列表页、归档页、标签页,只要内容足够多,就一定会出现分页。分页本身不是问题,问题在于写法不统一时,蜘蛛容易在同一个列表里反复绕圈:一会儿抓到 ?page=2,一会儿抓到 /list/2/,中间还夹着空页和越界页。这类情况通常不会立刻表现出来,但积累下来会持续消耗抓取资源,也让真正的内容页排不上队。
分页为什么值得单独自查
分页页面的数量往往远大于正文页。一个只有三百篇内容的站点,如果栏目、标签、作者页各有一套分页,再叠加筛选条件,分页 URL 很容易上千。这些页面的标题、描述高度雷同,正文区基本是链接列表,属于典型的结构重复、内容稀薄页面。当它们还能互相组合出大量排列时,就等于给蜘蛛开了一片没有边际的草地。
几种常见的问题形态
同一份列表出现多个地址
带参数的 page=1 和不带参数的列表首页内容完全一样;翻页用 /page/2/,但页脚又输出了 ?paged=2 的旧链接。搜索引擎会把它们当作不同 URL 分别抓取,权重和抓取配额都被摊薄。自查时最直接的办法是在浏览器里点一遍翻页,看地址栏的变化是否始终一致。
空分页与越界分页
最后一页之后还能继续翻,或者把参数随手改成 page=999,页面依然返回 200 和一片空白。这种页面既没有内容,又容易在日志里被反复请求。比较稳妥的做法是让越界请求返回 404,或跳回列表第一页,而不是稳定地返回一个空壳。
无限滚动与“加载更多”
纯 JS 加载的分页,蜘蛛可能只看到第一屏。如果站点主要靠无限滚动展示内容,最好同时保留一套可点击、可抓取的分页链接,或者提供“查看全部”的静态入口。内容能不能被发现,比交互是否顺滑更优先。
“查看全部”页面
把二十页内容合成一个长列表,对用户和抓取都友好,但要注意别让它和分页页同时完全开放,否则同一批链接会出现两套入口。选一套作为主入口,另一套做适当收敛即可。
一份可执行的自查清单
- 翻页地址是否只有一种形态,参数与静态路径不要混用。
- page=1 是否与列表首页重复,能否统一到同一个地址。
- 分页页的标题是否带上页码或范围,避免与列表首页完全相同。
- 越界页码是否返回 404 或重定向,而不是 200 空页。
- 翻页按钮是否为可点击的超链接,而不是 onclick 或纯按钮。
- 无限滚动是否有对应的静态分页兜底。
- 分页页的 canonical 是否指向自身,而不是一律指向列表首页。
- 是否有分页被误加 noindex,导致列表深处的页面失去入口。
- 标签、作者、归档页的分页是否纳入同一套规则。
- 日志里分页 URL 的请求占比是否异常偏高。
处理时的几个取舍
- 页码别写进标题堆废话。第 2 页写“第 2 页”可以,写成一大串关键词堆叠就没有必要。
- 不要一刀切 noindex。分页页本身不适合做落地页,但它是发现内容的重要通道,全部屏蔽等于把入口关掉。
- 别指望 rel=next/prev。主流搜索引擎已不再把它当作索引信号,重点还是放在链接可抓取、地址统一这两件事上。
- 优先处理被抓得最多的分页。先看日志里请求量最高的那几条分页 URL,改动收益最直接。
- 改完观察一段时间。分页调整通常不会立刻反映在抓取数据上,按周对比更有意义。
分页的目标不是让每个页码都被收录,而是让用户和蜘蛛都能顺着列表走到真正的内容页。把地址和链接做稳,比追求短期更管用。