分页是最容易被忽略的抓取入口
有列表就有分页。分页链接通常由模板或插件自动生成,做完上线就没人再回头看。但列表页的数量往往远超正文页:一个五百篇文章的栏目,按十篇一页就是五十个地址;如果每页还带排序、时间、分类参数,地址数量会成倍膨胀。这些页面本身价值不高,却会持续占用抓取资源,也容易让新内容被发现的时间被推迟。因此分页值得像别的运营项一样,定期拿出来过一遍。
先把站点里的分页形式分清楚
传统页码翻页
页脚一串“1 2 3 … 下一页”,每个页码都是独立可访问的地址。这种形式最容易被抓取,也最容易出问题:如果模板把页码一直延伸到几百页,或者最后一页之后还能继续翻,就会出现大量空列表页。
滚动加载与“加载更多”
内容靠 JavaScript 追加,地址栏不变。访客体验不错,但后续内容没有独立地址,搜索引擎很难发现,也没法单独引用某一页。至少应该提供一个可访问的翻页入口作为兜底。
参数拼接的分页
形如 ?page=2&orderby=date&cat=5 的组合。参数越多,可组合出的地址越多,重复内容的风险也越高。需要确认哪些参数会影响列表内容,哪些只是排序或展示偏好。
逐项自查清单
- 打开任意一个列表页,查看分页链接是否指向真实可访问的地址,而不是 href="#" 或 JavaScript 空链接。
- 翻到列表末尾,确认不会继续生成空白页;如果存在,检查是否返回了合适的状态码,而不是空页面配 200。
- 检查分页地址是否都被收录或提交。通常只需要保留第一页作为代表,后续页允许抓取即可,不必强求索引。
- 确认分页页面上的 canonical 指向自身,而不是统一指回列表第一页,否则后续页的内容可能被忽略。
- 如果采用滚动加载,用无脚本方式打开页面,看能不能找到进入后续内容的入口。
- 检查排序、筛选、视图切换参数是否会被拼进分页链接,造成同一列表的多套地址。
- 观察日志中列表页的抓取频次,如果某个翻页系列被抓得异常频繁,多半是链接结构有问题。
处理时的几个原则
让每一页都有稳定地址。即便是滚动加载的站点,也应保留一个简单的翻页入口,方便访客分享、也方便搜索引擎顺着走。
控制翻页深度。运营上可以接受“最后一页没人点”,但不要让抓取程序在空页之间来回。给列表设一个合理的上限,超出部分通过归档或分类入口承接。
避免整页标题雷同。分页页面的标题至少带上页码或内容范围,别让几十个页面共用同一句话。
还有一点容易被忽略:分页本身不是内容。如果站点长期靠翻页列表撑页面数量,而正文更新很少,那么再规范的翻页结构也换不来价值。分页是通道,不是目的地。
建议每季度挑一个内容量最大的栏目,从第一页翻到最后一页手动走一遍。很多分页问题人工点一遍就能发现,不必等日志报表。