站点的列表翻页(常见的 /page/2、?paged=3、list_2.html)被搜索索引收进去,是很多站点都会遇到的情况。它未必是坏事:有些翻页页确实有独立入口价值,也有些纯粹是重复内容的载体,占着抓取配额。难点在于两类页面没有明显的分界线,所以要先判断角色,再决定收口方式,而不是统一一刀切。
先给翻页页分个类
按页面的实际功能分成三类,处理方式会清楚很多:
- 系列内容分页:长文、连载、教程的第二三页,用户会顺着读下去,页面上有内容增量。
- 列表导航分页:文章列表、商品列表翻页,主要作用是发现新链接,页面之间差异有限。
- 筛选排序分页:带筛选参数或排序参数生成的组合,数量容易失控,重复度也往往偏高。
判断值不值得收录的几个角度
- 有没有搜索需求:如果用户会直接搜某类内容的第二页、第三页,保留收录通常更合理。
- 内容是否只是重复:翻页页如果只有标题列表变化,正文结构与第一页高度相似,价值有限。
- 抓取日志里的占比:翻页页吃掉大量抓取次数、挤占详情页,就要考虑收口。
- 被发现的新链接:如果详情页主要靠列表页被发现,收口时要保证内链通路不被切断。
常见收口方式与各自的副作用
canonical 指向第一页
适合翻页只是同一批内容另一种排列的情况。要注意第一页本身必须自指,不要出现整条链路都指向别处的循环。若某一页确实有独立价值,就不要把它并到第一页。
noindex, follow
适合不希望翻页页进入索引、但仍希望蜘蛛顺着链接爬到详情页的场景。写成 noindex, nofollow 会同时断掉链接发现,除非你另有替代入口。
限制翻页深度与链接暴露
比如只让前几页在站内可点,后面的页靠接口或按需加载。这种做法会让部分页面难以被抓到,取舍时要把用户能否到达和蜘蛛能否到达分开看。
一个容易忽略的冲突:同一批翻页页里,有的用 canonical 指向第一页,有的用 noindex,还有的两种都写。指令混用时搜索引擎会自行判断,最终结果往往与预期不一致。改之前先把现状列成表,比改之后反复猜要省事。
调整之后的核对顺序
- 抓取日志:看翻页页的抓取频次是否下降,详情页是否相应增加。
- 索引状态:抽查若干翻页 URL,确认是移出还是仍在,留意生效本身有延迟。
- 内链通路:确认深层详情页仍有可被抓到的入口,没有变成孤岛。
- sitemap 与 robots:提交的文件里不要再包含已经不打算收录的翻页地址,避免信号互相矛盾。
记录变更,别反复折腾
翻页收口很少一次到位。建议把改动时间、改动方式、当时的抓取与索引数据记在同一处,隔一段时间再看趋势。多次来回切换 canonical 与 noindex,反而会让这类页面在搜索引擎眼中的处理方式更不稳定。