先分清:分页页被抓取,和进入索引是两件事
日志里频繁出现 /list/page/12 这类地址,只能说明搜索引擎在爬它。是否收进索引,取决于这个 URL 有没有独立价值。很多人一看到“分页被抓取”就紧张,其实抓取本身是正常的,它是爬虫顺着内链往下走、发现新内容的过程。真正需要判断的是:这批 URL 值不值得占一个索引位置。
第一步:给每个分页 URL 定角色
同样是分页,承担的任务差别很大。先按用途分组,再谈取舍:
- 导航型:用户要翻着看,第二、三页有明确的浏览需求,通常可以正常抓取。
- 深度翻页:第 20 页之后的列表,极少有人主动搜到,收录价值有限。
- 聚合型:按标签或条件组合生成的列表,可能和主分类页内容高度重合。
- 发现通道:新详情页往往是通过列表页的内链首次被发现的,这类路径不能掐断。
第二步:看点击深度,别把发现路径一起关掉
分页 URL 常常是深链入口。如果详情页只能从分页列表点进去,那么分页被屏蔽,等于把发现路径也一并关上了。
为什么不要用 robots.txt 一刀切屏蔽分页目录
robots 屏蔽的结果是“不再抓取”。爬虫看不到页面内容,也看不到页面上的链接,深层详情页就更难被发现。用 noindex 处理则不同:页面仍可被抓取,链接仍可被跟进,只是不进入索引。想收敛索引,优先考虑 noindex,而不是直接封路。
第三步:判断重复度,再决定留不留
如果分页页只展示标题加摘要,而详情页已经被收录,这些分页大多不提供额外信息,索引价值偏低。反过来,如果分页页里带了一段独特的汇总说明、价格区间或统计信息,它就不算纯重复,可以保留。
收敛方式的选择顺序
- 保留索引:前几页有真实浏览和检索需求,内容不重复,保持现状即可。
- 保留抓取 + noindex:深度翻页、条件组合页、纯列表页,最常见的选择。
- 谨慎使用 canonical:把后续分页指向第一页,会让各页独有的条目失去被抓取的意义,容易拖慢新内容的发现,只在内容确实重复时使用。
- 合并或收敛 URL:把筛选参数收进规范形式,减少同一列表派生出的多套地址。
- 最后才考虑 robots:只有在明确既不需要发现、也不需要索引时才用。
需要留意:加了 noindex 的页面依然会被抓取,量大的时候同样占用抓取预算。如果几千个分页都挂上 noindex,效果可能不如从源头减少可翻页的数量。
用日志核对:分页有没有吃掉抓取预算
- 统计日志里分页 URL 占总抓取的比例,如果超过一半就值得留意。
- 对比新发布页面的收录速度,明显变慢时,先怀疑深度分页在消耗预算。
- 检查“加载更多”:如果它不生成真实 URL,里面的内容就不会被单独发现;需要收录就给一个可访问地址。
调整节奏:小范围先试
不要一次性给整站分页加 noindex。可以先把最深的几层处理掉,观察一到两个抓取周期:新页面被发现的速度有没有变化、索引里多余的分页是否减少。方向确认后再逐步扩大范围,比一次性大改更容易回退,也更容易判断到底是哪一步起了作用。