先把“发现”和“收录”分开看
列表页、分页页、筛选页最容易被混淆的一点是:它们的价值更多在于让爬虫顺着链接走到详情页,而不是自己成为搜索结果。把这两件事分开之后,判断就简单很多——一个分页 URL 哪怕不进入索引,只要爬虫会来、会跟着链接继续往下走,它的任务就已经完成了。
反过来,如果你把所有翻页都当成收录目标去追,往往会得到一大堆内容高度相似、彼此抢位置的页面,既占用抓取资源,也让索引变得臃肿。
判断一个列表页该不该进索引
可以按下面三个问题依次过一遍,多数页面在第二步就能有结论。
- 它有没有独立的搜索需求?如果用户会直接搜“某类文章列表”“某某排行榜”这类词,说明这个页面本身有被检索的价值,可以考虑保留在索引里。
- 它的主体内容和别的页面重不重复?page/2、page/3 这类翻页,通常只是把同一批内容切块,正文高度相似,独立价值很低。
- 它有没有稳定的入口和唯一的 URL?排序参数、会话参数拼出来的组合页,往往一个内容对应几百个 URL。这种先收敛入口,再谈收录,顺序不能倒。
常见的几类页面,处理方式不一样
第一页与后续翻页
很多站点把第一页当作栏目主入口,那么第一页保留在索引里是合理的;page/2 及之后的翻页,如果只是同一批内容的延续,一般不需要单独进索引,但要保证爬虫仍然能从第一页顺着点下去。
关键是别用 noindex 把整条链断掉。被 noindex 的页面上的链接仍然可以被跟踪,但如果整站大面积这么做,发现效率会明显下降。稳妥的做法是保留可抓取、可顺着翻页前进的路径,只控制是否进入索引。
筛选、排序产生的组合页
颜色、价格、排序方式这些参数组合起来,数量是指数级的。常见处理是:保留一两个确实有搜索量的筛选组合,其余通过 URL 规范或 robots 规则挡在发现入口之外。判断标准不是“参数多不多”,而是“这组条件下有没有人真的会搜”。
标签页与聚合页
标签页的特点是数量多、每页内容少、彼此交叉严重。如果站内已经有对应的栏目页和详情页,这些标签页往往只是重复入口。可以先看它们是否带来过自然搜索点击,长期没有曝光的,考虑合并进栏目页或逐步收敛。
怎么确认自己判断得对不对
- 用 site: 查询看看这类 URL 实际被收录了多少,和你的预期差多少。
- 翻服务器日志,看分页 URL 的抓取频次是否正常——如果翻页几乎不被抓,说明入口或链接有问题,而不是“搜索引擎不喜欢”。
- 看索引覆盖报告里“已发现,尚未收录”的 URL,其中分页和筛选页占比偏高,通常说明可抓取的低价值 URL 太多。
判断顺序建议固定在:先确认有没有搜索需求,再看内容是否重复,最后才决定是保留索引还是只留作抓取通道。反过来的顺序容易一刀切,把本来有需求的页面也一起关掉了。
调整之后要观察什么
收敛一批分页或筛选页之后,重点不是看收录总数有没有下降,而是看两件事:详情页的抓取频次有没有变化,以及这些列表页原本带来的搜索点击有没有转移到栏目页上。如果详情页抓取更顺畅、栏目页接住了流量,说明这次收敛是有效的;如果详情页反而变慢,通常要回头检查入口链接是否被一起砍掉了。