分类列表页、标签聚合页、站内搜索结果页、筛选参数页——这类页面在数量上往往远超正文页。它们承担着站内链接通道的作用,蜘蛛大部分时间也花在这些页面上。但它们到底该不该进索引,很多站点没有明确答案,结果就是索引里堆了一大批低价值地址。
先把抓取和收录拆开看
蜘蛛抓取一个页面,目的是发现里面的链接、了解站点结构;而收录进索引,意味着这个地址有机会作为一个独立结果被展示。两件事的目标不同,所以一个页面完全可以是「值得抓,但不值得收录」。
列表页对抓取很有价值:新发布的文章靠它被蜘蛛发现,站点层级也靠它串起来。但如果用户搜某个词时,这个列表页给不出比正文页更有用的信息,把它放进索引只会稀释站点整体质量。
常见的几类页面怎么归类
通常建议保留在索引里
- 稳定的栏目页、分类页:主题明确,由编辑维护,长期存在。
- 人工筛选的专题聚合页:数量有限,每页有独立主题和说明文字。
- 分页的第一页,也就是列表主入口,通常就是分类页本身。
通常不建议收录,但可以放行抓取
- 站内搜索结果页:内容随查询变化,重复度高,还可能被外部批量构造地址。
- 纯排序、筛选参数页:同一批内容换顺序,主副本已经存在。
- 自动生成的标签页:只有几个标题堆在一起,缺乏可读内容。
- 分页的第二页之后:作为爬取通道保留,不必单独进索引。
判断一个页面值不值得收录
拿不准的时候,可以按下面几个问题过一遍:
- 能不能用一句话说清这页的主题?说不清的大概率不需要收录。
- 用户会不会拿这个主题去搜?如果对应的需求已经有正文页承接,就没必要再放一个列表页进来。
- 它和站内另一个页面有多少内容重复?重复比例高时,让其中一个作主副本。
- 去掉这个页面,站内链接会不会断?会断说明它需要保留可抓取,而不是被屏蔽。
- 内容会随时间大幅变化吗?搜索结果页、促销聚合页属于这一类。
几种处理方式和容易踩的坑
不希望页面进索引,最直接的是在页面上加 noindex。要注意两点:一是 noindex 需要蜘蛛能抓到页面才生效;二是如果页面本身有外部链接指向,被索引的概率会更高,处理要更主动一些。如果想让蜘蛛继续顺着页面里的链接走,可以配合 follow,让链接通道保留下来。
用 robots.txt 直接屏蔽则要谨慎:屏蔽之后蜘蛛看不到页面上的 noindex 指令,如果这个地址被外站大量引用,它仍可能以缺少描述的形式留在索引里。屏蔽同时也会切断页面内部的链接通道,影响新页面的发现速度。
分页处理上,比较常见的做法是主入口正常收录,后续分页保持可抓取,不额外追求收录。canonical 指向自身即可,不要为了省事把所有分页都指向第一页,那会让蜘蛛误判内容归属。
判断标准可以简化成一句:对用户有独立价值、内容稳定的页面进索引;只服务于爬取和跳转的页面,放行抓取但不追求收录。
调整之后的自查顺序
- 用 site: 指令看这类地址还在不在索引里,粗略掌握规模。
- 查服务器日志,确认列表页仍被正常抓取,链接通道没有断。
- 看被改动的页面是否还在承接流量,避免误伤原本有展示的聚合页。
- 观察一批正文页的发现速度,确认抓取通道没有被削弱。
- 过几周再复盘一次索引数量与展示数据的变化。
列表页和聚合页的处理没有统一答案,关键是别把它们当成顺手一起收录的副产品。先明确每个页面在站点里扮演什么角色,再决定它是抓取通道还是索引里的一个结果,后续调整会清晰很多。