很多站点讨论收录,习惯把“收录量”当成一个单独的数字来盯:涨了就高兴,跌了就排查。但搜索引擎的索引并不是站内目录的镜像,它是一个筛过一轮的结果集。同一批 URL 里,有些页面天生就该进索引,有些页面进不进其实无所谓,还有一些进了反而会摊薄整站的信号密度。与其等收录结果出来之后再补救,不如在 URL 设计阶段就先分一次档。
分档不是内部标签,它决定的是抓取与索引的动作
分档听起来像管理动作,但它最后一定落在技术处理上:这条 URL 要不要写进 sitemap,内链要不要指向它,canonical 指向自己还是指向别人,robots 要不要放开,出现重复时以哪一条为准。这些问题如果没在分档时说清楚,就会出现同一个页面在不同入口收到互相矛盾的信号。
判断一个页面值不值得被收录,先问三个问题
它有没有独立的信息价值
把页面的主体内容抽出来,去掉导航、推荐位、页脚和模板文案,剩下的部分是不是只在讲这一件事。如果剩下的内容和另一条 URL 高度接近,只是排序、筛选条件或渠道参数不同,那它更像是同一条内容的另一个入口,而不是一条新页面。
它能不能离开别的页面单独成立
结算页、登录后的个人中心、提交成功页、搜索参数组合页,这些页面通常需要有前置操作才能进入,或者只在特定会话里才有意义。它们对用户是必要的,但对外部检索来说缺少稳定的语境,让它们进入索引对谁都没有太大帮助。
它被搜到的场景是否真实存在
不要用“万一有人搜呢”来支撑一条 URL 进索引。更实际的做法是看这条页面解决的是不是一个明确的查找意图:有人会用什么词去找它,找到之后页面能不能直接给出答案。如果答案分布在另外几条页面上,这条页面更适合做入口或聚合,而不是索引目标。
常见的分档误判
- 把聚合页和详情页混为一谈:聚合页的价值在于组织入口,详情页的价值在于承载具体信息,两者的收录策略没必要一致。
- 认为参数越多越“丰富”:同一内容配上不同的筛选、排序、追踪参数,很容易变成近似重复的一大片。
- 靠 noindex 处理本该合并的页面:如果两条 URL 讲的是同一件事,优先考虑合并或规范,而不是一条留一条挡。
- 只按 PV 分档:浏览量低的页面不代表没有检索价值,反过来浏览量高的页面也可能是登录后才看得到的流程页。
分档之后,动作要落到 URL 上
- 核心页:canonical 自指,进入 sitemap,内链从相关页面自然指向,保持可抓取、可索引。
- 入口与聚合页:明确它是对内导航还是对外检索入口。对内为主的可考虑不进 sitemap,但也不必刻意屏蔽。
- 近似重复页:先判断能不能归并到主 URL,能归并就归并,不能归并再用 canonical 指向主版本。
- 功能页与流程页:优先从站内可抓取范围收口,减少爬虫在无检索价值路径上的消耗。
- 已被索引的历史遗留页:先看它是否还有外部引用和真实访问,再决定是继续保留、合并,还是让它自然退出。
分档需要定期复查,而不是一次定终身
站点的页面类型会变,业务重点也会变。今天放在“留在站内就好”那一档的页面,可能因为内容积累变成了有价值的详情页;反过来,一些曾经的核心页也可能在改版后只剩下模板骨架。建议按季度抽一批 URL 做抽查:内容是否还完整、页面是否还能独立成立、收到的信号是否一致。分档的目的不是把收录量压到一个数字,而是让每一次抓取和索引决策都有明确的理由。
收录不是越多越好,也不是越少越安全。真正需要盯的是:进入索引的那一批页面,是不是站点希望别人看到的那一批。