很多站点排查收录问题时,只盯着收录了多少条,却忽略了另一个更基础的数字:站点一共有多少个可以被访问到的 URL。当这个数字远超真实页面数量时,抓取资源会被消耗在重复、无效或低价值的地址上,真实页面的发现和更新自然变慢。
先把两个数字摆在一起
真实页面数,指的是站点里确实有独立价值的页面,比如商品详情、文章正文、活动页。URL 总量则来自访问日志、抽样统计、sitemap 条数和站点地图里的路由数量。两者差距越大,说明被浪费的地址越多。可以先各取一份样本:从日志里按目录归类,看哪些路径抓取量大、返回 200 的比例高,但内容几乎一模一样。
URL 膨胀的常见来源
- 参数组合:排序、筛选、每页数量、来源标记这类参数互相叠加,很容易生成成千上万个地址,内容却只有几种。
- 空结果页:筛选到没有结果时仍然返回 200 页面,这类地址数量往往比有效结果页还多。
- 站内搜索:用户搜过的词会变成一条 URL,如果允许被抓取,增长几乎没有上限。
- 自动生成的归档:日历页、标签页、作者页、地点页,模板相同、内容稀薄。
- 分页与滚动:翻页地址一直翻到没有内容还在输出。
- 会话与追踪参数:会话 ID、推广参数被当成了不同页面。
- 同一地址的多种写法:协议、www、大小写、末尾斜杠、默认端口的差异。
为什么这会拖慢收录
搜索引擎对每个站点投入的抓取量是有限的。当大量 URL 指向近似内容,抓取时间会花在重复访问上,新页面和更新页面的抓取频次就被压缩。同时,站点整体的内容质量判断也可能被稀释:大量空结果页、模板页会让质量分布偏向低位。这里要分清一件事:页面被频繁抓取,不等于会被收录。抓取只解决拿到内容,收录还取决于内容是否有独立价值、地址是否符合规范。
处理顺序:先止损,再收敛
- 量化。用日志按目录统计抓取量、状态码分布和内容相似度,找出最浪费资源的几类路径,而不是全站一起改。
- 切断发现路径。先让这些地址不再被内链、sitemap、列表页指向,这一步成本最低,效果通常也最直接。
- 统一规范写法。确定唯一的协议、域名形态、大小写和斜杠规则,其余写法做 301 到规范地址。
- 再决定索引处理。确认为无效的用 404 或 410,需要保留但不希望被索引的用 noindex,纯粹不希望被抓取的才用 robots.txt。
- 保留该保留的。部分参数页有真实搜索需求,可以用 canonical 指向主版本,或固定参数顺序、限制可抓取的参数组合。
判断一个 URL 值不值得留
可以问三个问题:有没有用户会直接搜到它、它的内容是否与主版本明显不同、它是否能带来独立价值。三个都是否,就属于可收敛的对象;有一个是,就值得保留,并把它做成规范版本。
收敛 URL 的目的不是让收录数字变好看,而是让有限的抓取资源集中在真正需要被索引的页面上。数量下降而有效页面的抓取变多,是正常且值得的结果。
小结
收录问题经常被当成内容问题,但它也可能只是地址问题。把 URL 总量控制在接近真实页面数的水平,再谈页面质量和内容更新,排查效率会高很多。这个过程不会立刻反映在收录数量上,需要持续观察日志和索引覆盖的变化,按目录分批验证。