先分清“多”的两种含义
核对索引量时,容易遇到两种不同的“多”。一种是索引里的 URL 数明显大于后台已发布的文章数,另一种是搜索结果条数看着比实际内容少。前者通常是形态差异造成的地址膨胀,后者多半是筛选、分页或展示层的问题。判断之前先定一个可信口径:后台已发布、可正常访问、且我们认可的规范地址有多少条,再拿索引里的 URL 去抽样对比,而不是只盯着总数曲线的涨跌。
多出来的地址一般来自这几处
- 大小写、结尾斜杠、默认首页等形态差异,各自被当成独立地址。
- 带参数的地址:排序、分页、追踪参数、会话参数。
- 附属输出:打印版、纯文本版、简化版页面。
- 附件与静态资源:图片、PDF、上传目录下的文件。
- 聚合页:标签页、作者页、日历页、专题合集页。
- 历史遗留路径:旧目录、旧站结构、测试路径仍然能打开。
- 站内搜索结果页被外部链接带出去,形成可被抓取的入口。
这些地址未必都是坏事。有些确实有独立搜索需求,有些则纯粹在消耗抓取资源。区别对待,比一刀切更稳。
按顺序核对,别一上来就删
- 抽样归类。从索引结果里取一批 URL,按目录和参数特征分组,看多出来的集中在哪几类,先找到主要来源。
- 确认可访问性。逐个看返回码,是 200 还是有跳转、有错误。返回 200 且带正文的,处理方式和空页完全不同。
- 查入口来源。这些地址是从内链、sitemap 还是外链被发现。如果站内到处链着它,改规范指向也没用,得先收口入口。
- 对齐规范信号。canonical、robots、sitemap 三处指向是否一致。三处打架时,多余的地址更容易被单独留下。
- 排优先级。有搜索需求、有外部链接的优先处理;没人访问、没入口的可以放到后面。
抓取与收录要分开看
地址被大量抓取,不等于它们会被大量收录。反过来说,索引里留着一条记录,也不代表它还在被频繁抓取。核对时把这两件事分开:抓取看的是日志里的请求,收录看的是索引里的记录。如果日志里参数页请求占比很高,先收口参数入口;如果日志干净但索引里仍有残留,重点就放在规范指向和移除处理上。
处理顺序:先合并,再收口,最后移除
对确认属于同一内容的多个形态地址,第一步是让它们指向同一个规范地址,并保证站内链接、sitemap 都只输出这一个版本。第二步是把产生多余地址的入口关掉:参数入口、站内搜索页的外部传播、附件目录的公开访问。第三步才是对确实不需要保留的地址做移除申请。
顺序颠倒会带来反复。常见的情况是只提交了移除,但站内还在大量链接旧地址,过一段时间又被重新发现,问题回到原点。
不要为了“干净”一次性对成千上万条 URL 做跳转或移除。改动量太大时,观察窗口里的波动会盖住真实信号,也容易误伤正常页面。分批做,每批留出两到四周观察。
观察什么才算有效
- 抽样批次里的多余地址,返回码和规范指向是否已经统一。
- 日志中参数页、附件页的请求占比是否下降。
- 重点正文页的抓取频次是否回升,而不是总抓取量下降就算成功。
- 索引总量缓慢回落属于正常,短时间内大幅波动要回头看是否有误伤。
整体思路是:先把多余的地址归到少数几类,再一类一类处理。每一类都按“统一规范指向、收口入口、必要时移除”的顺序走,比盯着总数追涨杀跌有效得多。索引数字本身只是结果,真正要管的是站内到底放出了多少个可被抓取的入口。