发现收录数量不对,很多人的第一反应是打开几个页面逐条检查。但如果问题出在站点层面,逐个页面改基本是白费力气。更省事的办法是先确定异常范围:是整站都受影响,还是集中在某个目录,或者只是个别页面。
为什么先分层比先改页面更重要
收录是抓取、索引、展示三件事叠加的结果,任何一个环节出问题,表现都可能相似。范围不同,原因通常也不同:站点级问题多和 robots、服务器响应、站点地图、整体质量有关;目录级问题常和内链结构、模板、参数有关;单页问题则更多是内容或状态码本身。先分范围,可以少走很多弯路。
三个层级各自的判断信号
站点级
- 索引量在较短时间内整体下滑或整体停滞,不分目录。
- 抓取统计里各类页面的抓取次数同时下降。
- robots.txt、服务器返回状态、CDN 规则近期有改动。
目录级
- 某个频道的 URL 大量停在“已发现,尚未抓取”。
- 同一模板下的页面索引率明显低于其他频道。
- 该目录缺少从首页或上级栏目进入的稳定链接。
页面级
- 同目录其他页面正常,只有少数 URL 有异常。
- 页面本身的状态码、canonical、meta robots 与预期不符。
- 内容与已有页面高度接近,可能被判定为重复。
定位顺序:从大到小,逐层排除
- 先看整体索引量与抓取趋势,确认是不是站级波动。
- 如果整体正常,再按目录或模板分组,对比索引率。
- 找出异常目录后,抽 10 到 20 条 URL 逐条核对状态码和标签。
- 最后才回到单页,判断是内容问题还是技术问题。
这个顺序的好处是,每一层都能缩小下一层的范围,而不是把整站当成嫌疑对象。
每层要看的几项数据
- 站点级:索引总量趋势、抓取请求总量、robots 与站点地图状态。
- 目录级:目录页数、被索引数、内链入口数量、模板是否统一。
- 页面级:状态码、canonical、meta robots、正文与标题是否完整。
数据不用多,关键是对得上。如果索引报表显示这个目录有几千条页面,但站点地图和内链加起来只有几百条,那问题很可能出在 URL 生成或入口上,而不是内容质量。
容易误判的两种情况
- 把数据延迟当成收录问题:报表本身有更新滞后,几天的波动先观察再动手。
- 把小样本当整体:抽查几页就下结论,容易把个别模板缺陷放大成站级判断。
把“收录不好”换成“哪个范围内的收录不好”,后面的判断会清晰很多。
处理动作按层级排优先级
- 站级问题优先处理,因为它会同时影响所有目录。
- 目录级问题通常靠补内链、统一模板、收敛无效参数来解决。
- 页面级问题逐个处理,但要先确认不是模板导致的批量现象。
顺序反了,容易出现改了很多页面、整体数据却没变化的情况。建议把定位过程记录下来:哪天发现异常、范围属于哪一层、做了什么改动、之后数据怎么变。积累几次之后,同类问题的判断会快很多。