一个页面从发布到出现在搜索索引里,通常要经过发现、抓取、解析、索引四个环节。很多“收录慢”或“不收录”的问题,其实只卡在链条中间某一步,而不是整站出了毛病。与其反复提交 URL、反复改标题,不如按顺序确认每一步的状态,把精力放在真正堵住的地方。
一、发现:蜘蛛得先知道这个 URL 存在
发现是整条链路的起点。如果你的页面没有任何入口指向它,蜘蛛连“有个新地址”都不知道,后面的环节就无从谈起。
- 站内链接:页面是否从首页或栏目页通过可点击的 a 标签链接到?只在 JS 里跳转、只在表单提交后到达的地址,发现概率会低很多。
- Sitemap:新页面有没有及时进入 sitemap?进了但地址写错、被规则屏蔽,也等于没提交。
- 外部引用:其他站点是否有链接指向它。外部链接不是必需的,但能加快发现速度。
- 日志核对:在服务器日志里搜一下这个 URL,看蜘蛛有没有来过。如果一次都没出现,问题就在发现环节。
二、抓取:知道地址,不代表马上会来
日志里能看到蜘蛛访问记录,说明发现已经完成。这时要看的就不是“有没有来”,而是“来了之后发生了什么”。
- 响应状态:返回的是 200,还是 301、302、403、5xx?非 200 的响应会直接影响后续处理。
- 抓取频次:小站抓取额度有限,页面又多,蜘蛛可能排在很后面。这时要优先保证重要页面在合理的内链深度内。
- 服务器表现:如果日志里出现大量超时或 5xx,先把服务器问题解决,再谈抓取节奏。
- robots.txt:确认没有被规则误屏蔽,包括路径写错导致的整段屏蔽。
三、解析:抓到了,也要能读懂
页面被抓取,不代表内容被正确理解。特别是依赖前端渲染的站点,这一环节最容易出问题。
- 渲染依赖:正文是否只有在执行 JS 后才出现。如果服务端返回的是空壳,蜘蛛看到的可能就是一片空白。
- canonical 与 noindex:页面上是否误写了指向别处的 canonical,或残留了 noindex 标签。这两类写法会直接改变页面的处理结果。
- 返回内容一致性:给蜘蛛返回的内容和给用户的是否一致。差异过大时,页面可能被判定为不可信。
四、索引:读懂了,还要判断值不值得留
前面三步都正常,页面仍可能停在索引之外。这时要考虑的是页面本身的价值判断,而不是技术故障。
- 内容单薄或重复:与站内其他页面高度相似,或信息量太少,容易只被当作备选。
- 页面类型:标签页、筛选页、分页、搜索结果页,本身就不适合大量进入索引,需要有取舍。
- 时效与更新:长期没有更新、也没有外部关注的页面,处理优先级自然靠后。
五、按环节定位,而不是一次性全改
排查时建议按下面的顺序走,每确认一步再往下,避免同时改十几个地方反而看不清原因。
- 日志里搜 URL,确认蜘蛛是否访问过;没有访问,先修发现路径。
- 有访问记录时,看返回状态和响应时间;异常先修服务器和规则。
- 状态正常时,检查页面渲染结果与 meta 指令;有问题先修输出。
- 以上都正常,再回到内容层面,判断这个页面是否真的值得被收录。
提交 URL、更新 sitemap 只是辅助手段,不能替代可用入口、正常响应和合格内容。把链条查清楚,再决定动哪一环,通常比反复提交更有效。