入口页的作用是把 URL 送到搜索蜘蛛面前。但很多运营者会遇到一个困惑:日志里明明看到蜘蛛抓了目标页,过一段时间去查,目标页还是没进索引。这时候继续加入口页、加链接,通常不会有变化,因为问题多半不在入口页,而在目标页自身或者抓取之后的几个环节。
先把“发现、抓取、收录”三件事拆开
- 发现:蜘蛛在入口页里读到目标页 URL,进入待抓取队列。
- 抓取:蜘蛛真正请求了目标页,服务器日志会留下记录。
- 收录:搜索引擎判断这个页面值得进索引,并能出现在结果里。
入口页最多只能推动前两步。第三步由目标页和整站状态决定,入口页再怎么加也没法替代。把这三件事分清之后,排查才有方向。
抓取已经发生但收录没发生:常见的几类卡点
1. 抓到的不是最终内容
如果目标页正文由 JavaScript 渲染,蜘蛛第一次抓到的可能是空壳。它会不会再走一次渲染,取决于页面重要性和渲染资源是否可用。判断方法:用抓取工具模拟不带 JS 的请求,看看返回的 HTML 里有没有正文和链接。如果关键内容只存在于 JS 里,考虑做服务端渲染或预渲染,至少保证首屏有可读内容。
2. 页面返回状态不干净
软 404 是常见问题:HTTP 状态码是 200,但页面写的是“该内容不存在”“已下架”。这类页面一般不会进索引。同样,内容极薄、大量模板重复、正文被折叠到需要交互才展开,都会让页面在索引环节被放弃。
3. 规范标签指向别的 URL
如果目标页的 canonical 指向了另一个页面,搜索引擎会把这个 URL 的内容归到那个页面上,它自己就不进索引。带参数、存在多份副本的 URL 尤其容易踩这个坑。检查时把目标页自身的 canonical、站点地图里的写法和站内链接指向的版本对照一遍,看是不是同一个地址。
4. 被 robots 规则或 meta 拦在索引之外
Disallow 影响抓取,noindex 影响收录,两者拦的阶段不一样。还有一种情况是服务端根据 UA 返回不同内容,蜘蛛拿到的版本带着 noindex,而你自己在浏览器里看不到。这种情况要按蜘蛛 UA 去请求一次才能发现。
5. 页面本身缺少值得收录的信号
没有站内入口、没有外部引用、内容和其他页面高度相似、主题和整站关系不大,这些都会让页面停留在“抓过但不收录”的状态。这不算技术故障,靠加入口页也解决不了。
建议的排查顺序
- 先在日志里确认蜘蛛确实抓过目标页,拿到抓取时间和返回状态码。
- 用不带 JS 的方式请求目标页,看返回的 HTML 里有没有正文和有效链接。
- 检查 HTTP 状态码、canonical、meta robots、X-Robots-Tag 是否互相一致。
- 看目标页内容是否和站内其他页面高度重复,是否有独立价值。
- 确认目标页有正常的站内入口,而不是只靠蜘蛛池入口页导过去。
- 以上都正常时,可以通过站点地图或提交接口把这个 URL 再提交一次,缩短重新判断的等待时间,但不要期待立刻有结果。
入口页能做什么、不能做什么
入口页擅长的是扩大 URL 的暴露面,让更多地址进入待抓取队列。它不擅长的是改变搜索引擎对目标页的价值判断。把入口页数量翻倍,往往不如把目标页的问题先修干净。
如果日志显示蜘蛛持续抓取目标页但长期不收录,优先怀疑目标页本身,而不是继续增加入口页规模。
几个容易忽略的细节
- 目标页在入口页里的锚文本和周围文字,会影响蜘蛛对该页主题的初步判断,但不会决定它收不收录。
- 同一目标页在多个入口页重复出现,边际收益递减,还会占用抓取额度。
- 目标页如果是站外域名,入口页能帮上的只是发现,收录判断由那个站点自身的状态决定。
- 抓取频率和收录速度不是线性关系,抓得多不代表收录得快。
入口页解决的是“蜘蛛知不知道这个 URL”,收录解决的是“这个 URL 值不值得进索引”。看到抓取却没收录时,把注意力从入口页挪到目标页,按上面的顺序逐项排除,通常比继续加链接更有效。