遇到页面不收录,很多人第一反应是提交 sitemap 或加外链。但在动手之前,更值得先确认一件事:搜索蜘蛛到底有没有来过这个 URL。如果蜘蛛从未访问,问题在 URL 发现;如果来过但没有收录,问题才可能落在抓取质量、页面质量或索引筛选上。两者混淆,后续操作容易做反。
日志里先看什么
服务器日志或 CDN 日志是核对 URL 发现入口的原始依据。至少关注几个字段:请求时间、User-agent、请求 URL、状态码、响应时间。先筛选出主流搜索蜘蛛的 UA,例如 Googlebot、Bingbot、Baiduspider 等,再看目标 URL 是否出现在记录中。
如果日志里只有 404、403、503,说明蜘蛛来过但没拿到正常内容;如果只有 301/302,说明它被引导到了别处;如果记录里压根没有这个 URL,才轮到“如何被发现”这个问题。
URL 发现的几个入口
搜索蜘蛛发现新 URL 的路径通常不止一条,常见的有:
- 站内链接:从已收录页面点到新页面,是最稳定也最可控的入口。
- sitemap:适合批量告知 URL,但提交不等于一定会抓取。
- 外部链接:其他站点的链接会带来发现机会,但质量和稳定性不可控。
- 主动推送或第三方服务:包括部分蜘蛛池、推送接口等,可能带来访问,但不保证最终收录。
- 历史抓取与重访:已抓取过的 URL 可能被再次访问,用于发现更新或新链接。
核对顺序建议从站内链接开始。一个页面如果在站内没有任何入口,只靠 sitemap 或推送,发现速度往往不稳定。
抓取和收录不是一回事
日志出现蜘蛛访问,只能说明“抓取”发生了,不能直接等同于“收录”。抓取之后,搜索引擎还要判断页面是否值得进入索引,可能因为内容重复、页面质量、canonical 指向、noindex 指令、返回状态异常等原因不收录或稍后移除。
日志是发现和抓取的证据,不是收录的保证。
所以排查时可以先问三个问题:蜘蛛有没有来过;来的时候拿到的是什么状态;拿到正常内容后,页面本身是否具备进入索引的条件。每一步对应不同的处理动作。
用日志核对入口的实操顺序
- 锁定目标 URL,在日志中按路径搜索,确认主流搜索蜘蛛是否访问过。
- 查看首次访问的日期、状态码和响应时间,判断是否抓到正常内容。
- 如果从未访问,检查站内链接是否可达、sitemap 是否包含、robots.txt 是否误屏蔽。
- 如果访问过但状态异常,先修复状态码和可访问性,再观察后续重访。
- 如果正常抓取但未收录,再核对 canonical、重复内容、页面质量与索引指令。
常见误区
- 只看 sitemap 提交记录,不看日志里有没有真实抓取。
- 把蜘蛛访问次数当成收录量,忽略索引筛选。
- 页面在站内没有入口,却指望推送或蜘蛛池解决发现。
- 日志里出现 404 就认为“被收录了错误页”,其实还要看索引状态。
把“发现—抓取—索引”分开看,收录问题会清晰很多。日志不能直接提升收录,但它能告诉你下一步该修哪一环。