站点上线一批新页面,日志里搜索蜘蛛却很少走进这些地址,索引状态长期停在“已发现,尚未抓取”,或者干脆没有出现。这时候不少人会先去调蜘蛛池、改抓取频次,但真正决定页面能不能被发现的,往往是从已有页面出发的链接路径。按下面的顺序核对,更容易找到卡住的位置。
先分清:是没被发现,还是被发现后没抓取
这两种情况的处理方向完全不同。打开索引状态查询,看目标 URL 当前的覆盖状态;再对照服务器日志,看蜘蛛是否访问过这个地址。
- 日志里完全没有记录、索引工具里也查不到,说明 URL 还没有进入发现队列,重点在内链和站点地图;
- 日志里有访问记录,但状态长期不更新,重点在抓取、渲染和页面本身的质量判断。
把这一步做在前头,可以避免在错误的方向上反复调整。
第一步:数一数从首页到目标页要几次点击
从首页出发,顺着页面上真正可点击的链接走到目标 URL,记录中间经过的次数。层级越深,蜘蛛走到这里的概率越低。
- 首页直达的栏目页、推荐位,通常最容易被发现;
- 三级以内、每层都有稳定入口的页面,一般在较短周期内能被抓到;
- 需要四五次点击、中间某一层链接还经常变动的页面,容易长期停留在未发现状态。
如果目标页确实处在很深的位置,优先考虑在相关栏目页或聚合页上补一条固定入口,而不是只依赖站点地图。
第二步:看内链是否真的通向它
页面上出现了链接文字,不代表蜘蛛能顺着走过去。逐项检查:
- 链接是否用可抓取的 a 标签和 href 书写,而不是点击事件或按钮;
- 链接上有没有被加上 nofollow;
- 所在区块是不是由 JS 延迟渲染,原始响应里根本没有这个链接;
- 链接是否被折叠、藏在标签页里,需要交互之后才出现。
另外注意单个页面上的链接数量。一个页面挂着几百条链接,真正有价值的入口会被稀释;反过来,只有页脚一条全站链接的页面,指向作用也比较弱。
入口要有相关性
内容相关的页面之间互相引用,比全站统一的页脚链接更有意义。同一主题的文章彼此引用、列表页里带位置的自然推荐,都是比较稳的入口形式。
第三步:新页面自己是否提供了可被发现的地址
有些页面本身没有任何对外链接,只在站点地图里出现过一次。站点地图能帮助发现,但它不是入口的替代品。需要核对:
- 站点地图里的 URL 与实际地址是否完全一致,包括协议、域名、尾斜杠和参数;
- 站点地图文件本身能否正常访问,有没有被 robots.txt 屏蔽;
- 新页面发布后,相关列表页和栏目页是否同步更新了链接。
第四步:确认没有其他因素挡住发现
- robots.txt 里是否误屏蔽了目录;
- 页面是否返回 3xx 或 4xx,链接存在但跟随失败;
- 整站入口是否只靠 JS 渲染,原始响应里几乎没有链接;
- 页面是否被其他规则临时下线。
常见的误区
把收录问题全部归结为蜘蛛池或抓取频次,改善往往有限。抓取频次只是结果的一部分,前提是 URL 已经进入可发现的路径,并且链接能被正常跟随。
另一个误区是短期反复提交同一个地址。重复提交不会加快索引,反而让日志里出现大量相同请求。真正需要做的是补齐入口、修好链接,然后留出观察周期。
核对顺序小结
- 用日志和索引状态分清是未发现还是未抓取;
- 从首页数点击深度;
- 检查内链是否可抓取、是否有 nofollow、是否依赖 JS;
- 检查站点地图地址与实际地址是否一致;
- 检查 robots.txt、状态码与渲染方式;
- 补齐相关页面入口,隔一段时间再看日志变化。
页面被收录的前提是被发现并且被抓取,而发现主要依靠链接。把入口理顺之后,再去看抓取频次和索引状态的变化,判断会清晰很多。