很多人盯着索引覆盖报表里的“已发现但未抓取”,其实在抓取之前还有更前面的一步:蜘蛛根本不知道这个 URL 存在。站点地图提交只解决“告知”这一件事,真正决定长期发现效率的,往往是站内链接能不能把新页面接到已有的链路上。
蜘蛛是怎么知道一个 URL 的
- XML 站点地图提交后被读取的时间和频率,并不完全由我们控制;
- 已有页面正文里的站内链接,是会被反复重新走过的入口;
- 外部链接、社交分享能带来额外线索,但不可控;
- 历史重定向、旧版栏目页、废弃的 RSS,也可能留下一些痕迹。
其中最能自己掌握的是第二条。它不需要等谁批准,改一次模板或加几处正文链接就能生效。
常见的“孤岛”情况
- 新页面只在后台生成,没有任何站内链接指向它;
- 只能从首页导航点进去,再往下就没有下一层入口;
- 只出现在“最新内容”模块里几天,掉出列表后就断了被发现的路;
- 链接写在脚本里、点了才加载,或者被 nofollow 遮住;
- 列表页只放出第一页,后面的内容没有可抓取的分页入口。
几个实用做法
- 在内容相关的老页面里,用自然语言加一到两处链接,位置比数量更重要;
- 建专题页或聚合页,把同类内容集中挂在一个可抓取的列表里;
- 面包屑和栏目导航保持一致,别让同一层级的页面散落在不同路径下;
- 分页列表保留可抓取的 a 标签,不要用无限滚动完全替代翻页;
- 站点地图只放需要被发现的规范 URL,不用频繁重提交,保持最后修改时间准确即可。
内链的首要作用不是传递权重,而是让蜘蛛有一条稳定、可以重复走的路径。
怎么判断有没有起作用
翻服务器日志,看新 URL 第一次被抓的时间、抓取请求带来的来源页,比盯着收录数字更直接。如果两三周内外部入口都来过,而站内路径一次都没出现,多半是链接没被渲染出来或者没被跟到。也可以看索引覆盖报表里的“已发现但未抓取”,数量长期堆积时,优先补内链,而不是反复提交站点地图。
几个容易忽略的点
- 内链全部指向首页和少数几个热门页,长尾页面依然没有入口;
- 为了让权重“集中”而把内链做成 nofollow,反而断掉了发现路径;
- 改版后旧链接直接 404 且没有 301,历史入口一次性全部失效;
- 页面数量上千而入口只有导航,被抓的永远是那几十个。
理顺内链不等于收录,更不等于排名,但它决定了页面有没有机会被看到。先把入口这件事做扎实,再去看抓取频次和索引状态,很多问题的定位会清楚很多。