站点里常有一类页面:状态码正常、内容也写得完整,Sitemap 里列着,但搜索里几乎看不到它。排查时容易一头扎进“内容质量”,实际上更常见的原因是——除了 Sitemap,站内没有任何一条链接指向它。发现 URL 的路径断了一条,收录自然慢。
先把“发现路径”这个概念理清
搜索引擎发现一个 URL,通常有几条路:站内链接(导航、正文、列表、相关推荐)、Sitemap、外部链接,以及历史已知地址的重复抓取。其中站内链接的作用最大,因为它同时传递了“这个页面在站内处于什么位置”的信息。Sitemap 只解决“我知道有这条 URL”,不解决“它有多重要”。
当一条 URL 只靠 Sitemap 出现,它就成了孤岛:蜘蛛知道它存在,但没有上下文说明它和站内其他页面是什么关系。抓取队列里,这类 URL 往往排在后面。
孤岛 URL 常见的几种产生方式
- 批量生成的落地页,只写进 Sitemap,没有从栏目页链出去。
- 旧内容改版后被移出导航,却没有做跳转或保留入口。
- 由前端路由或 JS 渲染出的链接,爬虫拿不到 href。
- 链接挂在登录后、弹窗里或懒加载区块中,默认不可见。
- 分站、频道页之间没有互链,各管各的。
核对顺序:从内链开始,而不是从内容开始
- 先查站内是否有入口。用站内搜索或抓取工具跑一遍,看有没有页面链接到这个 URL。如果一条都没有,问题就在这里,不必先怀疑内容。
- 再看入口的可抓取性。有链接不等于能被发现:链接若是 JS 动态插入、被 nofollow 标记、要点击按钮才加载,效果会打折扣。核对时把“链接存在”和“链接可被抓取”分开确认。
- 确认 Sitemap 的一致性。URL 是否与页面真实地址完全一致(协议、尾斜杠、参数),返回状态是否为 200。Sitemap 里写了 404 或重定向地址,等于给了一条无效线索。
- 检查页面的独立价值。孤岛页面里有相当比例是内容相近的模板页或参数页。如果没有内链、内容又高度重复,即使被抓,也很可能停在“已抓取、未编入索引”。
- 最后看抓取日志。如果日志里从未出现该 URL,说明它还停在发现阶段;如果抓过但没收录,才需要转向质量与重复的排查。
先分清“没被发现”和“被发现但没收录”,这两类问题的处理方向完全不同。孤岛 URL 大多属于前者。
处理方式
最直接的办法是补内链:从相关栏目、正文或聚合页里自然链过去,让 URL 回到站内结构里。如果页面数量很大,不必全都补,先挑有价值的加链接,其余考虑合并或下线。
另外要控制批量生成的速度。一次性往 Sitemap 里加几千条无内链的 URL,抓取预算会被摊薄,老页面和重要页面反而受影响。
补链之后怎么验证
补上入口后,不要立刻期待收录状态变化。可以按顺序观察:站内抓取工具能否顺着新链接走到该 URL;服务器日志里是否出现该地址的抓取记录;再到搜索中确认是否进入索引。三步分开看,能判断是卡在发现、抓取还是入库环节。
小结
页面不收录时,把“发现路径”当作第一站排查项,往往比反复改内容更快找到原因。Sitemap 负责告知,内链负责背书,两者缺一,收录就容易卡住。