网站收录

只在 Sitemap 里出现的页面:孤岛 URL 的发现路径与收录核对

有些页面状态正常、内容完整,Sitemap 里也列着,却迟迟不收录。问题常常不在内容,而在站内没有任何链接指向它。本文把发现路径拆成内链、Sitemap、外链几条线,给出从入口检查到抓取日志的核对顺序,帮助判断是卡在发现、抓取还是入库环节。

网站收录

只在 Sitemap 里出现的页面:孤岛 URL 的发现路径与收录核对

站点里常有一类页面:状态码正常、内容也写得完整,Sitemap 里列着,但搜索里几乎看不到它。排查时容易一头扎进“内容质量”,实际上更常见的原因是——除了 Sitemap,站内没有任何一条链接指向它。发现 URL 的路径断了一条,收录自然慢。

先把“发现路径”这个概念理清

搜索引擎发现一个 URL,通常有几条路:站内链接(导航、正文、列表、相关推荐)、Sitemap、外部链接,以及历史已知地址的重复抓取。其中站内链接的作用最大,因为它同时传递了“这个页面在站内处于什么位置”的信息。Sitemap 只解决“我知道有这条 URL”,不解决“它有多重要”。

当一条 URL 只靠 Sitemap 出现,它就成了孤岛:蜘蛛知道它存在,但没有上下文说明它和站内其他页面是什么关系。抓取队列里,这类 URL 往往排在后面。

孤岛 URL 常见的几种产生方式

  • 批量生成的落地页,只写进 Sitemap,没有从栏目页链出去。
  • 旧内容改版后被移出导航,却没有做跳转或保留入口。
  • 由前端路由或 JS 渲染出的链接,爬虫拿不到 href。
  • 链接挂在登录后、弹窗里或懒加载区块中,默认不可见。
  • 分站、频道页之间没有互链,各管各的。

核对顺序:从内链开始,而不是从内容开始

  1. 先查站内是否有入口。用站内搜索或抓取工具跑一遍,看有没有页面链接到这个 URL。如果一条都没有,问题就在这里,不必先怀疑内容。
  2. 再看入口的可抓取性。有链接不等于能被发现:链接若是 JS 动态插入、被 nofollow 标记、要点击按钮才加载,效果会打折扣。核对时把“链接存在”和“链接可被抓取”分开确认。
  3. 确认 Sitemap 的一致性。URL 是否与页面真实地址完全一致(协议、尾斜杠、参数),返回状态是否为 200。Sitemap 里写了 404 或重定向地址,等于给了一条无效线索。
  4. 检查页面的独立价值。孤岛页面里有相当比例是内容相近的模板页或参数页。如果没有内链、内容又高度重复,即使被抓,也很可能停在“已抓取、未编入索引”。
  5. 最后看抓取日志。如果日志里从未出现该 URL,说明它还停在发现阶段;如果抓过但没收录,才需要转向质量与重复的排查。
先分清“没被发现”和“被发现但没收录”,这两类问题的处理方向完全不同。孤岛 URL 大多属于前者。

处理方式

最直接的办法是补内链:从相关栏目、正文或聚合页里自然链过去,让 URL 回到站内结构里。如果页面数量很大,不必全都补,先挑有价值的加链接,其余考虑合并或下线。

另外要控制批量生成的速度。一次性往 Sitemap 里加几千条无内链的 URL,抓取预算会被摊薄,老页面和重要页面反而受影响。

补链之后怎么验证

补上入口后,不要立刻期待收录状态变化。可以按顺序观察:站内抓取工具能否顺着新链接走到该 URL;服务器日志里是否出现该地址的抓取记录;再到搜索中确认是否进入索引。三步分开看,能判断是卡在发现、抓取还是入库环节。

小结

页面不收录时,把“发现路径”当作第一站排查项,往往比反复改内容更快找到原因。Sitemap 负责告知,内链负责背书,两者缺一,收录就容易卡住。