搜索抓取

孤岛 URL 怎么被蜘蛛发现:没有入链的页面还能走哪些入口

孤岛 URL 指站内没有任何链接指向的页面,蜘蛛顺着链接爬行时走不到。本文梳理孤岛页常见的产生原因,说明 Sitemap、外链、站内搜索、feed 等补充入口该怎么用、有什么局限,并给出把内链接回去的排查顺序。

搜索抓取

孤岛 URL 怎么被蜘蛛发现:没有入链的页面还能走哪些入口

站内链接是蜘蛛最主要的行路方式:从一个已知页面出发,顺着 a 标签一路走下去。但总有那么一些 URL,站内没有任何链接指向它,蜘蛛顺着路径爬到哪儿都碰不到——这类页面通常被叫做孤岛页。它们不是打不开,也不是被 robots 挡住,只是没人给蜘蛛带路。

孤岛 URL 一般是怎么产生的

孤岛页很少是有人故意做的,多数是运营和开发过程中的副产品:

  • 改版或栏目调整:旧列表页被下线,但详情页还在,入口链接一起删掉了。
  • 筛选、排序、参数页:由筛选条件动态生成的 URL,只有用户点选才会出现,站内没有固定链接。
  • 活动页、专题页:上线时挂在首页,活动结束后入口撤掉,页面本身还留着。
  • 接口或脚本生成的页面:由后端数据拼出来的地址,只在特定场景下被调用。
  • 分页深处:列表翻到很后面才有链接,前面几页又翻不到那里。

这些页面的共同点是:它们存在于服务器上,返回 200,但站内的链接图上没有它的位置。

蜘蛛发现 URL 的几条补充入口

内链之外,蜘蛛还有一些别的路可以走到 URL,虽然不如内链稳定,但在孤岛页的处置上可以作为过渡手段。

Sitemap 兜底

Sitemap 是告诉蜘蛛“我这儿有哪些地址”的清单。把孤岛页按目录或类型分组,放进对应的分片文件里,至少在 URL 发现这一层有了交代。要注意的是,Sitemap 只是声明,不等于蜘蛛一定会抓;如果页面长期孤岛、内容又不更新,抓取优先级通常也不会高。

外链与外部提及

如果这个页面值得被外部引用,一条来自其他站点的正常链接,往往比 Sitemap 更有推动力。但外链需要内容本身有价值,为了被发现而四处发链接,属于另一回事。

站内搜索页与聚合入口

有些站点的站内搜索结果是可被访问的 URL。如果搜索结果页能被蜘蛛抓到,里面的结果链接就成了一条发现路径。不过搜索页通常需要限制抓取范围,否则参数组合会无限膨胀,反而给抓取路径添乱。

Feed 与结构化数据

RSS、Atom 这类 feed 文件天然带链接,适合更新频繁的内容;结构化数据里的 URL 属性也能起到提示作用。它们更偏向“告知更新”,不适合当作长期入口。

把内链补回去才是长久解法

补充入口能解决一时的发现,但页面拿不到站内链接权重,位置也不会稳。更实际的做法是给它找一条合理的回程路:

  1. 确认这个页面还需要存在吗。有些孤岛页是历史遗留,直接 301 到相近页面或下线更干净。
  2. 从上游页面加入口。栏目列表、标签页、相关推荐,都是自然的入口位置。
  3. 同级页面互相链接。同一批内容之间互相引用,能让蜘蛛在几页之间来回走。
  4. 面包屑补层级。即使是孤岛页,也让它有一条回栏目、回首页的路径,方便蜘蛛继续跑。
  5. 检查链接是否可抓。链接用了 JS 跳转、按钮而非 a 标签、或者加了 nofollow,都会让这条路走不通。

几个容易踩的坑

  • 为了“把所有页面塞给蜘蛛”,在页脚堆几百条链接。这类链接权重稀薄,也影响用户阅读。
  • 只加 Sitemap 不补内链,时间一长页面又会回到孤岛状态。
  • 孤岛页本身内容薄弱、返回 200 却像空壳,即使被发现,抓取结果也不理想。
  • 把内链修复当成一次性任务,改版后没有复查,新的孤岛又冒出来。
判断一个页面是不是孤岛,不用靠猜:在站内链接图里找它的入链,找不到就是。发现入口是过渡,内链才是常驻路径。

可以按这个顺序排查

  1. 用爬虫工具跑一遍站内链接,导出只有出链、没有入链的 URL 列表。
  2. 对照服务器日志,看这些地址有没有被抓过、抓的是哪些地址。
  3. 对照 Sitemap,确认哪些孤岛 URL 不在清单里。
  4. 按“保留 / 合并 / 下线”三类分别处理。
  5. 处理完再跑一次链接检查,确认入链接上了。

孤岛 URL 的治理不复杂,难在坚持:站点每次结构性调整,都会产生新的孤岛。把链接检查纳入常规流程,比事后补救省力得多。