搜索抓取

一个 URL 需要几条发现入口:内链冗余的取舍

很多页面的发现路径只有一条:只能从某个列表页翻进去。一旦这条入口改版、失效或被脚本化,URL 在站内就失去了被发现的机会。本文讲清入口冗余的价值、合理的入口数量、如何核对现有页面有几条发现路径,以及页脚堆链接、相关推荐全靠脚本等常见误区。

搜索抓取

一个 URL 需要几条发现入口:内链冗余的取舍

检查 URL 发现情况时,很多人只关心“这个页面有没有被链接到”,却忽略了另一个问题:它是从几条路径被链接到的。一个页面只有一个入口,和有三四个互相独立的入口,在面对改版、列表重构、脚本化改版时,结果完全不同。

单入口的风险:一条路径断了,整批 URL 就失联

最常见的结构是:内容页只出现在某一个列表页里,而这个列表页又只从导航的某个二级栏目进入。这条链条上任何一环出问题,整批 URL 的发现都会受影响。

  • 列表分页过深,靠后的条目长期处在较深的层级;
  • 导航调整或栏目合并,旧入口整段消失;
  • “相关推荐”“猜你喜欢”改成脚本渲染,链接不再出现在初始 HTML 中;
  • 入口页本身被加了 noindex,或链接带的参数被 robots 规则挡掉;
  • 内容迁移到新路径,旧入口没有做承接。

这些情况单看都不算严重故障,但叠加在一起,就会让一部分 URL 只剩 Sitemap 这一条通道。

合理的冗余层级:不是越多越好

入口冗余的目标是“容错”,不是“堆数量”。比较稳妥的做法,是让每个重要页面至少有两类互相独立的入口:

  • 结构性入口:分类列表、专题枢纽页,负责覆盖范围和层级控制;
  • 相关性入口:正文内链、相关阅读,负责把分散的详情页串起来;
  • 兜底入口:Sitemap,不依赖页面渲染,用于补充和核对。

这三类入口的生成方式不同,一类失效时另一类通常还在,这才是冗余真正的价值。

页脚挂满全站链接、每篇文章塞进几十个链接,看起来入口很多,实际只是把链接价值摊薄,还会让“哪些才是真正重要的入口”变得难以判断。

核对一个页面有几条发现路径

  1. 抽取一批代表性 URL,覆盖新发布内容、老内容、冷门栏目;
  2. 用站内搜索或服务器日志反查,看这些 URL 出现在哪些页面里;
  3. 逐条确认链接是否在初始 HTML 中,而不是渲染后才出现;
  4. 检查这些入口页自身能否被正常抓取,包括状态码、robots、参数处理;
  5. 记录每类页面的入口数量,把只有单入口的挑出来优先补链。

核对时要区分“链接存在”和“链接能走通”。跳转链、依赖点击展开的内容、需要交互才出现的列表,都不能算稳定入口。

几个常见误区

  • 把 Sitemap 当成唯一入口,页面不更新、内链也不补;
  • 相关推荐全部异步加载,HTML 里空无一物;
  • 为了“增加入口”在每页堆上百个链接,反而拉低有效链接的辨识度;
  • 入口只连向首页和栏目页,详情页依旧孤立。

落地建议

与其追求入口数量,不如先保证两件事:重要页面至少有一条结构性入口和一条相关性入口;所有入口都能在初始 HTML 中被稳定解析。做到这两点,再考虑用专题页、标签页做补充。发现路径是否真的被走到,最终仍取决于搜索蜘蛛的调度,任何结构设计都只是提高被发现的可能,而不是结果。