网站收录

页面藏得太深:点击深度与内链入口对收录的影响排查

页面收录迟迟没有动静时,除了检查 sitemap、robots 和 canonical,还可以从内链入手。本文整理点击深度的概念、常见表现、排查顺序与可落地的内链调整方式,帮助判断爬虫是否容易发现目标页面。

网站收录

页面藏得太深:点击深度与内链入口对收录的影响排查

很多站点会遇到这样的情况:首页和栏目页都被收录了,但某些详情页长期停留在「已发现」状态,或者干脆没有动静。排查 sitemap、robots、canonical 都正常,这时候可以换一个角度——从首页出发,要点几次链接才能到那个页面。

点击深度是什么,为什么会牵扯到抓取

点击深度指的是从站点入口出发,沿着站内链接到达某个页面最少需要经过几次跳转。通常首页算第 0 层,主导航里的一级栏目是第 1 层,栏目下的列表页是第 2 层,列表页里的详情页是第 3 层,以此类推。

搜索引擎每天在站内能走的路径和次数都有上限。层级越深的页面,被发现的路径越少,能分到的抓取机会也越少。这不代表深层页面一定不会被收录,但确实会让发现和重新抓取变得更慢。

还有一个容易忽略的点:同样在第 3 层的页面,如果只有一条入口,和有三四条来自不同位置的入口,被访问的概率是不同的。入口数量和质量往往比单纯的层级数字更关键。

深度太深时常见的表现

  • sitemap 里提交了,日志里偶尔能看到抓取,但索引状态长期没有变化。
  • 只有少数几个入口指向该页面,链接还都藏在 JS 折叠菜单或很深的分页里。
  • 同一批上线的页面,浅层的很快有动静,深层的迟迟不动。
  • 页面之间互链只靠「相关推荐」这类动态模块,静态 HTML 里看不到链接。

排查顺序

  1. 先数路径:从首页开始,只用 HTML 里真实存在的 a 标签,手动点出一条到目标页的最短路径,记下跳转次数。
  2. 再确认链接是否可被抓取:链接是不是由 JS 渲染后才出现,是不是用了 onclick 或按钮而非 a 标签,是不是需要登录或提交表单才能进入。
  3. 看内链数量:除了列表页,有没有其他页面自然提到并链接到它,比如相关文章、专题页、面包屑。
  4. 看抓取日志:确认爬虫是否访问过该 URL,访问频率与同层级其他页面相比是否明显偏低。
  5. 看列表页分页:如果详情页只出现在第 5 页之后,而分页链接又不是可抓取的 a 标签,实际可发现性会更差。

可以做的调整

思路是让重要页面拥有更多、更浅的入口,而不是靠堆砌链接。

  • 把重要栏目或聚合页放进主导航,减少一级入口的跳转次数。
  • 列表页控制每页条数,避免新品或新文章被挤到很深的页码。
  • 用面包屑、标签聚合、专题页给详情页增加静态入口,链接文字自然描述目标内容。
  • 确保关键链接在服务端渲染或首屏就存在,而不是等 JS 执行后才插入。
  • 定期用站点地图对照内链,找出「只有 sitemap 提到、站内没有任何入口」的页面。

几个容易走偏的地方

增加入口不等于到处塞链接。同一个锚文本在大量页面重复指向同一地址,容易被判断为刻意堆砌;把不相关的页面硬链在一起,对用户也没有价值。更稳妥的做法是围绕内容本身组织内链,让链接出现的位置符合用户的阅读路径。

也不必为了压低层级把所有页面都塞进导航。导航过载会稀释每个入口的权重,反而让真正重要的页面不突出。分清楚哪些是核心页面、哪些可以留在深层通过搜索或专题页触达,效果通常更好。

点击深度只是排查收录的一个维度。sitemap 质量、页面内容、服务器响应、URL 规范同样会影响结果,任何单一手段都不能保证收录。

小结

当常规项都排查过、收录仍然卡住时,不妨从首页手动走一遍到目标页的路径,看看它到底藏在第几层、有几个真实入口。多数情况下,先解决「爬虫能不能顺畅发现」的问题,比反复提交 URL 更有意义。