网站收录

页面离首页太远:点击深度怎么影响抓取与收录

新页面迟迟不被抓取,除了 robots 和 canonical,链接路径也值得排查。本文说明点击深度的含义,为什么过深、过窄的路径会拖慢发现与回访,怎么自查哪些页面被埋住,以及如何用导航、面包屑、分页和 sitemap 把重要路径收短,并给出验证思路。

网站收录

页面离首页太远:点击深度怎么影响抓取与收录

很多站点会遇到这种情况:新页面提交了站点地图,内链也加了,但蜘蛛迟迟不来,或者来了只抓一次。排查时大家习惯先看 robots、canonical、状态码,这些确实优先。但如果这些都正常,下一步值得看的是链接路径——从首页出发,要点几次才能到目标页。

点击深度是什么

点击深度指从站点入口页(通常是首页)出发,沿着可点击链接走到某个 URL 所需的最少跳数。首页是第 1 层,导航栏里的分类是第 2 层,分类下的列表页是第 3 层,列表页里的详情页是第 4 层,以此类推。

对爬虫来说,站内链接是发现新 URL 的主要途径之一。站点地图能提供一份名单,但它不保证抓取顺序和频次;真正影响“多久被找到一次”的,往往是页面在链接网络里的位置。

深度为什么会影响抓取与收录

先说清楚一件事:抓取和收录是两件事。爬虫抓到了页面,只能说明它读过;是否进入索引,还要看页面质量、重复度、内容是否可渲染等。点击深度主要影响前一步——蜘蛛能不能找到、会不会反复回访。

  • 发现概率:深在第五、第六层的页面,从首页出发的路径可能只有一两条,任何一条断掉,整段页面就变成孤岛。
  • 回访频次:靠近入口、被多个页面链接的 URL,更容易被反复抓取;埋得很深的页面,更新后可能要很久才被重新读取。
  • 路径脆弱:如果唯一的入口是分页最后一页的推荐位,或者一个不定期更换的运营位,路径随时会消失。

这里不必把深度当成硬指标。三层和四层没有本质差别,真正的问题是路径少且不稳定,而不是数字本身。

自查:哪些页面被埋得太深

  • 从首页开始手动点一遍,记录到重点页面需要几次点击。
  • 看蜘蛛日志里的抓取路径:如果某个目录的 URL 几乎只靠站点地图触发,说明站内链接贡献很少。
  • 检查是否有页面只有一条入链,而且这条链来自低质量或低频页面。
  • 看面包屑、相关推荐、标签聚合这些模块是否真的输出了可抓取的链接,而不是 JS 点击事件。

常见的越点越深结构

  • 详情页只从列表页进入,而列表页只有第一页被链接,后面的分页靠加载更多按钮。
  • 多级筛选参数把 URL 层层叠加,每个组合都变成一个可访问地址。
  • 内容只在站内搜索里能找到,没有固定入口。
  • 归档、标签、作者页大量复制同一批链接,把路径绕远。

把重要路径收短

  1. 确定核心层级:先分清哪些页面需要被搜到,哪些只是辅助。重要页面尽量控制在从首页三到四次点击内。
  2. 补固定入口:导航、面包屑、相关推荐、专题页都可以作为稳定入口,优先用服务端渲染输出的普通链接。
  3. 分页给可抓的链接:不要把所有后续页都藏在加载更多里,至少保证存在可点击的分页地址。
  4. 减少无意义层级:中间层如果只是空白分类页,可以考虑合并或直接链接到下一层。
  5. 用站点地图兜底:把重要 URL 放进去,但它解决的是知道有这个地址,不等于优先抓取。
点击深度不是排名的直接因素,它影响的是发现速度和路径稳定性。把深页从只有一条路改成有几条稳定的路,比单纯追求层级数字更实际。

做完之后怎么验证

调整链接结构后,别急着看收录量。先看蜘蛛日志里这些 URL 的抓取次数、首次抓取时间、状态码有没有变化,再看索引覆盖报告里的分类是否从已发现、已抓取未编入等状态转入已编入。这个过程通常需要几周,不同站点差异很大。

如果路径已经收短、抓取也正常,但页面还是进不了索引,问题就不在深度上,需要回到页面质量、重复内容和渲染结果去排查。