很多站点会遇到这种情况:新页面提交了站点地图,内链也加了,但蜘蛛迟迟不来,或者来了只抓一次。排查时大家习惯先看 robots、canonical、状态码,这些确实优先。但如果这些都正常,下一步值得看的是链接路径——从首页出发,要点几次才能到目标页。
点击深度是什么
点击深度指从站点入口页(通常是首页)出发,沿着可点击链接走到某个 URL 所需的最少跳数。首页是第 1 层,导航栏里的分类是第 2 层,分类下的列表页是第 3 层,列表页里的详情页是第 4 层,以此类推。
对爬虫来说,站内链接是发现新 URL 的主要途径之一。站点地图能提供一份名单,但它不保证抓取顺序和频次;真正影响“多久被找到一次”的,往往是页面在链接网络里的位置。
深度为什么会影响抓取与收录
先说清楚一件事:抓取和收录是两件事。爬虫抓到了页面,只能说明它读过;是否进入索引,还要看页面质量、重复度、内容是否可渲染等。点击深度主要影响前一步——蜘蛛能不能找到、会不会反复回访。
- 发现概率:深在第五、第六层的页面,从首页出发的路径可能只有一两条,任何一条断掉,整段页面就变成孤岛。
- 回访频次:靠近入口、被多个页面链接的 URL,更容易被反复抓取;埋得很深的页面,更新后可能要很久才被重新读取。
- 路径脆弱:如果唯一的入口是分页最后一页的推荐位,或者一个不定期更换的运营位,路径随时会消失。
这里不必把深度当成硬指标。三层和四层没有本质差别,真正的问题是路径少且不稳定,而不是数字本身。
自查:哪些页面被埋得太深
- 从首页开始手动点一遍,记录到重点页面需要几次点击。
- 看蜘蛛日志里的抓取路径:如果某个目录的 URL 几乎只靠站点地图触发,说明站内链接贡献很少。
- 检查是否有页面只有一条入链,而且这条链来自低质量或低频页面。
- 看面包屑、相关推荐、标签聚合这些模块是否真的输出了可抓取的链接,而不是 JS 点击事件。
常见的越点越深结构
- 详情页只从列表页进入,而列表页只有第一页被链接,后面的分页靠加载更多按钮。
- 多级筛选参数把 URL 层层叠加,每个组合都变成一个可访问地址。
- 内容只在站内搜索里能找到,没有固定入口。
- 归档、标签、作者页大量复制同一批链接,把路径绕远。
把重要路径收短
- 确定核心层级:先分清哪些页面需要被搜到,哪些只是辅助。重要页面尽量控制在从首页三到四次点击内。
- 补固定入口:导航、面包屑、相关推荐、专题页都可以作为稳定入口,优先用服务端渲染输出的普通链接。
- 分页给可抓的链接:不要把所有后续页都藏在加载更多里,至少保证存在可点击的分页地址。
- 减少无意义层级:中间层如果只是空白分类页,可以考虑合并或直接链接到下一层。
- 用站点地图兜底:把重要 URL 放进去,但它解决的是知道有这个地址,不等于优先抓取。
点击深度不是排名的直接因素,它影响的是发现速度和路径稳定性。把深页从只有一条路改成有几条稳定的路,比单纯追求层级数字更实际。
做完之后怎么验证
调整链接结构后,别急着看收录量。先看蜘蛛日志里这些 URL 的抓取次数、首次抓取时间、状态码有没有变化,再看索引覆盖报告里的分类是否从已发现、已抓取未编入等状态转入已编入。这个过程通常需要几周,不同站点差异很大。
如果路径已经收短、抓取也正常,但页面还是进不了索引,问题就不在深度上,需要回到页面质量、重复内容和渲染结果去排查。