网站收录

重要页面埋得太深:收录核对先量一遍从首页到它的点击距离

收录对不上时,多数人先改正文和标签,却忽略页面根本没被蜘蛛走到。本文给出一套从首页做广度遍历的量法:三层以内的判定标准、三类页面的合理深度、深度超标的常见原因与处理顺序,帮你把“抓不到”和“收不进”分开判断。

网站收录

重要页面埋得太深:收录核对先量一遍从首页到它的点击距离

收录对不上时,大家习惯先看页面本身:标题、正文、noindex、canonical。但有一类问题出在更前面——页面根本没被蜘蛛走到,或者走到的路径绕了太远。这时不管页面写得多好,都可能长期停在“已发现、未抓取”那一栏。核对之前先量一遍从首页到目标页的点击距离,往往比反复改正文更快定位问题。

为什么要先量点击距离

蜘蛛发现 URL 的顺序,主要取决于站内链接里出现的地址。sitemap 能提供一份清单,但它解决的是“知道有这个地址”,不等于“被排进抓取队列的前面”。在抓取能力有限的前提下,从首页一两跳就能到的地址,通常比埋在第五、第六层的地址更早被取回。

抓取和收录是两件事:被抓过说明蜘蛛来过,被收录说明索引层认可它。点击距离影响的是前一件事,做得不好,后一件事连上场的机会都没有。

怎么量:从首页做一次广度遍历

不需要复杂工具。找一份站内链接导出(爬虫工具、服务器日志、或站点后台的内链统计都可以),按三步做:

  1. 把首页记为第 0 层,只统计页面里真实可点击的链接,不含脚本拼接出来的地址。
  2. 第 1 层是主导航、面包屑、首页推荐位指向的地址;第 2 层是栏目列表里的条目;以此类推。
  3. 给每个目标页只记最短的那条路径,而不是随便一条。有直达路径,就不必管它同时也出现在第五层。

三类页面分开看

栏目页、内容页、工具或活动页的合理深度并不一样。栏目页一般落在 1 到 2 层;常规内容页三跳以内比较稳;专题、活动、长尾内容可以放宽,但最好有聚合入口托着,而不是只靠站内搜索兜底。

深度超标通常是这几个原因

  • 只出现在列表页的后几页。第一页永远最容易被爬到,越往后越难被顺路取回。
  • 入口只在搜索框里。用户搜得到,不代表蜘蛛走得到。
  • 链接由脚本动态插入。原始 HTML 里没有这条链接时,很多时候等于没有。
  • 相关推荐用了 nofollow 或跳转脚本。链接信号被削弱,发现优先级也跟着下降。
  • 只在 sitemap 里出现。清单给了,站内却没有任何链接指向它,这类地址常长期停在“已发现”。

处理顺序建议

  1. 先修覆盖最多页面的位置:主导航、面包屑、栏目分类入口。
  2. 再补聚合页,用标签页、专题页、索引页把同类地址串起来,给长尾页面多一条进路。
  3. 减少不必要的中间层。能一次跳到的,不要设计成“列表—子列表—详情”三段。
  4. 列表分页保留第一页的直接链接,深层页面尽量往前提。
  5. 改完后隔一段时间再量一次,对比前后的层级变化。
层级只是一个变量。页面本身质量太低、与已有页面内容高度重复,即使压到第一层也不一定进索引。深度排查回答的是“有没有机会被抓到”,不是“抓到了就一定会收”。

复核时对齐两个数

一次核对只回答一个问题:重要页面是不是都有一条三跳以内的路径。把层级表和索引状态放在一起看,如果某个地址层级很浅却仍不进索引,问题大概率在页面质量或重复内容上,这时再回到内容层面排查,效率会比一开始就怀疑站点结构高得多。

这套量法可以固定成例行检查:新站上线、改版换模板、批量新增栏目之后各做一次,深度异常的地址通常一眼就能看出来。