网站收录

从首页点到目标页要几次:站点层级对抓取与收录的影响

页面收录不好,有时不是内容问题,而是入口太深。本文区分 URL 层级与点击深度,给出用服务器日志和内链抽样测量的方法,列出几种无意中加深层级的做法,并说明补入口、做聚合、压层级的处理顺序,以及改完之后该观察哪些数据。

网站收录

从首页点到目标页要几次:站点层级对抓取与收录的影响

很多站点在做收录排查时,会把注意力放在 URL 长短上,比如 /news/2024/03/12/xxx.html 看起来比 /xxx.html 深。但对搜索引擎来说,真正影响发现和抓取效率的往往不是 URL 写了几层,而是从已知入口到目标页需要点几次链接。这就是点击深度,也是网站收录里最容易被忽略的一条。

深度的两种含义,别混在一起

URL 层级是给人看的地址结构,点击深度是蜘蛛实际走过的路径。两者经常不一致:一个 /a/b/c/ 的长地址,可能从首页直接就有入口;一个短地址,却只能靠站内搜索才能到达。后者才是收录困难的常见原因。

判断标准可以简单理解为:如果站内搜索框是用户找到这个页面的唯一方式,那对蜘蛛来说它几乎等于不存在。

为什么深度过大会拖住收录

  • 发现概率下降:列表页翻到第十页之后的链接,被访问机会明显减少。
  • 抓取配额被消耗在中间层:每一次翻页都占用一次抓取机会。
  • 更新信号弱:长期没人访问的页面,重新被抓取的间隔会被拉长。
  • 内链信号分散:同一批页面只靠一个入口,缺少页面之间的互相印证。

先量一遍,再动手改

  1. 看服务器日志:统计蜘蛛一天内访问的 URL 分布,观察它最深翻到第几页。
  2. 抽样检查:挑 10 个你认为重要的页面,从首页出发数一数需要点击几次。
  3. 对照收录状态:把这些页面的收录情况与点击深度列在一起,通常能看到对应关系。

哪些做法在无意中加深层级

  • 列表页只保留“下一页”,没有分类、年份等中间层入口。
  • 内容只在标签页、归档页出现,主栏目里没有固定位置。
  • 列表靠 JS 异步加载,源码里没有可抓取的链接。
  • 导航使用图片,或菜单需要点击展开,蜘蛛拿不到链接地址。
  • 重要页面只在活动期间出现在首页,活动结束后入口就消失了。

改善的一般顺序

先补入口,再谈其他。首页或一级栏目给这些页面一个相对稳定的位置,比反复提交 URL 更实在。其次是做聚合页或分类页,把长尾内容按主题归拢,让列表页本身成为发现通道。面包屑、相关推荐、上下篇这类模块,可以顺带把深度再压下去一层。

站点地图是有用的补充,但它替代不了内链:sitemap 解决的是“知道有这个地址”,内链解决的是“愿意抓、经常抓”。

需要提醒的是,缩短层级只是提高被发现的概率,不等于一定被收录。内容质量、页面重复度、服务器响应速度同样在起作用。

不是所有页面都值得压到首页

工具页、低频说明页、历史归档页本身访问量低,硬塞到首页反而会挤压主要入口。这类页面放在合适的层级、保证有一条可抓路径即可。真正需要重点照顾的,是有转化价值、有搜索需求、希望被长期索引的页面

改完之后看什么

  • 蜘蛛对目标页面的抓取频次与首次抓取时间。
  • 这些页面的收录数量变化,注意区分“被抓取”和“被索引”。
  • 日志中深层翻页是否减少,抓取是否更多集中在内容页。

如果几周内抓取和收录都没有变化,先别急着继续加链接,回头检查页面本身是否存在重复内容、模板化严重或加载缓慢的问题。