網站收錄

站内連結深度:頁面埋得越深,被發現和重抓的机會越少

很多收錄問题不在内容本身,而在頁面所處的站内位置。本文從連結深度入手,說明如何自查頁面离首頁几跳、入口數量是否足够,以及哪些看似存在的連結其實起不到發現作用,並给出一個成本較低的改善顺序。

網站收錄

站内連結深度:頁面埋得越深,被發現和重抓的机會越少

排查收錄問题时,很多人先看内容质量、robots 規則、站点地图,却忽略了一個更基础的因素:這個頁面在站内處于什么位置,從首頁点几下能到。連結深度不决定收錄结果,但它實實在在影响頁面被發現的概率和频率。

連結深度為什么會影响收錄节奏

搜尋引擎發現 URL 的主要渠道之一是站内連結。爬虫沿着連結一层层往下走,頁面离首頁越遠,被走到的机會就越少,被抓取的間隔也越長。深度大的頁面,可能几天甚至几周才被訪問一次。

深度還會影响重抓节奏。一個经常被内鏈指向的頁面,内容更新後往往能較快被重新抓取;而深埋在角落里的頁面,即使更新了内容,也可能長時間停留在舊版本上,让人誤以為是索引出了問题。

先做一次連結深度自查

  1. 從首頁出發,记錄到達目标頁面最少需要几次点击;
  2. 用站内搜尋或站内連結检查,看還有哪些頁面連結到它;
  3. 把入口連結按来源分類:導航、分類頁、正文内鏈、頁脚、侧栏;
  4. 查看這些来源頁面本身是否已被收錄、是否经常被抓取。

常见经驗是把重要頁面控制在三次点击以内,但這只是參考值,不是硬性标准。真正需要關注的是入口數量和入口本身的质量,而不是單纯數层級。

入口數量和质量,比层級更值得看

一個頁面如果在多個被频繁抓取的頁面里出現,即使层級深一点,被發現的机會也不低。反過来,只有一個連結、且来自一個同样很少被抓取的頁面,就算层級只有两层,也可能長期不被訪問。

  • 入口數量:只有一两個内鏈入口的頁面,風險較高;
  • 入口頁面质量:来源頁面是否被收錄、是否有稳定的抓取;
  • 連結位置:正文里的上下文連結,通常比頁脚、侧栏的批量連結更有效;
  • 锚文本是否可讀:寫成「点击這里」這類無意义文本,入口的作用會被削弱。

常见的几種假入口

有些連結看起来存在,實际對發現頁面帮助有限,排查时容易誤判。

  • 連結由脚本在点击後才生成,HTML 源碼里並没有可直接抓取的地址;
  • 内鏈指向的地址要经過多次跳轉才到目标頁,鏈路越長越容易被放弃;
  • 連結被 nofollow 或 robots 規則挡住;
  • 連結藏在需要展開、点击「更多」才出現的模块里;
  • 列表頁里目标條目排在很靠後的位置,且没有其他入口。

改善顺序:先让入口有效,再考虑提交

調整时按下面的顺序做,成本和收益比較可控。

  1. 把重要頁面放進主導航或分類頁,确保源碼里就有可抓取的普通連結;
  2. 在主题相關的正文里补充上下文内鏈,让入口出現在真實阅讀路径上;
  3. 清理重定向鏈,让内鏈直接指向最终地址;
  4. 修掉會阻断抓取的規則,例如誤寫的 robots 或頁面級 noindex;
  5. 最後再用站点地图和提交接口做补充,而不是一上来就依赖它們。
站点地图和提交接口解决的是「告知一次」,站内連結解决的是「持續被發現」。两者不能互相替代,入口没打通时,單靠提交往往看不到稳定變化。

連結改善之後,再回到其他维度

如果入口已经补上、連結深度也合理,頁面仍然長期不被收錄,那就要換方向排查:内容是否與站内其他頁面高度重复、URL 是否規范、頁面是否需要渲染後才出内容、是否存在返回 200 却空白的软 404 情况。

連結深度只是让頁面「被看到」的一环。能不能進入索引,最终還要看這個頁面本身是否值得被保留。把入口問题和其他维度分開處理,排查起来會清楚很多。