網站收錄

從首頁点到目标頁要几次:站点层級對抓取與收錄的影响

頁面收錄不好,有时不是内容問题,而是入口太深。本文区分 URL 层級與点击深度,给出用服務器日誌和内鏈抽样测量的方法,列出几種無意中加深层級的做法,並說明补入口、做聚合、压层級的處理顺序,以及改完之後该观察哪些資料。

網站收錄

從首頁点到目标頁要几次:站点层級對抓取與收錄的影响

很多站点在做收錄排查时,會把注意力放在 URL 長短上,比如 /news/2024/03/12/xxx.html 看起来比 /xxx.html 深。但對搜尋引擎来说,真正影响發現和抓取效率的往往不是 URL 寫了几层,而是從已知入口到目标頁需要点几次連結。這就是点击深度,也是網站收錄里最容易被忽略的一條。

深度的两種含义,別混在一起

URL 层級是给人看的地址结构,点击深度是蜘蛛實际走過的路径。两者经常不一致:一個 /a/b/c/ 的長地址,可能從首頁直接就有入口;一個短地址,却只能靠站内搜尋才能到達。後者才是收錄困难的常见原因。

判断标准可以简單理解為:如果站内搜尋框是用戶找到這個頁面的唯一方式,那對蜘蛛来说它几乎等于不存在。

為什么深度過大會拖住收錄

  • 發現概率下降:列表頁翻到第十頁之後的連結,被訪問机會明顯减少。
  • 抓取配額被消耗在中間层:每一次翻頁都占用一次抓取机會。
  • 更新信号弱:長期没人訪問的頁面,重新被抓取的間隔會被拉長。
  • 内鏈信号分散:同一批頁面只靠一個入口,缺少頁面之間的互相印證。

先量一遍,再動手改

  1. 看服務器日誌:統計蜘蛛一天内訪問的 URL 分布,观察它最深翻到第几頁。
  2. 抽样检查:挑 10 個你認為重要的頁面,從首頁出發數一數需要点击几次。
  3. 對照收錄狀態:把這些頁面的收錄情况與点击深度列在一起,通常能看到對應關系。

哪些做法在無意中加深层級

  • 列表頁只保留“下一頁”,没有分類、年份等中間层入口。
  • 内容只在标簽頁、归档頁出現,主栏目里没有固定位置。
  • 列表靠 JS 异步加载,源碼里没有可抓取的連結。
  • 導航使用图片,或菜單需要点击展開,蜘蛛拿不到連結地址。
  • 重要頁面只在活動期間出現在首頁,活動結束後入口就消失了。

改善的一般顺序

先补入口,再谈其他。首頁或一級栏目给這些頁面一個相對稳定的位置,比反复提交 URL 更實在。其次是做聚合頁或分類頁,把長尾内容按主题归拢,让列表頁本身成為發現通道。面包屑、相關推荐、上下篇這類模块,可以顺带把深度再压下去一层。

站点地图是有用的补充,但它替代不了内鏈:sitemap 解决的是“知道有這個地址”,内鏈解决的是“愿意抓、经常抓”。

需要提醒的是,缩短层級只是提高被發現的概率,不等于一定被收錄。内容质量、頁面重复度、服務器响應速度同样在起作用。

不是所有頁面都值得压到首頁

工具頁、低频說明頁、歷史归档頁本身訪問量低,硬塞到首頁反而會挤压主要入口。這類頁面放在合适的层級、保證有一條可抓路径即可。真正需要重点照顾的,是有轉化價值、有搜尋需求、希望被長期索引的頁面

改完之後看什么

  • 蜘蛛對目标頁面的抓取频次與首次抓取時間。
  • 這些頁面的收錄數量變化,注意区分“被抓取”和“被索引”。
  • 日誌中深层翻頁是否减少,抓取是否更多集中在内容頁。

如果几周内抓取和收錄都没有變化,先別急着繼續加連結,回头检查頁面本身是否存在重复内容、模板化嚴重或加载缓慢的問题。