網站收錄

已發現、已抓取、未编入索引:索引狀態分层下的核對顺序

索引覆盖率报告里,URL 不只有“已收錄”和“未收錄”。已發現但未抓取、已抓取但未编入索引這些中間狀態,往往指向完全不同的原因。本文按狀態分层,從連結入口、抓取渲染到頁面质量,给出可执行的核對顺序。

網站收錄

已發現、已抓取、未编入索引:索引狀態分层下的核對顺序

在索引覆盖率报告里,URL 通常不會只分成“收錄”和“没收錄”两類。中間還夹着几個容易被忽略的狀態:已發現但尚未抓取、已抓取但尚未编入索引、已编入索引但被選為备用網頁。只看最终數字,很容易誤判問题出在哪一环。

三個中間狀態各自說明什么

  • 已發現,尚未抓取:搜尋引擎知道這個地址存在,但還没安排抓取。常见于連結刚出現、站点抓取节奏有限、地址只来自外部且入口單薄。
  • 已抓取,尚未编入索引:内容已经被讀取,但系統判断目前不值得放進索引,或需要更多信号来確認。
  • 已编入索引,但被選為备用網頁:存在多條相似地址,規范版本另有其人。

狀態本身是信号,不是结论。同一個狀態下,原因可能完全不同,需要往上游去找。

先確認這批 URL 是否真的需要收錄

很多“收錄不動”的問题,本质是這些地址並不需要收錄。下面几類可以先排除:

  • 篩選、排序、會话追踪參數生成的地址。
  • 站内搜尋结果頁、空白列表頁、無内容的分頁。
  • 同一内容的多份副本:打印版、PDF 预览、AMP、獨立移動版地址。
  • 由模板批量生成、正文几乎相同的聚合頁。
把希望被收錄的地址和不希望被收錄的地址分開看,报告里的數字才有意义。

從連結入口往下核對

如果地址确實该收錄,先看它被谁連結、連結有多深。

  1. 主導航、面包屑、栏目列表里有没有稳定的入口。
  2. 從首頁到目标頁需要几次点击,是否超過三四层。
  3. 入站内鏈是否只有一條,且来自同样低质量的頁面。
  4. 锚文本是否描述了頁面主题,還是清一色的“点击這里”。
  5. 站点地图里的地址與實际可訪問地址是否一致。

入口單薄时,“已發現”會長期停在原地。

再核對抓取與渲染是否完整

抓取能返回 200,不代表内容被完整讀取。需要確認:

  • 返回碼正常,且没有被 robots 規則挡住關键资源。
  • 正文在首屏 HTML 里,還是依赖脚本渲染;若是後者,渲染後的内容是否與预期一致。
  • 頁面是否被 CDN、登入墙、驗證頁拦截,抓到的只是一張空壳。
  • canonical 指向的地址是否與此頁一致,有没有自相矛盾。

頁面质量信号看哪些

抓取完成後,是否進入索引更多取决于頁面本身。可以按下面几点自查:

  • 主体内容占比:正文與導航、广告、推荐模块的比例。
  • 獨特性:與站内其他頁面、站外同题内容的重复程度。
  • 信息完整度:是否有明确主题、可讀的段落结构、必要的說明。
  • 时效與维護:更新時間、是否長期無人维護。
  • 站点整体印象:同一目錄下的頁面是否普遍偏薄、是否大量重复。

一個可执行的核對顺序

  1. 把目标 URL 按狀態分组,不要混在一起看。
  2. 剔除本就不该收錄的參數頁、重复頁、空列表頁。
  3. 检查入口层級與内鏈數量,补齐導航或相關推荐。
  4. 模拟訪問,確認返回碼與渲染结果。
  5. 核對 canonical、robots、站点地图三者是否一致。
  6. 對比同站已收錄的相似頁面,找出差异点。
  7. 調整後观察若干抓取周期,再看狀態是否變化。

收錄没有固定公式,狀態流轉也需要時間。把“已發現”和“已抓取”当成獨立問题處理,通常比盯着總收錄數更有用。這些調整只是提高條件被满足的概率,没有人能保證某個地址一定被收錄。