在索引覆盖率报告里,URL 通常不會只分成“收錄”和“没收錄”两類。中間還夹着几個容易被忽略的狀態:已發現但尚未抓取、已抓取但尚未编入索引、已编入索引但被選為备用網頁。只看最终數字,很容易誤判問题出在哪一环。
三個中間狀態各自說明什么
- 已發現,尚未抓取:搜尋引擎知道這個地址存在,但還没安排抓取。常见于連結刚出現、站点抓取节奏有限、地址只来自外部且入口單薄。
- 已抓取,尚未编入索引:内容已经被讀取,但系統判断目前不值得放進索引,或需要更多信号来確認。
- 已编入索引,但被選為备用網頁:存在多條相似地址,規范版本另有其人。
狀態本身是信号,不是结论。同一個狀態下,原因可能完全不同,需要往上游去找。
先確認這批 URL 是否真的需要收錄
很多“收錄不動”的問题,本质是這些地址並不需要收錄。下面几類可以先排除:
- 篩選、排序、會话追踪參數生成的地址。
- 站内搜尋结果頁、空白列表頁、無内容的分頁。
- 同一内容的多份副本:打印版、PDF 预览、AMP、獨立移動版地址。
- 由模板批量生成、正文几乎相同的聚合頁。
把希望被收錄的地址和不希望被收錄的地址分開看,报告里的數字才有意义。
從連結入口往下核對
如果地址确實该收錄,先看它被谁連結、連結有多深。
- 主導航、面包屑、栏目列表里有没有稳定的入口。
- 從首頁到目标頁需要几次点击,是否超過三四层。
- 入站内鏈是否只有一條,且来自同样低质量的頁面。
- 锚文本是否描述了頁面主题,還是清一色的“点击這里”。
- 站点地图里的地址與實际可訪問地址是否一致。
入口單薄时,“已發現”會長期停在原地。
再核對抓取與渲染是否完整
抓取能返回 200,不代表内容被完整讀取。需要確認:
- 返回碼正常,且没有被 robots 規則挡住關键资源。
- 正文在首屏 HTML 里,還是依赖脚本渲染;若是後者,渲染後的内容是否與预期一致。
- 頁面是否被 CDN、登入墙、驗證頁拦截,抓到的只是一張空壳。
- canonical 指向的地址是否與此頁一致,有没有自相矛盾。
頁面质量信号看哪些
抓取完成後,是否進入索引更多取决于頁面本身。可以按下面几点自查:
- 主体内容占比:正文與導航、广告、推荐模块的比例。
- 獨特性:與站内其他頁面、站外同题内容的重复程度。
- 信息完整度:是否有明确主题、可讀的段落结构、必要的說明。
- 时效與维護:更新時間、是否長期無人维護。
- 站点整体印象:同一目錄下的頁面是否普遍偏薄、是否大量重复。
一個可执行的核對顺序
- 把目标 URL 按狀態分组,不要混在一起看。
- 剔除本就不该收錄的參數頁、重复頁、空列表頁。
- 检查入口层級與内鏈數量,补齐導航或相關推荐。
- 模拟訪問,確認返回碼與渲染结果。
- 核對 canonical、robots、站点地图三者是否一致。
- 對比同站已收錄的相似頁面,找出差异点。
- 調整後观察若干抓取周期,再看狀態是否變化。
收錄没有固定公式,狀態流轉也需要時間。把“已發現”和“已抓取”当成獨立問题處理,通常比盯着總收錄數更有用。這些調整只是提高條件被满足的概率,没有人能保證某個地址一定被收錄。