網站收錄

能抓取、能索引、能收錄:用三层漏斗排查頁面進不了索引

很多运营把蜘蛛訪問当成收錄信号,其實中間隔着可抓取、可索引、值得索引三道關。本文用漏斗思路拆解每一层常见的卡点,包括狀態碼、robots、noindex、canonical、渲染内容與頁面质量,並给出日誌、URL 检查與覆盖率报告的對照方法,帮助你判断頁面到底卡在哪一步。

網站收錄

能抓取、能索引、能收錄:用三层漏斗排查頁面進不了索引

蜘蛛来過,不等于頁面會被收錄。抓取、索引、收錄其實是三個不同阶段,中間任何一层出問题,頁面都可能停在队列里。把排查過程想成一個漏斗:先能抓,再能索引,最後才谈是否值得放進索引。

第一层:可抓取

如果蜘蛛连頁面都拿不到,後面的事都不用谈。常见卡点集中在服務器與 URL 本身:

  • 狀態碼不稳定:間歇性 502、504 或大量 403,會让蜘蛛降低抓取频次,甚至暂时放弃這個目錄。
  • robots.txt 誤伤:整站屏蔽、誤屏蔽 CSS/JS,或寫错路径,都會让頁面無法進入正常抓取流程。
  • URL 規范混乱:同一内容有带參數、大小寫、尾斜杠多個版本,蜘蛛可能在變体之間来回抓,真正的主版本反而没被稳定發現。
  • 入口太少:没有内鏈、站点地图又没列出的 URL,蜘蛛發現得慢,甚至長期發現不了。

這一层可以用服務器日誌、站点地图和 URL 检查工具對照:看蜘蛛是否真的請求了目标 URL,返回碼是什么,抓的是哪個版本。

第二层:可索引

頁面能被抓取,也可能被明确或隐含地排除在索引之外。重点看响應头和頁面里的指令:

  • noindex:meta robots 或 X-Robots-Tag 寫了 noindex,頁面抓取正常,但不會進索引。
  • canonical 指向別處:頁面自己声明主版本是另一個 URL,搜尋引擎通常會按 canonical 收口。
  • 重复内容:站内多個 URL 内容高度相似,系統會選一個主版本,其余可能只抓不收。
  • 渲染後才有内容:首屏依赖 JS 渲染时,要確認渲染後的 HTML 里确實有正文、連結和必要的元信息。
抓取工具看到的是原始 HTML 還是渲染结果,會直接影响判断。對 JS 站点,最好用抓取測試或渲染後的 HTML 對照一次。

第三层:值得索引

能抓、也能索引,不代表頁面會被放進索引。搜尋引擎還要判断這個頁面是否值得占一個位置。常见的“抓了不收”包括:

  • 内容太薄,只有几句话或纯參數篩選结果。
  • 與站内其他頁面高度同质,僅換了排序或篩選條件。
  • 頁面主题不明确,标题、正文和用戶可能搜尋的词對不上。
  • 聚合頁、标簽頁大量生成,但每個頁面没有獨立價值。

這一层没有開關可以打開,能做的是提高頁面的獨立價值:补足正文、明确主题、收敛重复入口,把不值得收錄的頁面用 noindex 或 robots 挡在索引之外,而不是让它們消耗抓取。

怎么判断卡在哪一层

  1. 先用站点地图或内鏈找到目标 URL,確認蜘蛛最近是否抓過。
  2. 看日誌里的返回碼和抓取版本,判断可抓取层是否正常。
  3. 用 URL 检查工具看抓取时的 HTML、noindex、canonical 和渲染结果。
  4. 如果前三步都正常,再去對比同模板頁面:是單個頁面不收,還是一批都不收。
  5. 最後看頁面质量與站内重复情况,判断是否属于“可抓但不值得收”。

三层漏斗不是一次性检查,而是一個排查顺序。先排除硬性阻断,再處理收口問题,最後才去優化内容质量。這样定位起来會比反复提交 URL 更有方向。需要說明的是,排查能减少阻碍,但没人能承诺某個頁面一定被收錄,最终仍由搜尋引擎决定。