網站收錄

URL 的四種狀態:已發現、已抓取、已索引、可展示

很多运营把“抓取到”和“被收錄”当成同一件事,實际上 URL 要经過發現、抓取、索引、展示四個环节。本文按這四個狀態拆開讲,說明每個环节常见卡点、核對方式和 URL 規范、重复内容、頁面质量對索引归集的影响,帮助你把排查顺序理顺。

網站收錄

URL 的四種狀態:已發現、已抓取、已索引、可展示

在收錄問题里,最容易混淆的一句话是“頁面已经抓了,怎么還没收錄”。抓取、收錄、索引、展示在後台可能對應不同狀態,混在一起看,排查就會乱。把同一個 URL 的四種狀態拆開,很多問题會具体到某一步。

四種狀態分別指什么

  • 已發現:搜尋引擎知道這個 URL 存在,来源可能是内鏈、站点地图、外鏈或手動提交。發現只代表進入待處理队列,不保證很快抓取。
  • 已抓取:爬虫實际請求了頁面,拿到了 HTML 或狀態碼。服務器返回 200、内容能解析,才谈得上進入下一步。
  • 已索引:頁面内容被解析、去重、质量判断後,進入可被检索的索引。這個阶段可能出現“已抓取但未编入索引”。
  • 可展示:用戶搜尋某個词时,頁面有机會出現在结果里。即使進了索引,也不代表每個查询都會展示。

狀態對不上时,先看卡在哪一层

發現到抓取之間

常见原因是 URL 层級太深、内鏈太少、站点地图缺失或错誤、robots.txt 屏蔽、服務器响應慢。日誌里長期没有爬虫记錄,先查這些,而不是反复改正文。

抓取到索引之間

頁面被抓了但没進索引,常见信号包括 noindex、canonical 指向其他 URL、内容與站内或站外高度重复、頁面主体内容過薄、模板化嚴重。此时要判断頁面是否值得單獨存在,而不是只改标题。

索引到展示之間

頁面在索引里,但搜尋品牌词或長尾词不出現,可能和查询意图、排序竞争、地域、個性化有關。用固定的查询词和不同设备多试几次,再看标题摘要是否被改寫。

核對狀態时,別只依赖一種方式

  1. 先看抓取日誌,確認爬虫是否来過、返回什么狀態碼。
  2. 再看站点地图和索引狀態报告,区分“已發現未抓取”和“已抓取未索引”。
  3. 用 URL 检查工具看具体地址的目前狀態,但不要把它当成最终排名依據。
  4. 用站内搜尋和外部搜尋交叉驗證,注意 site 查询本身有誤差。

URL 規范和重复内容影响的是索引归集

同一内容如果存在多個地址,比如带參數、带大小寫、带末尾斜杠、打印版、移動版,索引信号會被分散。處理顺序通常是:先统一 URL 寫法,再用 301 把舊地址指向代表頁,最後用 canonical 或 noindex 處理剩余變体。不要同时给一個 URL 加互相冲突的指令。

  • 代表頁只保留一個,其他變体不要都放在站点地图里。
  • 篩選參數、排序參數、會话參數,能屏蔽就屏蔽,能合並就合並。
  • 分頁和列表頁按實际價值决定是否留在索引,不要預設全收。

能主動做的几件事

把重要頁面放在靠近首頁的层級,用内鏈把 URL 串起来;站点地图只放希望被抓取的規范地址;上线新頁面後观察日誌和索引狀態,而不是当天就下结论;對薄内容做扩充、合並或 noindex,而不是反复提交。這些動作提高的是被正常處理的机會,不保證一定收錄或展示。

先確認 URL 處在發現、抓取、索引、展示中的哪一步,再决定改什么。顺序對了,收錄問题才不會變成盲目改版。