在收錄問题里,最容易混淆的一句话是“頁面已经抓了,怎么還没收錄”。抓取、收錄、索引、展示在後台可能對應不同狀態,混在一起看,排查就會乱。把同一個 URL 的四種狀態拆開,很多問题會具体到某一步。
四種狀態分別指什么
- 已發現:搜尋引擎知道這個 URL 存在,来源可能是内鏈、站点地图、外鏈或手動提交。發現只代表進入待處理队列,不保證很快抓取。
- 已抓取:爬虫實际請求了頁面,拿到了 HTML 或狀態碼。服務器返回 200、内容能解析,才谈得上進入下一步。
- 已索引:頁面内容被解析、去重、质量判断後,進入可被检索的索引。這個阶段可能出現“已抓取但未编入索引”。
- 可展示:用戶搜尋某個词时,頁面有机會出現在结果里。即使進了索引,也不代表每個查询都會展示。
狀態對不上时,先看卡在哪一层
發現到抓取之間
常见原因是 URL 层級太深、内鏈太少、站点地图缺失或错誤、robots.txt 屏蔽、服務器响應慢。日誌里長期没有爬虫记錄,先查這些,而不是反复改正文。
抓取到索引之間
頁面被抓了但没進索引,常见信号包括 noindex、canonical 指向其他 URL、内容與站内或站外高度重复、頁面主体内容過薄、模板化嚴重。此时要判断頁面是否值得單獨存在,而不是只改标题。
索引到展示之間
頁面在索引里,但搜尋品牌词或長尾词不出現,可能和查询意图、排序竞争、地域、個性化有關。用固定的查询词和不同设备多试几次,再看标题摘要是否被改寫。
核對狀態时,別只依赖一種方式
- 先看抓取日誌,確認爬虫是否来過、返回什么狀態碼。
- 再看站点地图和索引狀態报告,区分“已發現未抓取”和“已抓取未索引”。
- 用 URL 检查工具看具体地址的目前狀態,但不要把它当成最终排名依據。
- 用站内搜尋和外部搜尋交叉驗證,注意 site 查询本身有誤差。
URL 規范和重复内容影响的是索引归集
同一内容如果存在多個地址,比如带參數、带大小寫、带末尾斜杠、打印版、移動版,索引信号會被分散。處理顺序通常是:先统一 URL 寫法,再用 301 把舊地址指向代表頁,最後用 canonical 或 noindex 處理剩余變体。不要同时给一個 URL 加互相冲突的指令。
- 代表頁只保留一個,其他變体不要都放在站点地图里。
- 篩選參數、排序參數、會话參數,能屏蔽就屏蔽,能合並就合並。
- 分頁和列表頁按實际價值决定是否留在索引,不要預設全收。
能主動做的几件事
把重要頁面放在靠近首頁的层級,用内鏈把 URL 串起来;站点地图只放希望被抓取的規范地址;上线新頁面後观察日誌和索引狀態,而不是当天就下结论;對薄内容做扩充、合並或 noindex,而不是反复提交。這些動作提高的是被正常處理的机會,不保證一定收錄或展示。
先確認 URL 處在發現、抓取、索引、展示中的哪一步,再决定改什么。顺序對了,收錄問题才不會變成盲目改版。