網站收錄

已發現但未抓取、已抓取但未编入索引:两種狀態別用同一套办法

頁面索引报告里的“已發現-尚未抓取”和“已抓取-尚未编入索引”经常被混着看,但前者是排队問题,後者是取舍問题。本文拆開讲两種狀態的成因、排查顺序和常见誤判,帮你判断這一轮该優化抓取鏈路,還是该動頁面本身。

網站收錄

已發現但未抓取、已抓取但未编入索引:两種狀態別用同一套办法

在 Search Console 的頁面索引报告里,“已發現 - 尚未抓取”和“已抓取 - 尚未编入索引”是两個经常被混着看的數字。它們的中文表述很像,但指向的原因几乎不重叠。用同一套办法去處理,多半會白忙一场。

先看清两種狀態各说了什么

已發現 - 尚未抓取:搜尋引擎知道這個 URL 存在,但還没去訪問它。URL 可能来自内鏈、外鏈、站点地图或提交接口。這條记錄說明的是排队問题,不是内容問题。

已抓取 - 尚未编入索引:爬虫已经訪問過頁面,拿到了内容,但决定不放進索引。這條說明的是取舍問题——它看過了,觉得没必要留。

一句话区分:前者是“還没轮到”,後者是“看過了没要”。

已發現但未抓取:往抓取這條线上找原因

  • 站点整体响應慢或经常超时,爬虫每次来都拿不到完整内容。
  • 站内存在大量自動生成的低價值 URL,把抓取額度先消耗掉了。
  • 新頁面入口太深,只靠站点地图提交,站内没有像样的連結指向。
  • 站点地图里塞了几萬個 URL,而站点實际被抓取的速度遠低于這個量級。
  • 整個站点缺少外部連結,爬虫的訪問频率本来就低。

這類情况改内容基本没用。優先做的是:把重要 URL 用站内連結接進主干、压缩無意义 URL 的數量、把服務器响應時間压下来。

已抓取但未编入索引:往内容和重复上找原因

  • 頁面與站内其他頁面高度雷同,只差几個字段或几句描述。
  • 正文有效信息太少,主体内容被導航、推荐、广告挤到後面。
  • 頁面是模板批量拼出来的,不同 URL 之間的差异對用戶没有意义。
  • 正文依赖 JS 渲染,而抓取时拿到的是空壳。
  • canonical、noindex、robots 之間存在互相打架的配置。
  • 内容與其他站点大量重复,或者本身就是轉载。

排查顺序建议

  1. 先在报告里抽样几條 URL,逐條確認頁面本身能否正常打開、返回碼是否正常。
  2. 如果狀態集中在“已發現”,先看站点日誌里的抓取频率和總抓取量,再看内鏈结构。
  3. 如果狀態集中在“已抓取”,把這几條 URL 的正文抽出来,和同類頁面並排比一比。
  4. 改動之後不要天天盯數字,给一到两周让抓取和重新评估跑完。
  5. 记錄改動時間和改動内容,否則後面無法判断是什么起的作用。

几個常见的誤判

  • 把未抓取当成质量問题去改内容:内容改得再好,没被訪問到就没意义。
  • 把未编入索引当成額度問题去堆内鏈:内鏈再多,重复頁面還是重复頁面。
  • 看單日資料下结论:這两種狀態會互相轉換,某天從 A 跳到 B,可能只是抓取节奏變化。
  • 把报告數字当全集:索引报告是抽样展示,數量級可參考,具体到某個 URL 要單獨查。

一個可执行的小流程

先按狀態分组,每组各取 5 到 10 條 URL 做样本。已發現的那组,重点看入口和抓取額度;已抓取的那组,重点看正文和重复度。两邊都做完一遍,再决定這一轮是優化抓取還是優化内容。混在一起改,最後往往说不清是哪一步起了作用。

收錄這件事很少靠單点動作解决。把两種狀態分開看,至少能让你知道這一轮该動的是站内结构,還是頁面本身。