在 Search Console 的頁面索引报告里,“已發現 - 尚未抓取”和“已抓取 - 尚未编入索引”是两個经常被混着看的數字。它們的中文表述很像,但指向的原因几乎不重叠。用同一套办法去處理,多半會白忙一场。
先看清两種狀態各说了什么
已發現 - 尚未抓取:搜尋引擎知道這個 URL 存在,但還没去訪問它。URL 可能来自内鏈、外鏈、站点地图或提交接口。這條记錄說明的是排队問题,不是内容問题。
已抓取 - 尚未编入索引:爬虫已经訪問過頁面,拿到了内容,但决定不放進索引。這條說明的是取舍問题——它看過了,觉得没必要留。
一句话区分:前者是“還没轮到”,後者是“看過了没要”。
已發現但未抓取:往抓取這條线上找原因
- 站点整体响應慢或经常超时,爬虫每次来都拿不到完整内容。
- 站内存在大量自動生成的低價值 URL,把抓取額度先消耗掉了。
- 新頁面入口太深,只靠站点地图提交,站内没有像样的連結指向。
- 站点地图里塞了几萬個 URL,而站点實际被抓取的速度遠低于這個量級。
- 整個站点缺少外部連結,爬虫的訪問频率本来就低。
這類情况改内容基本没用。優先做的是:把重要 URL 用站内連結接進主干、压缩無意义 URL 的數量、把服務器响應時間压下来。
已抓取但未编入索引:往内容和重复上找原因
- 頁面與站内其他頁面高度雷同,只差几個字段或几句描述。
- 正文有效信息太少,主体内容被導航、推荐、广告挤到後面。
- 頁面是模板批量拼出来的,不同 URL 之間的差异對用戶没有意义。
- 正文依赖 JS 渲染,而抓取时拿到的是空壳。
- canonical、noindex、robots 之間存在互相打架的配置。
- 内容與其他站点大量重复,或者本身就是轉载。
排查顺序建议
- 先在报告里抽样几條 URL,逐條確認頁面本身能否正常打開、返回碼是否正常。
- 如果狀態集中在“已發現”,先看站点日誌里的抓取频率和總抓取量,再看内鏈结构。
- 如果狀態集中在“已抓取”,把這几條 URL 的正文抽出来,和同類頁面並排比一比。
- 改動之後不要天天盯數字,给一到两周让抓取和重新评估跑完。
- 记錄改動時間和改動内容,否則後面無法判断是什么起的作用。
几個常见的誤判
- 把未抓取当成质量問题去改内容:内容改得再好,没被訪問到就没意义。
- 把未编入索引当成額度問题去堆内鏈:内鏈再多,重复頁面還是重复頁面。
- 看單日資料下结论:這两種狀態會互相轉換,某天從 A 跳到 B,可能只是抓取节奏變化。
- 把报告數字当全集:索引报告是抽样展示,數量級可參考,具体到某個 URL 要單獨查。
一個可执行的小流程
先按狀態分组,每组各取 5 到 10 條 URL 做样本。已發現的那组,重点看入口和抓取額度;已抓取的那组,重点看正文和重复度。两邊都做完一遍,再决定這一轮是優化抓取還是優化内容。混在一起改,最後往往说不清是哪一步起了作用。
收錄這件事很少靠單点動作解决。把两種狀態分開看,至少能让你知道這一轮该動的是站内结构,還是頁面本身。