在搜尋後台的索引报告里,常能看到一種狀態:URL 已被發現,但尚未抓取。它和“已抓取但未编入索引”是两回事。前者說明搜尋引擎知道這個地址存在,只是還没去讀它;後者說明已经讀過,但判断不值得進索引。把這两種情况混在一起處理,往往白忙一场。
這個狀態意味着什么
搜尋引擎發現 URL 的途径主要有三種:站内連結、Sitemap、外部連結。發現之後,地址會進入待抓取队列。队列不是先到先服務,而是按预估價值和抓取成本排序。所以出現“已發現但未抓取”,通常說明两件事之一:這個地址在队列里排得很靠後,或者站点整体可用的抓取額度被別的地址占满了。
先分清三種情况
一、正常的排队
新站、新目錄、刚上线的内容,被發現後等几天到几周才被抓取很常见。如果這類 URL 數量不多,而且都是你真正想要的頁面,一般不需要額外操作,把内鏈和 Sitemap 补好即可。
二、額度被低價值 URL 占用
当站点存在大量參數頁、篩選頁、站内搜尋结果頁、重复列表頁时,搜尋引擎會把抓取額度花在這些地址上,真正重要的頁面反而排在後面。典型表現是:日誌里抓取量不小,但抓的多是不重要的地址,新頁面迟迟轮不到。
三、抓取被技術問题挡住
服務器响應慢、频繁返回 5xx、請求超时、限速過嚴,都會让搜尋引擎降低抓取频率。這種情况下即使 URL 已经被發現,也可能長時間停在“未抓取”。先修服務器,比改内容更有效。
常见的額度浪費来源
- 站内搜尋、排序、篩選參數生成的大量 URL
- 标簽頁、归档頁、日歷頁的無限翻頁
- 已刪除但内鏈還指向的地址,走一次跳轉再落到 404
- 重定向鏈,例如 A 跳 B、B 又跳 C,每次跳轉都消耗一次請求
- 同一個列表頁的多個近似版本,内容差別很小
按顺序排查
- 看服務器日誌:抓取集中在哪些目錄,平均响應時間多少,5xx 占比多少。
- 看重要頁面的内鏈:能否從首頁两三跳内到達,锚文本是否有意义。
- 收紧 Sitemap:只提交你希望被索引的規范 URL,不要全量塞進去。
- 核對 robots.txt:確認没有誤屏蔽 CSS、JS 或整段目錄。
- 控制生成端:站内搜尋、篩選、排序類頁面加 noindex,或者干脆不生成可抓取的連結。
- 處理重定向鏈:把多跳合並成一跳,直接指向最终地址。
抓取和收錄不是一回事
被抓取只代表頁面被讀過了。是否進索引,還要看内容质量、重复程度和頁面本身的用途。抓取額度理顺之後,“已發現但未抓取”的數量會下降,但“已抓取但未索引”未必跟着解决,後者要回到内容和重复問题上去查。
把待抓取队列当成待办清單,先問哪些地址根本不值得被抓,再問怎么让值得的地址排到前面。
什么时候可以等,什么时候要動手
如果只有少量新 URL 停在待抓取,日誌顯示抓取节奏正常,等一两周是合理的。如果待抓取列表持續增長、日誌里却几乎看不到這些目錄,或者抓到的頁面中重要頁面的比例一直很低,就值得按上面的顺序查一遍。
最後提醒一句:不要為了让某個地址“被抓”,临时堆大量内鏈或反复提交。這類操作對抓取排序的影响有限,反而可能把更多不重要的地址送進队列,進一步挤压真正頁面的空間。