網站收錄

URL 顯示“已發現但未抓取”:先看抓取額度被谁占用了

索引报告里的“已發現但未抓取”和“已抓取但未索引”是两件事:前者是還没去讀,後者是讀了但没被收錄。本文按排队、額度被低價值 URL 占用、技術問题挡住三條线拆開,给出日誌、内鏈、Sitemap 與生成端的排查顺序。

網站收錄

URL 顯示“已發現但未抓取”:先看抓取額度被谁占用了

在搜尋後台的索引报告里,常能看到一種狀態:URL 已被發現,但尚未抓取。它和“已抓取但未编入索引”是两回事。前者說明搜尋引擎知道這個地址存在,只是還没去讀它;後者說明已经讀過,但判断不值得進索引。把這两種情况混在一起處理,往往白忙一场。

這個狀態意味着什么

搜尋引擎發現 URL 的途径主要有三種:站内連結、Sitemap、外部連結。發現之後,地址會進入待抓取队列。队列不是先到先服務,而是按预估價值和抓取成本排序。所以出現“已發現但未抓取”,通常說明两件事之一:這個地址在队列里排得很靠後,或者站点整体可用的抓取額度被別的地址占满了。

先分清三種情况

一、正常的排队

新站、新目錄、刚上线的内容,被發現後等几天到几周才被抓取很常见。如果這類 URL 數量不多,而且都是你真正想要的頁面,一般不需要額外操作,把内鏈和 Sitemap 补好即可。

二、額度被低價值 URL 占用

当站点存在大量參數頁、篩選頁、站内搜尋结果頁、重复列表頁时,搜尋引擎會把抓取額度花在這些地址上,真正重要的頁面反而排在後面。典型表現是:日誌里抓取量不小,但抓的多是不重要的地址,新頁面迟迟轮不到。

三、抓取被技術問题挡住

服務器响應慢、频繁返回 5xx、請求超时、限速過嚴,都會让搜尋引擎降低抓取频率。這種情况下即使 URL 已经被發現,也可能長時間停在“未抓取”。先修服務器,比改内容更有效。

常见的額度浪費来源

  • 站内搜尋、排序、篩選參數生成的大量 URL
  • 标簽頁、归档頁、日歷頁的無限翻頁
  • 已刪除但内鏈還指向的地址,走一次跳轉再落到 404
  • 重定向鏈,例如 A 跳 B、B 又跳 C,每次跳轉都消耗一次請求
  • 同一個列表頁的多個近似版本,内容差別很小

按顺序排查

  1. 看服務器日誌:抓取集中在哪些目錄,平均响應時間多少,5xx 占比多少。
  2. 看重要頁面的内鏈:能否從首頁两三跳内到達,锚文本是否有意义。
  3. 收紧 Sitemap:只提交你希望被索引的規范 URL,不要全量塞進去。
  4. 核對 robots.txt:確認没有誤屏蔽 CSS、JS 或整段目錄。
  5. 控制生成端:站内搜尋、篩選、排序類頁面加 noindex,或者干脆不生成可抓取的連結。
  6. 處理重定向鏈:把多跳合並成一跳,直接指向最终地址。

抓取和收錄不是一回事

被抓取只代表頁面被讀過了。是否進索引,還要看内容质量、重复程度和頁面本身的用途。抓取額度理顺之後,“已發現但未抓取”的數量會下降,但“已抓取但未索引”未必跟着解决,後者要回到内容和重复問题上去查。

把待抓取队列当成待办清單,先問哪些地址根本不值得被抓,再問怎么让值得的地址排到前面。

什么时候可以等,什么时候要動手

如果只有少量新 URL 停在待抓取,日誌顯示抓取节奏正常,等一两周是合理的。如果待抓取列表持續增長、日誌里却几乎看不到這些目錄,或者抓到的頁面中重要頁面的比例一直很低,就值得按上面的顺序查一遍。

最後提醒一句:不要為了让某個地址“被抓”,临时堆大量内鏈或反复提交。這類操作對抓取排序的影响有限,反而可能把更多不重要的地址送進队列,進一步挤压真正頁面的空間。