在索引覆盖率报表里,有时會看到一批 URL 的狀態是“已發現,尚未抓取”。它和“已抓取,尚未编入索引”不是一回事:前者是搜尋引擎已经知道這個地址存在,但還没安排抓取任務;後者是已经抓過頁面,只是在决定要不要放進索引。理解這個区別,能避免把抓取排队問题当成内容质量問题来處理。
這個狀態在说什么
“已發現”通常来自站内連結、站点地图、外部連結或之前抓取时顺带發現的地址。搜尋引擎把這些 URL 放進待抓取队列,但队列有優先級和配額。当待抓取的地址遠多于它愿意在近期抓取的數量时,一部分 URL 就會一直停在“已發現”狀態。
所以這個狀態本身不是惩罚,更像是一種排队信号:搜尋引擎認為這些頁面暂时不值得優先消耗抓取资源。站点能做的,是让重要的頁面看起来更值得優先抓取,同时减少不重要的頁面占用队列。
积压常见的几類原因
- URL 數量超出抓取能力。站点新增頁面速度快,或者參數、篩選、排序组合生成了大量地址,抓取队列被低價值入口填满。
- 新頁面没有站内入口。URL 只寫在 sitemap 里,站内没有任何連結指向它。没有内鏈支撑的地址,通常會被排在後面。
- 頁面重复或内容單薄。同一套内容用不同參數、不同排序生成了多個地址,搜尋引擎需要花時間判断哪一個才值得抓。
- 服務器回應不稳定。超时、5xx 或频繁限流會让抓取速度下降,队列消化得更慢。
處理顺序:先分類,再動手
不建议把所有“已發現”的 URL 都当成必须马上抓取的對象。先按頁面價值分一下:
- 核心頁:产品、服務、主要栏目、重要文章。這類頁面需要有稳定的内鏈入口,並出現在 sitemap 中。
- 長尾頁:有獨立内容、能被搜尋需求命中的頁面。可以保留,但不必强求全部快速抓取。
- 试驗頁:临时活動、測試參數、重复篩選。這類頁面如果不需要收錄,最好用 robots.txt 或 noindex 明确排除,减少它們進入待抓取队列。
分類之後,優先處理核心頁的抓取入口,再考虑長尾頁的补充。试驗頁的重点不是“让它被抓”,而是“让它不占用抓取资源”。
可以立刻做的几件事
- 补内鏈入口。把核心頁連結放進栏目導航、相關推荐、列表頁或文章正文中,尽量让連結出現在离首頁較近的位置。
- 收敛站点地图。sitemap 只保留希望被索引的 URL;把參數頁、重复頁、已失效頁從 sitemap 中移除,避免繼續扩大队列。
- 清理重复入口。检查篩選、排序、追踪參數是否生成了大量可抓取地址。能用 canonical 合並的合並,该屏蔽的屏蔽。
- 检查服務器表現。看抓取日誌里是否出現大量超时或 5xx。如果服務器响應慢,先解决稳定性,再谈抓取频率。
不建议做的事
反复提交 sitemap、短時間内大量堆外鏈、或者把所有 URL 都塞進“優先抓取”的幻想里,通常不會让队列加快多少。搜尋引擎會自己判断抓取優先級,站点能做的是减少干扰項,而不是制造更多信号。
抓取积压更像一個排队問题:重要的頁面要排到前面,不重要的頁面不要占位置。把這两件事做好,比反复催促更有效。
观察节奏
調整之後,不要每天盯着狀態變化。可以按周看抓取日誌:核心頁的抓取次數是否增加、服務器错誤是否减少、新頁面從“已發現”轉為“已抓取”的時間是否缩短。如果两三周後核心頁仍在积压,再回头检查内鏈深度、sitemap 范围和服務器响應。收錄和抓取都需要時間,观察趋势比盯單個 URL 更有意义。