做收錄排查时,最容易犯的错是把“收錄量”当成一個可以單獨解讀的數字。它涨了不一定說明變好,跌了也未必是出了問题——總量受栏目改版、URL 變更、歷史頁面堆积的影响很大。真正有用的做法,是用一份可控的抽样清單,在同一批 URL 上反复观察狀態變化。
為什么只看總量看不出問题
收錄總量是结果,不是過程。它由無數個頁面的狀態匯總而成,任何一次结构調整都會把它拉高或压低。比如把一批分頁 URL 合並、把舊活動頁清理掉,回收的索引量可能是几千條,但這跟站点健康度没什么關系。反過来,總量平稳的时候,也可能是一批核心頁面掉出索引、另一批低质頁面补進来。
先确定一份可重复使用的抽样名單
抽样要分层,不是随便抓几個 URL。按栏目、頁面模板、發布時間各切一刀,每一层取 20 到 50 個就够用。
- 按模板分:詳情頁、列表頁、专题頁、帮助文档,各取一组。
- 按新舊分:最近 7 天發布、30 天前發布、改版前的歷史頁面。
- 按入口分:首頁直達、二級栏目入口、只出現在站点地图里的。
- 把這份名單存下来並标注日期,下次核對时使用同一份。
狀態分成三類統計,別混在一起
- 已進索引:能被搜尋到,快照内容與目前版本基本一致。
- 被抓但没進索引:日誌里有抓取记錄,索引里查不到。
- 還没被抓:日誌里找不到訪問记錄,多半是入口不足。
三類占比的變化,比绝對數量更值得關注。如果“被抓未收錄”這一档在扩大,說明抓取通道是通的,問题更可能出在頁面本身;如果“還没被抓”在扩大,先查内鏈和站点地图的覆盖,而不是急着改内容。
用同一批 URL 做時間對比
單次体检只能得到一張快照。建议每隔两三周用同一份名單复查一次,记錄每個 URL 的狀態迁移:從未抓取到被抓取、從被抓取到進索引、從有索引到消失。连續三四轮下来,能看出哪些模板的頁面普遍卡在同一個环节,這比逐個頁面調優有效得多。
抽样對比看的是趋势和比例,不是精确的收錄率。不要拿它去推算“全站收錄率是多少”,那样很容易得出错誤结论。
容易造成誤判的几種情况
- site: 查询返回的數字偏差較大,只适合做粗略參考。
- 索引更新有延迟,刚發布的頁面当天查不到属于正常現象。
- 同一内容的不同 URL 版本可能互相替換,看起来像掉收錄。
- 需要登入或依赖地域的頁面,在外部查询工具里表現會失真。
把结论落到具体動作
体检的價值在于把“收錄不好”拆成可执行的問题。若卡在未被抓取,優先补内鏈入口、精简站点地图;若卡在被抓未收錄,回头看内容质量、與已有頁面的重复度,以及頁面上是否真的需要那么多參數變体。每次只改一到两項,然後等下一轮抽样结果来驗證,避免一次性大改之後分不清是哪個動作起了作用。