收錄這件事,很多人是盯着一個總量數字看的:涨了高兴,跌了紧張。但數字本身說明不了問题,它只是三個口径叠在一起的估算值。真正有用的是做一次對帳——把站点上真實存在的頁面、sitemap 里声明的 URL、以及索引里的记錄放在同一張表里比對,看差异出在哪一類頁面上。
為什么要對帳,而不是看總量
總量是结果,對帳是過程。總量只能告诉你“多了”或“少了”,對帳能告诉你“哪些目錄多了”“哪些模板少了”。而且抓取和收錄本来就是两件事:蜘蛛来過、返回了 200,只代表這個 URL 被發現了,不代表它進了索引。把這两层混在一起看,判断很容易跑偏。
第一步:拿到一份靠谱的线上 URL 清單
這份清單要尽量接近“站点上真實存在、且希望被收錄的頁面”。可以合並几個来源:
- sitemap:站点自己声明的范围,但要注意里面是否混了已下线或參數化的地址。
- 服務器日誌:筛出蜘蛛抓取且狀態碼為 200 的 URL,這是外部實际看到的口径。
- 爬虫工具:按内鏈走一遍,能顺带發現孤岛頁面。
- CMS 或後台導出:内容型頁面最准的一份底帳。
匯總之後先做一轮去重归一:统一大小寫、去掉末尾斜杠差异、剥掉纯追踪參數、把 http 和 https、带 www 和不带 www 归到同一個代表地址上。不做這一步,後面的比對會被大量伪差异淹没。
第二步:把索引口径拉出来對齐
索引這一侧没有唯一權威的數字来源。搜尋命令、站長後台的覆盖报告、第三方工具的收錄量,都會因為采样范围和更新节奏不同而對不上。建议的做法是:用後台报告看分類和原因,用搜尋命令做抽样驗證,第三方工具只当作趋势參考。
索引數量是估算,不是帳本。對帳的目的是找出有問题的 URL,不是让两邊的數字相等。
第三步:把差异归類,別急着動手
差异基本落在四類里,處理方式完全不同:
- 清單里有、索引里没有:可能刚發布還没被抓取,也可能被 noindex 挡住,或者缺少内鏈入口,或者頁面本身没有被收錄的理由。
- 索引里有、清單里没有:常见于已下线但没做處理的頁面、參數變体、大小寫變体、測試环境残留、改版遗留的舊地址。
- 两邊都有,但代表地址不一致:多為重复内容的归並問题,canonical 指向或站内連結指向不统一。
- 两邊都有且一致:正常狀態,不用管。
處理顺序:先收口,再补漏
顺序很重要。先把不该存在的 URL 收口——已下线的做 410 或 301,參數頁用 robots 或規范标簽约束,測試环境整段屏蔽。這一步做完,索引里的杂音會明顯减少,剩下的差异才看得清。
再處理该收錄却没收錄的頁面。按優先級检查三件事:頁面有没有可被抓取的入口(内鏈、導航、sitemap);頁面本身是否具备獨立價值,還是模板批量生成的空壳;返回的狀態和内容是否稳定。抓到問题就改問题,不要靠反复提交来催。
几個容易漏的地方
- 分頁、篩選、排序、打印頁這類由模板批量产生的 URL,往往數量大、價值低,需要按模板級別定規則,而不是一個個改。
- 标簽頁、作者頁、归档頁属于灰色地带,判断标准是它有没有獨立的聚合内容。
- 同一内容的多語言或多地区版本,要確認相互之間的對應關系寫對了,否則容易被当成重复。
- 改版或迁移之後一定要重做一次對帳,舊地址的残留常常要過一段時間才顯出来。
把它變成一件定期的事
不需要每周做,但改版後、大促前後、内容量級明顯變化时值得做一次。把每次的差异整理成表,标注 URL、類型、原因、處理動作,积累几次之後,你會發現自己站点的收錄問题其實集中在少數几個模板上。
對帳的意义不是把數字做大,而是让每一個 URL 的存在狀態都是你主動决定的:该被收錄的,入口通畅、内容立得住;不该被收錄的,有明确的規則挡住。做到這一点,收錄量的波動也就不那么让人紧張了。