做收錄排查时,抓取、索引、能被搜到這三件事经常被当成同一件事。實际上它們分属不同阶段,出問题时的信号和核對方式也不一样。分清楚卡在哪一段,比反复提交 URL 更有用。
三個阶段的差別
抓取:蜘蛛把頁面下载了
抓取是可观察的動作:蜘蛛請求了某個 URL,服務器返回了内容,日誌里留下记錄。抓到只說明内容被取走,不代表内容被接纳。日誌有訪問、狀態碼是 200,只能證明抓取這一环是通的。
索引:内容被解析並建立條目
抓到的内容會被解析、去重、做质量與規范化判断,再决定是否建立索引條目。這一步常见的结果有三種:正常建立、以另一個 URL 為准(規范化到別處)、被忽略。頁面被抓過很多次却始终没有索引狀態,通常卡在這里,而不是抓取环节。
能被搜到:查询时被召回
即使建立了索引條目,也不代表某個具体查询一定會展示它。相關性、同類頁面數量、内容时效都會影响结果。搜某個词搜不到,可能是展示层面的問题,而不是頁面根本没被收錄。
各自的核對方式
- 抓取:看服務器日誌或抓取統計里的請求记錄,重点關注狀態碼、時間分布和請求的 URL 類型。
- 索引:用站長工具類的 URL 检查,或用 site: 加上完整地址做粗判。注意 site: 的结果數是估計值,不适合当准确收錄量。
- 能被搜到:用頁面上獨有的長句去搜,比用短關鍵詞更接近真實情况。
三種方式各有誤差,交叉驗證比單看一個數字更可靠。特別是收錄量這類指标,不同工具的統計口径本来就不一致,看趋势比看绝對值有意义。
建议的排查顺序
- 先確認有没有抓取记錄。完全没有請求,問题在發現入口,比如内鏈位置、站点地图、外部連結。
- 有抓取但没索引,再看頁面本身:主内容是否完整、是否與站内其他 URL 高度重复、可索引信号是否寫對。
- 有索引但搜不到,回到查询本身:換用頁面獨有句子測試,並接受展示位置本身就有波動。
把抓取量、索引量、搜尋可见度当成三個獨立指标来看,比混在一起讨论“收錄好不好”更容易找到下一步動作。
几個常见誤区
- 把日誌里的蜘蛛請求數当成收錄數。
- 把 site: 结果數当成精确收錄量,並據此判断涨跌。
- 認為進了索引就等于有排名,把两類問题混在一起處理。
- 頁面被抓取過一次,就預設收錄這件事已经完成。
收錄是一條分段鏈路,每一段的判断依據不同。與其反复提交,不如先确定目前卡在哪一段,再针對那一段做動作。多數时候,定位准确比操作數量更能推動结果。