做站点运营的人,几乎都遇到過這種场面:昨天 site 查询還有八千條,今天只剩六千多條,後台没有任何改動,第一反應往往是“是不是被惩罚了”。多數情况下,收錄量的起伏属于索引的正常维護,和惩罚没有必然關系。
先接受一件事:收錄量本身不是精确數字
site 查询给出的數字,本质上是一個抽样估算,不是後台帳本。不同資料中心、不同時間点查到的结果都可能不一样,差個百分之十几很常见。把它当成绝對值去對比昨天和今天,本身就容易得出错誤结论。
更關键的是,索引里的頁面是分层的。有些頁面處在临时区,随时可能被替換;有些頁面只是被發現,還没正式進入索引;有些頁面收錄了但長期没有展示。這些狀態在收錄量上混在一起,單看數字看不出区別。
這些波動通常不用處理
- 新頁面進進出出:新 URL 被收錄後又消失,過几天再出現,在内容偏少的頁面上尤其常见,蜘蛛還在评估它该不该長期留在索引里。
- 老頁面重抓後短暂消失:蜘蛛重新抓取时,頁面會短暂處于待更新狀態,抓取完成、内容確認後一般會回来。
- 站内结构調整带来的少量掉量:改導航、改分頁、合並栏目,内鏈入口變化會让一部分 URL 的抓取频率下降,收錄随之波動。
- 抓取失敗的临时重试:服務器偶發 5xx 或超时,蜘蛛這次没抓到,不等于頁面被刪除。
判断标准可以简單一点:掉的是不是零散頁面、几天内能不能自然恢复、核心頁面還在不在。三個條件都满足,優先观察,不要急着改頁面。
這些信号出現,就该動手排查
真正需要處理的波動,通常有明确形態:
- 同一目錄、同一套模板生成的 URL 在几天内成批消失,而不是零散掉几條;
- 首頁、栏目頁、核心詳情頁這類入口型 URL 從索引里消失;
- 服務器日誌中 5xx、超时、连接被拒的比例明顯上升;
- robots.txt、canonical、meta robots 在近期有過改動;
- 頁面模板改版後,正文變成必须执行脚本才能出現的内容;
- 站内出現大量空壳頁、參數頁、搜尋结果頁,把抓取引向了低價值 URL。
收錄量下降本身不是問题,抓取到索引這條鏈路上某個环节断了才是。先定位断点,再决定要不要改内容。
一套固定的排查顺序
- 看日誌狀態碼分布:5xx 和超时是否集中出現、集中在哪些目錄。這一步能排掉大部分服務器侧原因。
- 確認抓取規則:robots.txt 是否被誤改,是否有整段規則覆盖了正常目錄。
- 检查索引指令:抽查若干消失的 URL,看 canonical 是否被模板统一改错,meta robots 是否被带上了 noindex。
- 驗證渲染结果:用抓取工具查看蜘蛛拿到的 HTML,正文是否完整,還是只剩一個空容器。
- 最後再看内容與重复度:同一批頁面是否高度相似,是否只是參數不同、排序不同的同一份内容。
用固定口径记錄,而不是每天刷新
建议准备一份 30 到 50 條的抽样 URL 清單,覆盖首頁、栏目頁、詳情頁、分頁,每周用同一種方式检查一次,记錄收錄狀態、最近抓取時間和返回碼。观察两到四周,趋势會比單日數字可靠得多。
同时把“收錄”和“展示”分開记錄。收錄量稳定但自然流量下滑,問题往往在關鍵詞覆盖和点击表現上,和索引维護是两件事。
索引本身就是一個持續更新、允许试错的地方。小幅波動是它的工作方式,不是發给你的信号。真正需要動作的,是那些形態明确、能定位到具体环节的變化。