用 site 查询时發現某個頁面不见了,很多人第一反應是“被惩罚了”。實际上,索引本身是動態的,頁面進進出出属于常態。先分清是查询口径造成的错觉,還是頁面真的被移除,再决定要不要動手處理。
先排除“看起来消失了”
site 查询返回的是抽样和估算结果,不同時間、不同地区、不同设备上看到的數量都可能不一样。索引报告也有延迟,通常要過几天才反映最新狀態。判断某個具体 URL 是否還在索引里,更可靠的做法是直接搜尋完整 URL,或使用 site:具体URL,並在多個時間点重复確認。如果只是整站收錄量少了十几條,而目标頁仍然能被搜到,多數不需要處理。
頁面本身發生了變化
noindex、robots 或 canonical 被改错
上线新模板、調整 SEO 插件配置时,很容易把 noindex 带到正式頁面上,或者在 robots.txt 里顺手屏蔽了某個目錄。HTTP 响應头里的 X-Robots-Tag 同样會被遵守,而且比頁面里的 meta 标簽更隐蔽,排查时別只看 HTML。canonical 指向了另一個 URL,也會让目前這版從索引里退场。
服務器狀態異常
频繁返回 5xx、响應超时、DNS 解析不稳定、CDN 或防火墙拦截,都會让搜尋引擎降低抓取频率。如果長時間抓不到,已经收錄的頁面也可能被逐步移出。這類問题通常在服務器日誌和站点可用性监控里能看出端倪。
内容改動幅度過大
改版後正文大幅缩减、标题和描述被替換成模板话術、頁面被加上登入墙,都會让搜尋引擎重新评估這個 URL 的價值。合並頁面时如果直接改掉原頁面内容,而没有做跳轉,原 URL 也可能被放弃。
站点层面的原因
- 大批量清理低质頁面,比如自動生成的聚合頁、空标簽頁;
- 多個 URL 内容高度重复,搜尋引擎自行挑選保留其中一個;
- 活動頁、招聘頁、限时专题過期後不再更新;
- 站内搜尋结果頁、篩選參數頁數量失控,稀释了整体质量。
這些情况下被移除的不一定是你關心的那一條,但同一個目錄下的頁面往往會一起受影响。
一套可执行的自查顺序
- 直接訪問该 URL,確認返回的狀態碼正常,頁面内容完整;
- 查看頁面源碼中的 meta robots,以及响應头里的 X-Robots-Tag;
- 检查 robots.txt 是否屏蔽了對應路径,注意通配符寫法;
- 確認 canonical 指向的是自己,而不是其他版本或其他站点;
- 在搜尋平台的網址检查工具里看目前索引狀態和抓取记錄;
- 翻服務器日誌,確認近期是否有正常抓取,是否被拦截;
- 換一個搜尋引擎或換個地区再查一次,判断是否為個別資料中心的差异。
按這個顺序走一遍,多數問题能落到具体某一环,而不是停留在“收錄掉了”這種模糊判断上。
確認被移除之後
如果問题出在誤加的 noindex 或 robots 規則上,修正後重新提交即可,注意不要在同一天反复修改配置,否則抓取會一直看到變動中的狀態。如果原因是内容本身,需要先想清楚這個頁面是否還有獨立價值:有價值就补充内容、恢复内鏈入口;只是临时頁或重复頁,让它自然登出索引反而更合理。
收錄狀態是動態的,站点能控制的是让頁面可抓取、URL 稳定、内容有獨立價值,而不是某一條 URL 永遠留在索引里。
最後提醒一点:收錄量的小幅波動不用每天盯着看,把注意力放在抓取是否正常、重要頁面是否稳定這几件事上,比追着數字跑更有效。