很多人判断頁面有没有被收錄,只看索引报告里的數字。數字涨了就放心,跌了就慌。但报告本身是抽样和估算的结果,單看它很容易得出错誤结论。把索引报告、站内查询、服務器日誌三组資料放在一起看,才能大致還原頁面被搜尋系統處理到了哪一步。
三组資料分別在回答什么問题
索引报告:看趋势,不看绝對值
索引报告给出的“已编入索引”“已發現但未编入索引”等分類,是按样本估算的,不同時間点刷新结果可能略有出入。它的價值在于观察變化方向:某類模板的頁面连續几周從“已编入索引”滑向“已發現”,說明這批 URL 的抓取或质量出了問题。把它当成体检趋势线,而不是精确台帳。
站内查询:只能作為抽样參考
用 site 指令查某個目錄或某個關鍵詞,返回的條數经常和报告差很多。它受查询词、地域、時間点影响,结果並不稳定,也不代表全部索引。比較實用的用法是抽查具体頁面:確認某個 URL 是否以你期望的标题和摘要出現,以及是否被別的地址替代。
服務器日誌:看抓取事實,看不到索引结果
日誌能明确告诉你某個 URL 在什么時間被哪個爬虫請求過、返回了什么狀態碼、抓了多少字节。但它只能證明“被抓過”,不能證明“進了索引”。反過来,日誌里長期没有某個 URL 的记錄,基本可以判断它還没有被纳入抓取范围,這时候再纠结索引狀態意义不大。
資料對不上时的排查顺序
- 先確認頁面可訪問。用未登入、無缓存的請求測試,確認返回 200 且正文可见。如果返回 4xx、5xx 或跳到登入頁,後面的判断都不成立。
- 再查 robots 與 noindex。確認没有被 robots.txt 挡住,也没有 meta robots 或响應头里的 noindex。這两項會让頁面在索引报告里顯示得模棱两可。
- 然後看 canonical 指向。如果頁面把自己指向了另一個地址,索引里挂的可能是那個地址,站内查询自然搜不到本頁。
- 接着核對日誌。看目标 URL 近期有没有被抓取记錄。没有记錄就先解决入口問题:内鏈、站点地图、栏目路径是否可達。
- 最後對照索引报告。如果日誌顯示已抓取、robots 和 canonical 都正常,頁面仍長期停在“已發現”狀態,就要回到内容层面,检查正文是否過薄、是否與其他頁面高度重复。
建立一份可复用的核查记錄
- 按頁面模板分组记錄,而不是逐個 URL 记錄,否則量一大就失去可操作性。
- 每次核查固定看同一批样本 URL,跨時間對比才有意义。
- 记錄狀態碼、canonical 目标、最近抓取時間和目前索引狀態四項,够用且不繁琐。
- 改版、換模板、調整内鏈之後主動复查一次,這類操作最容易让收錄狀態出現波動。
三组資料的作用是互相校驗,不是互相替代。任何一组單獨看,都可能让你做出错誤的優化動作。
收錄核查的难点不在于拿到資料,而在于知道每條資料能證明什么、不能證明什么。当报告、查询和日誌给出不一致的信号时,先怀疑测量方式,再怀疑頁面本身,通常能省下不少無效改動。