“這個頁面收錄了吗?”很多团队的預設動作是打開搜尋框敲一下 site 命令。它方便,但只适合当线索,不适合当结论。把 site 查询结果直接等同于索引库,是收錄排查里最常见的一類偏差。
site 查询到底在回答什么
site 查询返回的是一组與查询條件相關的估算结果,不是索引資料库的快照。它通常只列出搜尋引擎認為值得在這次查询里展示的頁面,數量是粗略值,翻到後面還會出現缺漏、重复或顺序错乱。
- 查询结果會受地域、語言、個性化因素影响,換網絡环境可能看到不同的頁面。
- 權重低、层級深、内容單薄的頁面,即使已经在索引里,也未必出現在结果前几頁。
- 被判定為重复或备用版本的 URL,可能被折叠,改由規范版本出面展示。
所以,site 查询查不到,只能說明“這次没展示出来”,不能直接推出“没被收錄”。
更接近事實的几種口径
- 後台索引报告:會区分“已编入索引”“已發現但未编入索引”“已抓取但未编入索引”,另有重复網頁、备用網頁等狀態,适合看整体分布。
- URL 检查工具:针對單條 URL 查询,能看到最近一次抓取時間、規范版本判定以及是否在索引中,适合抽样核對。
- 服務器日誌:能確認“有没有被抓”,但不能證明“有没有進索引”。
容易踩的几種誤判
- 頁面其實被收錄了,但規范版本指向另一條 URL。查询原地址查不到,問题不在收錄,而在 URL 归並。
- 頁面确實在索引里,只是因為搜尋词不匹配而不展示,這属于排序與選擇問题,不是索引問题。
- 後台顯示“已抓取但未编入索引”,這條 URL 被抓過,只是没有通過後續评估,把它当成“没抓”會做错動作。
- 參數頁、分頁頁、篩選頁的狀態與主頁面並不同步,混在一起統計會让整体數字失真。
抓取與收錄不是一回事
抓取解决的是“搜尋引擎有没有把内容讀走”,收錄解决的是“讀完之後要不要放進索引並允许展示”。前者受 robots 协议、服務器响應、内鏈入口影响,後者還要看内容是否重复、是否满足基本质量要求、是否有明确的規范地址。日誌里满屏的抓取记錄,只能說明内容被讀到了。
建议的自查顺序
- 按模板選一批代表性 URL:首頁、栏目頁、内容頁、分頁、參數頁各取几條。
- 對照後台索引报告,把狀態分類记錄,不要只看總數。
- 用 URL 检查工具逐個查看規范地址、最近抓取時間與索引狀態。
- 核對頁面本身是否有清晰的标题、正文、内鏈入口與規范标记。
- 把结果留档,隔两到四周再看趋势,單次结果波動參考價值有限。
收錄狀態由搜尋引擎判断,运营能做的是把信号讲清楚:让重要頁面容易被發現、内容不重复、規范地址稳定,而不是反复催结果。
site 查询可以留作快速感受,但判断收錄时,用後台报告加 URL 检查的组合口径更稳妥。把“查不到”拆成没被抓、抓了没编入、编入了但換了地址、编入了但不展示這几種情况,後續的排查方向會清晰很多。