網站收錄

用 site 查询的结果數当索引量:收錄核對先统一口径

site: 域名 返回的结果條數常被当成索引量,但它只是检索式给出的估算值,會受去重、地域、检索式寫法影响。這篇把後台索引报告、URL 检查、日誌和 sitemap 四個口径分開,說明各自回答什么問题,以及什么时候還能用检索式做定性確認。

網站收錄

用 site 查询的结果數当索引量:收錄核對先统一口径

很多人核對收錄时會做一個動作:在搜尋框里敲 site:自己的域名,看返回的结果條數,然後把這個數字记成“索引量”。過几天數字掉了就紧張,涨了就觉得收錄變好。這個數字确實有參考價值,但它和索引量不是一回事,两個口径混用,後面的判断几乎都會偏。

site 查询返回的是什么

site: 是一種检索式,它触發的是搜尋系統的查询结果,而不是後台的索引統計。结果頁顶部那個數字,是系統针對這次查询给出的估算结果,通常经過抽样、去重和取舍,而不是把库里所有符合條件的 URL 逐條數给你。

所以它天然带着几個特征:同一时刻不同人查、不同地区查、不同设备查,數字可能不一样;同一批 URL,检索式稍微變一下,數字也會變。它更像一個“大概有多少相關结果”的体感值,而不是一份准确的台帳。

把它当索引量,會踩哪几個坑

  • 數字被估算和截断。量級越大,展示的數字越接近一個粗略值,末尾几位往往不是真實計數。
  • 只統計能被检索到的部分。索引里存在、但因质量或策略原因不參與展示的頁面,不會体現在這個數字里。
  • 受检索式寫法影响。带不带 www、用主域還是子域、加不加路径,命中的集合完全不同。
  • 受结果去重影响。高度相似的頁面在结果里會被折叠,數量自然偏少。
  • 受地域與語言影响。不同节点返回的集合范围可能不同,跨時間對比时基准就變了。

结果就是:數字變了,你無法判断是索引真的增减了,還是查询口径、去重策略、节点差异發生了變化。用這样的數字做决策,容易把正常波動当成問题,也容易把真正的問题盖過去。

核對收錄,應该用哪几個口径

更稳的做法是分层對帳,每個口径解决一個問题:

  1. 後台索引报告:看整体趋势和原因分類,回答“有多少 URL 處在什么狀態”。
  2. 單條 URL 检查工具:抽样式驗證具体頁面的目前狀態、抓取時間和使用的 canonical,回答“這一條到底怎么了”。
  3. 站点日誌:看蜘蛛實际抓了哪些地址、返回什么狀態碼,回答“它有没有来、拿走了什么”。
  4. sitemap 與站内 URL 總表:把自己的清單和後台數字對齐,回答“差在哪些模板、哪些目錄”。
  5. 站内检索或抽样查询:只用来做定性確認,比如某個頁面是否還能被找到,不作為數量依據。
把“我搜到多少條”和“系統索引了多少條”分開记錄,是收錄核對里成本最低、收益最明顯的一步。

site 查询仍然有用的场景

不用完全弃用它,只是別把它当尺子。它比較适合做這些事:確認一個具体頁面是否還在结果里;看某個子域或目錄大概有没有被纳入;粗略感知某類内容的收錄方向。這些都属于定性判断,對绝對數字不敏感。

如果一定要记錄數字,建议固定检索式、固定地区、固定時間点,並且只和自己比,不跨口径比。同时把当天後台的實际數字一起记下来,两條线並排放,時間一長就能看出哪些波動来自查询口径、哪些来自真實變化。

一個小习惯

每次核對前先問一句:這次要回答的是“有没有被收錄”,還是“收錄了多少”。前者可以用检索式快速確認,後者必须回到後台和日誌。口径先统一,後面關于頁面质量、重复内容和 URL 規范的判断才有意义,否則很容易在一堆會變的數字上反复打轉。