很多人判断站点收錄情况,第一反應是在搜尋框里輸入 site:example.com。數字涨了高兴,跌了紧張。但 site: 返回的是一次检索结果,不是後台索引库的導出清單,两者之間存在系統性偏差。把它当趋势參考没問题,当成精确計數就會誤判。
site: 返回的到底是什么
site: 是一種查询语法,作用是在索引里按域名做過滤,再按相關性和一系列過滤規則返回一部分结果,並给出一個估算總數。這個總數是近似值,不是資料库里的行數。
- 结果數通常是估算並取整,不精确
- 同一域名下被判定為高度相似的頁面可能被折叠展示
- 结果頁自身會去重、聚類、做内容安全過滤
- 不同時間、不同地区、不同设备查,數字可能不一样
為什么這個數字會偏低
- 索引里确實存在,但和 site: 這個空泛查询的相關性太低,没被召回
- 頁面被标為备用版本,不再單獨占一條结果
- 深层頁面權重低,排在几百條之後,翻頁根本翻不到
- 站点有大量模板化相似頁,被折叠成一條展示
為什么這個數字會偏高
- 大小寫、斜杠、參數、协议不同造成的重复 URL 各算一條
- 已经下线但索引還没清理干净的舊地址仍挂在结果里
- 被视為低质或已排除的頁面偶尔也會露头
所以這個數字同时受“漏报”和“多报”影响,方向不固定,用它来判断收錄是涨是跌,本身就带噪声。
更接近實际的几種查法
想了解真實收錄量,站長後台通常比 site: 更靠谱,因為它是從索引侧给出的統計:
- 站長平台:Google Search Console 的頁面索引报告、百度搜尋资源平台的索引量工具,會给出“已编入索引”的頁面規模,也能看到被排除的頁面和原因。
- 服務器日誌:能看清蜘蛛實际抓了哪些 URL、返回什么狀態碼、多久抓一次。它反映的是抓取层,和收錄层要分開看。
- 线上 URL 對帳:導出實际线上地址,和 sitemap、索引报告逐條比對,找出“线上有但没被抓”“抓了但没進索引”的差集。
- 單條精确搜尋:拿頁面的獨特标题或一段獨有句子去搜,看回来的地址是不是你想要的這一個。
判断單個頁面有没有收錄
查具体頁面时,別再用 site: 整站,那只會给你一堆無關结果。正确做法是取這個頁面最獨特的一句话做精确查询:如果搜到的是你這個地址,說明它進了索引;如果搜到的是別的站点或別的地址,說明這個 URL 没被選為代表版本;如果什么都搜不到,說明還没進索引或已经掉了。
同一個頁面出現两個地址怎么办
搜出来两個地址都指向同一内容,說明規范頁没被明确。先確認 canonical、内鏈和 sitemap 里给的是同一個地址,再观察一段時間,別急着反复改動。
site: 的數字适合看趋势,不适合当對帳表。用它做月度记錄可以,用它判断某條頁面在不在索引里,几乎一定會得到错誤答案。
怎么用好這些數字
- 每周或每月固定记錄一次,看長期曲线,而不是每天盯着看
- 關注突然的大幅變化,小幅波動先观察
- 结合日誌里的抓取量一起看,抓取和收錄是否同步變化
- 记住收錄數增加不等于流量增加,還要看頁面是否被召回
與其纠结 site: 少了几條,不如把精力放在頁面质量、URL 規范和内鏈结构上。這些是能自己控制的輸入,而索引里最终呈現什么,是搜尋引擎根據這些輸入自己决定的。