site: 的數字是查询结果,不是統計报表
不少人习惯在搜尋框輸入 site: 加域名,看返回的“大约多少條结果”,把它当作收錄量。這個數字确實能反映一些情况,但它本质上是搜尋结果數,不是索引库的統計數。引擎返回的是能作為结果展示出来的頁面,中間會经過篩選、去重和折叠,和索引里實际存了多少個 URL,本来就是两回事。
差异通常来自這几處
- 结果數是估算值。同一個站,換地区、換語言、換设备再查,數字可能不一样。
- 只統計能作為结果返回的頁面。有些頁面虽然進了索引,但没有合适的查询词匹配,或被認為不适合展示,就不會出現在结果里。
- URL 變体會被折叠或分散計數。带參數的地址、多個入口指向的同一頁面,可能算成一條,也可能算成几條。
- 索引有延迟。你查到的可能是几天前的快照,刚上线或刚改動的頁面未必反映得出来。
- 站点分散在多個域名或子域时,site: 只覆盖你輸入的那一個。
搜尋控制台的索引报告是另一個口径
後台里的“已编入索引 / 未编入索引”同样不是精确到個位的統計,它通常基于抽样和估算,分類數字會浮動,也會滞後。它真正的價值在于看结构:未编入索引的頁面分別卡在什么原因上——是被 robots 挡了、是重复内容被合並了、是抓取後判定價值不高,還是根本還没被抓到。
所以两個數字對不上,多數时候不是站点出了問题,而是拿了两把不一样的尺子在量同一件事。
想判断某個頁面進没進索引,看這几点
- 直接查那個 URL。用後台的網址检查工具,或用 site: 加完整地址精确查一次,比盯着總數有用得多。
- 看服務器日誌。蜘蛛有没有抓、抓了几次、返回什么狀態碼,這些是你能拿到的一手信号。
- 看索引报告里的原因分布。重点看“已抓取,尚未编入索引”和“已發現,尚未抓取”两類占比的變化,而不是總數本身。
- 看趋势,不看單点。隔几天看一次走向,比每天盯一個波動的數字可靠。
两個容易踩的坑
數字一降就急着改站
收錄數字的短期波動,可能只是查询抽样變化或索引更新。這個时候批量改标题、改内鏈、加大推送,反而會把本来正常的頁面搅乱。先確認是不是真有一批 URL 從索引里消失了,再决定要不要動手。
拿 site: 數量和別的站比
不同站点的規模、结构、内容量都不一样,這個數字既不适合横向比較,也不适合当成考核指标。對内做趋势參考可以,對外做對比基本没有意义。
收錄相關的數字大多是估算。與其追一個精确值,不如盯住具体頁面:它被發現了没有、被抓了没有、抓完之後發生了什么。
一個简單的自查顺序
- 挑几個有代表性的 URL,逐個確認索引狀態。
- 對照日誌,看這些 URL 最近有没有被抓取。
- 在索引报告里看它們落在哪個分類,原因是什么。
- 把同類問题的頁面归到一起成批處理,別一頁一頁改。
- 改完之後隔一段時間再看趋势,不要当天就下结论。
收錄這件事很少一步到位。工具给的是线索,不是结论;把线索落到具体 URL 上,才知道下一步该做什么。