同一批頁面,在 A 搜尋引擎里能搜到,在 B 里怎么都找不到;或者反過来。遇到這種情况,很多人的第一反應是某一邊出了問题。但更常见的情况是:两邊都没出問题,只是判断标准不同。
各家的索引是各自獨立建的
每個搜尋引擎有自己的爬虫調度、抓取资源分配、頁面质量评估和索引存储。同一張頁面在一家被認為值得收錄,在另一家可能刚好卡在阈值之下。這不是谁對谁错,而是規則和资源分配方式不同。
所以核對收錄时,先接受一個前提:不存在一個统一的真實收錄數。你能拿到的,只是各家在自己索引里的判断结果。
差异往往集中在几類頁面上
- 内容偏薄、正文少于模板文字的頁面,各家的容忍度差別最大。
- 篩選、排序、參數组合類 URL,一家可能收几個代表頁,另一家可能一個都不收。
- 新發布的頁面,抓取排期不同,時間差可能有好几天。
- 依赖 JS 渲染才有正文的頁面,渲染能力的差异會直接反映到收錄上。
- 经歷過大改動的老頁面,一家可能還留着舊版本,另一家已经換成新版本。
核對时容易踩的誤判
第一是用 site: 语法直接横向對比數量。它给的是估算值,各家语法覆盖范围和匹配方式都不一样,拿来比大小意义不大。
第二是把日誌里的抓取次數当成收錄信号。抓取多說明蜘蛛愿意来,不代表頁面進了索引。抓取和收錄是两层判断。
第三是只看一家的站長平台报告就下结论。各家資料口径不同,一家标為已排除的原因,另一家可能压根没记錄這條。
一個可执行的核對流程
- 固定一份样本 URL 清單,二三十條即可,覆盖首頁、栏目頁、詳情頁、參數頁几種類型。
- 分別在几家引擎里查這批 URL,逐條记錄结果和查询日期。
- 翻服務器日誌,按 UA 区分是哪家蜘蛛来的、抓了哪些 URL、返回什么狀態碼。
- 把日誌结果和查询结果對照,分出抓了没收錄、没抓也没收錄两類各有多少。
- 隔两三周用同一份清單再查一遍,看趋势變化,而不是看單次快照。
差异大的时候先做什么
不要先去追某一家引擎的具体原因,先處理共性規范:canonical 是否统一、robots 是否誤挡、重要頁面是否有能被抓到的内鏈入口、正文是否在初始 HTML 里就存在。這些修完,几家的结果通常會一起變好。
共性規范没問题、差异依然明顯时,再回到内容本身看:這個頁面相比站内同類頁面,是否提供了別處没有的信息,還是只是換了套模板重复一遍。各家在這件事上的判断趋同度,其實比想象中高。
抓取是抓取,收錄是各家自己的判断。核對时把這两层分開,能省掉很多無效排查。
最後提醒一句:不要把某一家引擎的收錄结果,当成全站健康度的唯一指标。多引擎之間的差异本身,就是一次免費的頁面质量反馈。