很多人把“收錄數量”当成一個可以盯住的指标,但這個數字本身包含的信息量很低。同一批頁面,今天多两條明天少三條,可能只是索引在正常調整;真正需要處理的問题,往往藏在“應该被收錄却没被收錄”的那一小撮頁面里。想判断站点健康度,比起看總量,更實用的是先把頁面分好類,再算一個能横向比較的收錄率。
為什么“收錄數量”這個數字不能直接用
搜尋引擎给出的已编入索引數量是一個估算值,統計口径不公開,也不保證稳定。它會受到抓取周期、索引分层、頁面合並等因素影响。拿它做趋势參考可以,但用它推導具体動作,通常會得出错誤结论。比如總量下降,可能是删掉了一批參數頁,反而是好事。
第一步:先划定“應该被收錄”的頁面集合
把一個站点的頁面按功能分成三類:
- 必须收錄:核心内容頁、栏目入口頁、有獨立價值的聚合頁。
- 可以收錄:有内容但同质化較高的列表頁、多頁内容的後續分頁。
- 不该收錄:篩選參數頁、排序结果頁、站内搜尋结果頁、測試頁、登入後頁面、重复的打印頁。
只有第一類和部分第二類,才應该進入收錄率的計算。把第三類也算進去,只會得到一個永遠偏低的數字,然後逼着自己去做無意义的提交。
第二步:把不该收錄的頁面真正挡住
把它們分出来只是第一步,配置层面也要跟上。常见做法是按情况選擇:
- 篩選、排序、追踪參數造成的重复 URL,用 canonical 收口到主版本。
- 站内搜尋结果頁、登入後頁面,用 robots 或 noindex 明确挡掉。
- 已经没有意义的歷史頁,處理成 404 或 410,不要再统一重定向到首頁。
這一步没做完,後面統計出来的收錄率都是被污染的。
第三步:算一個可以横向比較的收錄率
不用全站統計,成本太高也没必要。按目錄或按模板抽样即可,比如從内容頁目錄里随机取 50 到 100 條 URL,逐條確認是否在索引中,再算比例。
查询方式上,site: 命令适合快速判断,但不精确;URL 检查工具顯示的狀態更接近真實情况,但一次只能看一條。两者结合用:前者筛異常,後者做確認。
收錄率是一個内部對比指标。同一個站点不同目錄之間比、同一目錄不同時間比,才有參考價值,跨站比較意义不大。
第四步:把未收錄頁面按原因分開
剩下的未收錄頁面,原因差別很大,處理方式也完全不同:
- 已發現未抓取:站内連結有入口,但抓取優先級不够。可以补内鏈、從更高權重的頁面導流,或放進 sitemap 提醒。
- 抓取過但未编入索引:通常是内容层面的判断,頁面太薄、和別的頁面高度重复、缺少獨立價值。
- 被規則挡掉:noindex、robots、canonical 指向了別處。這是配置問题,改完還要等重新抓取。
- 返回異常狀態:404、软 404、超时。先修服務端和狀態碼。
把這四類混在一起看,就會出現“我明明提交了為什么不收錄”這類無從下手的問题。
几個常见的判断誤区
把收錄率 100% 当成目标
正常站点本来就有一部分頁面不會被收錄,尤其是分頁和聚合頁。追求满額收錄,往往會把精力花在低價值頁面上。
只看總量,不看结构
總量持平,可能内部已经換了一批:舊内容掉出索引,新内容补進来。只看總數看不出這個變化,按目錄分组看才能發現。
一個可以固定执行的检查顺序
- 鎖定一個固定的頁面集合(比如内容頁目錄),不要每次都換样本。
- 抽样 50 到 100 條 URL,记錄目前狀態。
- 對未收錄頁面逐條归類,落到上面四類中。
- 只针對“應该收錄但没收”的頁面動手:补内鏈、改内容、修配置。
- 记錄改動日期,隔 4 到 6 周再抽样一次,對比同一集合。
這样做的好處是,你得到的不是一個每天都在跳動的數字,而是一组能對應到具体動作的頁面清單。收錄這件事,能落地的部分從来都是“哪些頁面该進来、哪些不该進来”,而不是總量本身。