很多运营同学會把“收錄率”当成一個健康分:算出来 90% 就松口气,只有 40% 就急着改頁面。但收錄率本身並不是客观事實,它取决于你把哪些 URL 放進分母、用哪種方式統計分子。定义不同,同一個站点可以算出 40%,也可以算出 90%。所以第一步不是看數字高低,而是先把這两個數定义清楚。
分母:哪些 URL 有资格被算進来
分母應该是“你真正希望被收錄的 URL 集合”,而不是資料库里的地址總數。
- 带篩選、排序、追踪參數的 URL,如果已经用 canonical 或 robots 收口,就不该進分母。
- 登入頁、购物车、搜尋结果頁、測試頁、後台路径,本来就不打算進索引,算進去只會拉低數值。
- 已 301 跳轉的舊地址、返回 404 或 410 的地址属于歷史遗留,不该和正常頁面混在一起。
- 同一内容的分頁、打印版、站内镜像,如果策略是只保留主版本,其余也不計入。
實际做法分两层:先算出全站候選 URL 數,再减去明确排除的類別,得到“目标收錄集合”,這個數才是分母。分母變小,收錄率會上升,但這不是自欺欺人,而是把指标對准了真實目标。
分子:已收錄數量至少用两種方式交叉看
没有一種方法能给出绝對准确的已收錄數量,各自都有偏差:
- site 查询:數量級參考,不同時間、不同地区结果差异明顯,還會漏掉部分頁面,不宜当作精确值。
- 站長後台的覆盖或頁面报告:按“已编入索引”分组統計,相對更接近真實,但更新有延迟,也會合並部分近似 URL。
- 日誌加抽样:從日誌里挑一批典型 URL,逐個確認索引狀態,再按比例推算。样本要覆盖不同模板和层級,否則誤差很大。
把三種结果放在一起,如果數量級接近,說明判断基本可靠;如果相差几倍,先別下结论,去查是哪一類 URL 被不同工具重复或漏算。
收錄率多少算正常
没有通用标准。影响因素包括站点体量、模板化程度、内容更新频率和外鏈情况。更值得關注的是两個信号:同一批新頁面在數周内的收錄進度是否接近;收錄率随時間是在稳定、上升還是持續下滑。跟自己的歷史比,比跟別人的绝對值比更有意义。
收錄率偏低时的排查顺序
- 先確認分母里有没有混入不该算的 URL。這一步经常就能解释掉大部分差距。
- 检查被排除的那批 URL 是否真的按策略失效:该返回 410 的没返回,该 noindex 的漏了标簽。
- 看未被收錄的頁面集中在哪個模板或目錄。如果是某個栏目整体不收,問题多半在模板或内容结构,而不是單頁。
- 看這些頁面有没有站内入口。只有 sitemap 没有内鏈的頁面,被發現的速度會明顯慢。
- 核對内容是否與站内其他頁面高度重合。近似内容過多时,往往只會留下其中一版,其余長期不收錄。
- 最後再看抓取层面的問题:响應時間、错誤率、是否被 robots 拦住。
別只看總數,看结构
收錄率是聚合數,容易掩盖局部問题。同样是 70%,可能是所有栏目都均匀漏掉 30%,也可能是核心栏目正常、長尾栏目大面积不收。後者通常不用太慌,前者值得查。建议按目錄、按模板、按上线時間分批統計,找出差异最大的那一组。
回到開头:收錄率的價值在于帮你發現異常、定位方向,而不是给你一個可以攀比的分數。把分母定准,把分子交叉驗證,再按结构拆開看,這個指标才真正能用得上。