做站点运营的人常被一個問题绕住:站点到底收錄了多少?但直接問“收錄率是多少”往往得不到有用答案,因為分子和分母都可能算错。把三個數字分別理清——站点總 URL、可索引 URL、已收錄 URL——對帳才有意义,後面的判断也不會跑偏。
為什么先要把分母分開
如果把所有歷史 URL 都塞進分母,收錄率看起来永遠很低;如果只統計最近一批 sitemap 里的地址,比例又會虚高。分母定义不同,结论完全不同,所以要做的第一件事不是去查收錄狀態,而是先把口径寫下来:統計范围是什么、排除哪些、多久跑一次。
三個數字分別怎么取
站点總 URL:以站内連結图為主
優先從内鏈结构出發統計:從首頁開始,顺着站内連結能到達的 URL 集合。這比只看 sitemap 更接近蜘蛛實际能發現的范围。sitemap 可以作為补充来源,但两份資料要合並去重,否則同一頁面會被重复計算。
可索引 URL:總 URL 减去明确排除的部分
這一步的难点不在技術,而在取舍。常见需要排除的包括:
- 被 robots.txt 拦截的目錄,比如後台、接口路径
- 带 noindex 的頁面,例如搜尋结果頁、空结果頁
- canonical 指向別處的重复頁
- 由參數组合生成的排序、篩選變体
- 登入後、购物车、會话相關的動態頁面
减完之後剩下的,才是“應该被收錄”的量,也就是對帳时真正该用的分母。這個數字一旦确定,就不要频繁改口径,否則前後两次統計没有可比性。
已收錄 URL:多来源交叉驗證
查询语法、索引狀態报告、服務器日誌里的蜘蛛抓取记錄都可以用,但各自的誤差也很明顯:站点查询覆盖不全,日誌只能說明被抓過、不代表進了索引,索引狀態报告给出的往往是抽样结果。几個来源取並集,再從中抽一部分頁面人工核對,结论會稳得多。要注意日誌里的抓取记錄和最终索引狀態是两件事,別混着算。
對帳之後,差异通常落在三档
把三個數字摆在一起,一般會出現三档落差,每一档對應的問题不同:
- 總 URL 明顯大于可索引量:說明站内存在大量本就不该被收錄的地址,先检查參數、篩選頁和内鏈是否把無關連結铺得到處都是。
- 可索引量大于已收錄量:說明有頁面提交了却没進索引,優先看内容是否單薄、是否與其它頁面高度重复、是否長期没有内鏈入口。
- 已收錄里混着不想收錄的頁面:多半是屏蔽手段没對上,noindex、robots.txt、canonical 各自的作用范围需要重新確認。
一套可以定期跑的對帳流程
- 固定統計周期,比如每月一次,避免用零散資料下结论。
- 導出站内連結图,合並 sitemap,去重得到總 URL 清單。
- 按既定規則剔除明确排除的地址,得到可索引清單。
- 用索引狀態报告和站点查询取並集,得到已收錄清單。
- 計算两個比例:可索引量 / 總量、已收錄量 / 可索引量。
- 從“已可索引但未收錄”里抽 20 到 50 條頁面,逐條看内容、内鏈、重复度。
- 把本次结论和新發現的排除項寫回規則文件,下次統計沿用。
流程本身不复杂,麻烦的是坚持同一口径。很多人每次都用不同的方法取數,结果就是每個月都在重新解释一遍數字。
別把覆盖率当成 KPI
覆盖率是一個诊断指标,不是目标。把比例做高最省事的办法是拼命扩充分母,或者把大量低價值頁面也送進索引,這對搜尋表現没有帮助。真正值得盯的是:應该被收錄的頁面有没有都進来,不该進来的有没有被挡住,以及新頁面從被發現到進入索引的节奏是否稳定。
收錄對帳的價值不在那個百分比,而在于它能告诉你下一件该做的事是什么:是清理參數連結,還是补内容,還是調整屏蔽策略。