做站点运营的人常被問一個問题:這個站收錄率多少?如果直接拿一個百分比回答,多半没有意义,因為不同口径下算出来的數可以差出几十個百分点。收錄率本身不是目标,它只是一個用来判断“哪里出了問题”的指标,所以先要把它定义清楚。
為什么收錄率容易算得含糊
分子分母各自都有多種取法。分母可以是站点地图里的 URL 數,也可以是全站實际存在、可訪問的 URL 數,還可以只算内鏈能到達的頁面。分子同样有分歧:是用索引量查询的结果,還是用站長工具里的已编入索引數,抑或抽样核對的结果。口径一旦混用,比如拿“站点地图 URL 數”当分母、拿“索引量估值”当分子,得到的比值只能用于内部對比,不能当作事實。
三種常见的分母口径
- 站点地图口径:只統計提交在 sitemap 里的 URL。适合观察“提交之後有没有被處理”,但站点地图本身可能過期,包含已刪除或已跳轉的地址。
- 可訪問口径:全站能正常返回 200 的 URL,包括没有放進站点地图、只靠内鏈到達的頁面。更接近“站上真實存在的頁面”,但需要爬一遍或從日誌里統計。
- 内鏈可達口径:從首頁出發,通過内鏈可以在有限层級内到達的 URL。這個口径最能反映“爬虫實际有机會發現多少”。
分子怎么數更靠谱
索引量查询的數字是估值,波動大,适合看趋势不适合看绝對值。站長工具里的頁面狀態报告提供了更细的分類,比如已编入索引、已發現但未编入索引、已抓取但未编入索引、重复網頁等,分類本身往往比總數更有價值。
如果只想得到一個能用来决策的數,抽样核對通常更實际:從每個頁型里随机抽一批 URL,逐條查询它們是否出現在索引里,得到一個分頁型的比例。样本量不用很大,但要覆盖不同目錄和不同頁型,否則容易被某一個量大的目錄带偏。
一個可复用的抽样核對流程
- 按頁型列出清單,例如首頁、分類頁、詳情頁、标簽頁、篩選頁。
- 每種頁型随机取 20 到 30 條 URL,尽量覆盖不同目錄、不同上线時間。
- 逐條核對索引狀態,记錄三類结果:已收錄、已發現未收錄、未收錄且未發現。
- 對“未收錄”的样本,回去核對内容完整度、内鏈入口數量、頁面是否有規范問题。
- 把结果按頁型匯總,找出哪一種頁型的收錄比例明顯偏低。
這样做的好處是,结论落在具体頁型上,而不是一個笼统的百分比。“詳情頁收錄一般,但篩選頁几乎不進索引”這種结论,比“收錄率 62%”有用得多。
數字出来之後怎么用
如果發現“已發現但未编入索引”的比例高,問题通常不在被發現,而在于頁面本身是否值得索引,或者内容與已有頁面重复度太高,這时優先检查内容與重复情况。如果“未發現”的样本多,說明 URL 的發現路径有問题,要回到内鏈和站点地图。如果只是索引量數字没怎么變,但流量结构變了,那可能是展示和排序层面的問题,和收錄不是一回事。
收錄率是诊断用的中間指标,不是一個需要刷高的目标。口径說明白,抽样稳定做,比追一個精确到小數点的數字更有意义。
最後提醒一点:不同工具的更新节奏不同,同一批 URL 在同一天查询也可能得到不同结果。做對比时尽量固定工具、固定口径、固定時間間隔,否則變化里混杂的是工具差异,而不是站点本身的變化。