網站收錄

收錄率的分母從哪来:先列一份“應该被收錄”的清單

收錄數只是一個绝對量,單獨看没有意义。本文說明收錄率的分母可以從哪几種口径来、各自有什么偏差,以及如何用一份固定的目标收錄清單,把頁面按已收錄、已發現未抓取、已抓取未编入、尚未發現分组,再决定先處理哪一块。

網站收錄

收錄率的分母從哪来:先列一份“應该被收錄”的清單

很多人看收錄情况,最後只报一個數字:索引里有 8000 條。但這個數字本身說明不了任何問题——如果站点實际只有 6000 個有效頁面,說明索引里混進了重复或無效 URL;如果有 5 萬個有效頁面,8000 就說明大面积没收錄。所以真正有意义的指标是收錄率,而收錄率必须先有一個分母。

為什么不能只看收錄數

收錄數是一個绝對量,它會随站点規模、模板改版、URL 结构調整而波動。同样一個 8000,在不同站点上的含义可能完全相反。只有把分子(索引中的有效頁面)和分母(應该被收錄的頁面)放在一起看,才能判断接下来该做什么。

分母的几種常见口径

  • sitemap 全量:最容易拿到,但往往包含已经下线的頁面、非規范 URL 變体,以及本就不打算收錄的篩選頁。作為分母會偏大。
  • 資料库或後台全量:覆盖最全,但包含草稿、未發布、内部预览等根本不该出現在索引里的頁面,同样偏大。
  • 内鏈可達頁面:更接近真實的可抓取范围,但會漏掉孤岛頁面(只靠外鏈或歷史收錄存在)。作為分母會偏小。
  • 日誌中被動抓取過的 URL:反映搜尋引擎實际见過什么,但包含大量參數组合和無效地址,噪音最大。

没有一個口径是完美的。可行的做法是選一個主口径,用其他口径做交叉校驗,而不是每次換口径——那样趋势就不可比了。

建议先建一份目标收錄清單

  1. 從主口径拉取候選 URL 全集。
  2. 按規范 URL 归並:大小寫、结尾斜杠、跟踪參數、排序參數统一到一個代表。
  3. 剔除明确不想收錄的:noindex 頁面、robots 屏蔽路径、登入後頁面、站内搜尋结果頁、纯篩選组合頁。
  4. 标记每個 URL 的入口情况:有几個内鏈指向、是否在 sitemap 中、上次被抓取的時間。
  5. 给清單打上版本,固定更新周期,例如每月重新生成一次。

這份清單的價值在于:它让收錄從模糊感觉變成可核對的列表,也让後續每一項改動都有對照物。

按狀態分组,動作才明确

拿到清單後,把每個 URL 归到四種狀態,處理方式完全不同:

  • 已收錄:暂时不用管,除非内容已變更、需要更新索引版本。
  • 已發現,未抓取:問题通常在入口和抓取優先級。先补内鏈、確認 sitemap 是否正确,再看服務器响應是否拖慢了抓取。
  • 已抓取,未编入索引:問题多半在頁面本身。检查内容重复度、與站内其他頁面的相似程度、頁面是否有明确主题。
  • 尚未發現:說明缺少入口,需要通過外鏈、内鏈或 sitemap 把它暴露出去。

把四類各占多少比例算出来,就已经知道该先動哪一块,不需要一上来就全站折腾。

收錄率是過程指标,不是目标

追求 100% 收錄既不現實也没必要。篩選頁、低價值聚合頁、已经過期的活動頁,被排除在索引外通常是正常结果。真正要關注的是:有價值的那部分頁面,收錄率是否稳定,是否在持續改善。

如果分母本身没定义清楚,收錄率的涨跌可能只是口径換了,而不是站点真的變好了或變差了。