很多人看收錄情况,最後只报一個數字:索引里有 8000 條。但這個數字本身說明不了任何問题——如果站点實际只有 6000 個有效頁面,說明索引里混進了重复或無效 URL;如果有 5 萬個有效頁面,8000 就說明大面积没收錄。所以真正有意义的指标是收錄率,而收錄率必须先有一個分母。
為什么不能只看收錄數
收錄數是一個绝對量,它會随站点規模、模板改版、URL 结构調整而波動。同样一個 8000,在不同站点上的含义可能完全相反。只有把分子(索引中的有效頁面)和分母(應该被收錄的頁面)放在一起看,才能判断接下来该做什么。
分母的几種常见口径
- sitemap 全量:最容易拿到,但往往包含已经下线的頁面、非規范 URL 變体,以及本就不打算收錄的篩選頁。作為分母會偏大。
- 資料库或後台全量:覆盖最全,但包含草稿、未發布、内部预览等根本不该出現在索引里的頁面,同样偏大。
- 内鏈可達頁面:更接近真實的可抓取范围,但會漏掉孤岛頁面(只靠外鏈或歷史收錄存在)。作為分母會偏小。
- 日誌中被動抓取過的 URL:反映搜尋引擎實际见過什么,但包含大量參數组合和無效地址,噪音最大。
没有一個口径是完美的。可行的做法是選一個主口径,用其他口径做交叉校驗,而不是每次換口径——那样趋势就不可比了。
建议先建一份目标收錄清單
- 從主口径拉取候選 URL 全集。
- 按規范 URL 归並:大小寫、结尾斜杠、跟踪參數、排序參數统一到一個代表。
- 剔除明确不想收錄的:noindex 頁面、robots 屏蔽路径、登入後頁面、站内搜尋结果頁、纯篩選组合頁。
- 标记每個 URL 的入口情况:有几個内鏈指向、是否在 sitemap 中、上次被抓取的時間。
- 给清單打上版本,固定更新周期,例如每月重新生成一次。
這份清單的價值在于:它让收錄從模糊感觉變成可核對的列表,也让後續每一項改動都有對照物。
按狀態分组,動作才明确
拿到清單後,把每個 URL 归到四種狀態,處理方式完全不同:
- 已收錄:暂时不用管,除非内容已變更、需要更新索引版本。
- 已發現,未抓取:問题通常在入口和抓取優先級。先补内鏈、確認 sitemap 是否正确,再看服務器响應是否拖慢了抓取。
- 已抓取,未编入索引:問题多半在頁面本身。检查内容重复度、與站内其他頁面的相似程度、頁面是否有明确主题。
- 尚未發現:說明缺少入口,需要通過外鏈、内鏈或 sitemap 把它暴露出去。
把四類各占多少比例算出来,就已经知道该先動哪一块,不需要一上来就全站折腾。
收錄率是過程指标,不是目标
追求 100% 收錄既不現實也没必要。篩選頁、低價值聚合頁、已经過期的活動頁,被排除在索引外通常是正常结果。真正要關注的是:有價值的那部分頁面,收錄率是否稳定,是否在持續改善。
如果分母本身没定义清楚,收錄率的涨跌可能只是口径換了,而不是站点真的變好了或變差了。