很多人看收錄,习惯拿“已收錄數 ÷ 站点總 URL 數”当一個指标。這個算法本身没错,但分母里装了什么,往往决定了结论是准的還是错的。一個内容站、一個电商站、一個工具站,URL 的构成完全不同,把這些頁面不加区分地塞進同一個分母,得出的收錄率既不能横向比,也不能纵向比。
分母為什么必须先分類
搜尋引擎不會因為一個 URL 存在就给它同等的期待。核心内容頁、自動生成的列表頁、登入頁、带參數的篩選頁,它們被索引的價值本来就不一样。把不该被收錄的頁面也算進分母,等于自己给自己制造低分。反過来,如果分母里只剩下少數几個“必錄”頁面,數字好看,却反映不了站点的真實覆盖情况。
更實际的做法是:先按頁面用途分组,每组單獨算比例,再决定要不要動手。
四類頁面,四種期待
核心内容頁
文章、商品詳情、教程、案例這類頁面,是站点要參與搜尋的主要资产。它們的收錄情况應该單獨看,並且看的是“该收錄的有没有收錄”,而不是“總數是多少”。低于预期时,重点查頁面主体内容是否足够、是否存在近似重复的版本互相分流。
列表與聚合頁
分類頁、标簽頁、归档頁、篩選结果頁。這類頁面的價值在于承接導航和長尾,但數量容易失控。判断标准不是收錄多少,而是:有没有真實用戶會從搜尋進入,内容是否随篩選條件产生實质變化。條件组合無穷無尽时,收敛通常比铺開更划算。
功能與過渡頁
登入、註冊、购物车、提交成功、短鏈跳轉。這些頁面一般不需要出現在索引里,把它們放進分母只會拉低數字。适合用合适的指令和入口管理,让它們不成為收錄议题。
歷史遗留頁
改版、下线、合並之後留下的舊 URL。它們的狀態應该被明确:是 301 到新地址,還是返回 404/410,或者仍在被訪問。悬而未决的舊 URL 會持續消耗抓取资源,也让收錄統計變得模糊。
分组之後各自看什么
- 核心頁:收錄缺失的頁面清單,以及它們各自的入口數量和内容完整度。
- 列表頁:有搜尋流量和没有搜尋流量的比例,據此决定保留還是收敛。
- 功能頁:是否還有被抓取记錄,是否影响正常頁面的抓取分配。
- 舊 URL:狀態碼是否统一,是否還有内鏈指向已经不存在的地址。
注意区分發現、抓取和索引這三個环节。日誌里出現抓取,不代表已经進入索引;索引报告里顯示“已發現但尚未抓取”,那往往是抓取预算和入口優先級的問题,和頁面质量是两回事,處理顺序也不一样。
一個可以照做的顺序
- 導出站点 URL 清單,按目錄和模板粗略归類,先分出上述四類。
- 给每一類單獨设一個合理预期,比如核心頁希望大部分被索引,功能頁希望基本不被索引。
- 只對偏离预期的那一類做排查,避免全站一起改。
- 改動之後隔一段時間再看同一组資料,而不是立刻盯總量。
收錄數字是结果,不是原因。分類是為了让這個结果能被解释,而不是為了让它變好看。
分母定清楚之後,收錄率的涨跌才有意义。它涨了,你能说出是哪一類頁面變好;它跌了,你也知道该先去查哪一组 URL,而不是對着一整站的資料反复猜测。