做收錄核對时,最容易看错的指标是“總收錄量”。几十萬條 URL 進了索引,看着很健康,但把地址按模板拆開一看,绝大部分是列表頁、分頁、标簽聚合頁,真正承载内容的詳情頁只占很小一部分。這種结构下,站点表面上收錄充足,實际能被搜到的有效頁面並不多。
先看清收錄里的頁面都是哪一類
在動手改之前,先把索引里的地址拉出来,按模板归類。不要只看“收錄了多少條”,而要看“每一類各占多少”。
分组时至少要把這几類分開
- 内容詳情頁:文章、商品、問答等單條内容
- 列表頁:栏目首頁、分類頁
- 分頁:列表的第 2、3、N 頁
- 标簽與聚合頁:由篩選、标簽、作者等维度自動生成
- 功能頁:搜尋结果地址、排序參數頁
分组後分別算两個數:這類 URL 一共有多少、其中進了索引的有多少。两個數一對比,問题通常立刻顯形——要么是詳情頁整体收錄偏低,要么是聚合類地址把總量撑了起来。
列表頁為什么容易被大量收錄
列表頁有几個天然優势:入口多、更新频繁、被蜘蛛反复訪問,而且往往挂在導航和面包屑里,從首頁几步就能到。詳情頁則相反,入口依赖列表頁,越靠後的内容越难被走到。当列表分頁很深时,詳情頁的連結會被压到很後面,抓取優先級自然靠後。
詳情頁收不進去,常见卡点
- 入口太浅或太深。只有翻到列表第 N 頁才出現連結,等于没有稳定入口。
- 被規則拦住。robots、noindex、canonical 指向別處,任何一條都會让頁面出局。
- 内容與列表摘要重合。詳情頁正文和列表頁里的摘要几乎一样,搜尋引擎没有理由單獨保留它。
- 詳情頁彼此相似。同模板批量生成、只換少量字段的頁面,容易被判為重复。
- 返回狀態不對。空内容返回 200,或者未登入就跳登入頁,都會影响判断。
處理顺序:先通路,再内容,最後收敛
- 確認詳情頁至少有一個固定入口,不依赖翻頁。可以在栏目首頁、相關推荐或站点地图里给出稳定連結。
- 逐個排查拦截規則,把誤拦的放開,把确實不想收的明确标注。
- 补足詳情頁的獨立信息,让它比列表摘要多出可讀的實际内容,而不是模板字段的堆砌。
- 判断聚合類地址的去留。分頁、篩選參數這類頁面,如果不带来獨有信息,考虑收敛入口或做規范化處理。
- 改完等一段時間再對比同一组資料,不要当天就下结论。
留一份能持續對比的基线
把分组方式、統計日期、每類 URL 的總數和收錄數记下来,隔一到两周用同样的口径再算一次。比值的變化比绝對數字更有參考價值:詳情頁占比在上升,說明方向對了;只是總量在涨而结构没變,多半還是聚合頁在扩。
收錄核對看的是结构,不是總數。總量涨得快不等于有效頁面變多,先把每一類的占比算清楚,再决定要動哪里。