站点的索引量突然涨了一截,很多人的第一反應是「坏 URL 太多,赶紧屏蔽」。但真到動手时,往往不知道该屏蔽哪一類:地址成千上萬,逐條看根本看不過来。更稳的顺序是先把索引里的 URL 按頁面模板分组,看每一類各占多少,再决定收敛谁。
為什么先按模板看,而不是先按單條 URL 看
索引里的地址是结果,模板才是原因。一條标簽頁被收錄,意味着這套标簽模板的生成規則、内鏈结构和可索引設定共同放行了它。只處理單條 URL,同類地址還會不断冒出来;按模板處理,才能一次覆盖一類。
第一步:把已收錄的 URL 按生成規則归類
用 site 查询配合日誌或站長平台的索引資料抽样,把地址归到下面這些常见類里:
- 栏目與列表分頁:/list/、/page/2、?paged=3
- 标簽、话题、作者等聚合頁:/tag/、/author/、/topic/
- 時間归档:/2024/05/、/archive/
- 站内搜尋结果:/search?q=
- 排序與篩選參數:?sort=、?price=、?color=
- 附件與下载類地址(如果混在頁面索引里)
归類标准尽量落到「由哪套程序模板生成」,而不是靠肉眼看地址長得像不像。
第二步:算占比,並抽取样本看表現
- 给每一類记两個數:已收錄數量、该模板在全站生成的地址總數。
- 算出索引占比,同时记錄這類頁面在站内获得的点击和展現量級。
- 抽查五到十條,看它是真的有獨立内容,還是只有分頁導航和同一批标题。
占比高不等于有問题。占比高、几乎没有獨立内容、也拿不到展現,才需要動手。
判断标准可以简單一点:這個地址單獨拿出来,除了導航和重复的标题列表,還剩多少只有它才有的信息。剩得越少,越倾向收敛。
第三步:按優先級收敛,而不是一刀切
優先處理
- 站内搜尋结果、多參數组合篩選、没有内容的空标簽頁,通常直接设為不可索引最省事。
- 翻頁很深的列表頁,保留前几頁作為抓取通路,更深的做收敛或折叠。
谨慎處理
- 分頁全部 noindex 會切断深层内容被發現的路径,蜘蛛進不去,新内容也更难被抓到。
- 标簽頁如果有編輯维護、确實能聚起一批相關内容,可以保留,但要控制生成量。
几個容易踩的坑
- robots.txt 只是不让抓,不等于移出索引,已收錄的地址可能還會挂一段時間。
- 把大量模板頁 canonical 指到首頁,會让這一類的信号互相打架,之後核對时更难判断谁是代表地址。
- 只改配置不看日誌,很难確認释放出来的抓取配額到底有没有轉给正文頁。
收敛之後怎么核對
調整後按两到四周為一個周期观察三件事:這類模板的索引數量有没有下降;抓取請求是否從這些地址轉到正文頁;正文頁的收錄有没有跟着變化。如果索引没動,先分清是還没重抓,還是抓了之後狀態没更新,再决定要不要繼續加碼。
整個過程不必追求把索引數量压到某個數字,目标只是让索引里留下的是真正能被检索、也值得被检索的頁面。