看收錄报表时,數字涨跌很容易吸引注意力,但真正影响站点健康的是另一件事:這些被索引的 URL 里,有多少是能承接搜尋需求的頁面。收錄量是结果,不是目标。先给索引頁面做一次质量分层,後面的取舍才有依據。
先分三档:能用、备用、该清掉
不必做复杂的评分模型,按用途粗分三档就够用。
- 能用:有獨立搜尋需求,内容基本唯一,有正常内鏈入口,用戶点進来能得到答案。
- 备用:暂时没有明顯搜尋表現,但有保留價值,比如刚上线的内容、季节性頁面、待补充的長尾頁。
- 该清掉:重复、空壳、參數拼接、站内搜尋或篩選产生的低價值 URL,長期没有訪問也没有内鏈價值。
分层的意义在于,把“要不要處理”變成“先處理哪一档”。大部分站点的問题不是收錄太多,而是该清的那一档長期没人管。
判断頁面质量时看哪几個点
先看内容本身,再看抓取和索引條件,顺序不要颠倒。
- 頁面是否有明确的搜尋意图對應,标题和正文是否在回答同一個問题。
- 正文是否與站内其他頁面高度重合,重合部分是否只是模板或參數差异。
- 頁面是否有站内入口,還是只能靠 sitemap 或外鏈被發現。
- 返回狀態是否稳定,是否存在跳轉鏈、超时或软 404。
- 頁面上是否有下一步路径,比如相關推荐、分類入口或轉化按钮。
這几項里只要有一項明顯異常,就先记為待观察,不要立刻下结论。
重复内容要先归因,再决定動作
重复不是一種情况。模板重复、參數重复和正文重复的處理方式完全不同。
- 模板重复:多個 URL 只有标题或篩選條件不同,正文主体一致。優先合並或規范 URL。
- 參數重复:同一内容被排序、分頁、追踪參數拆成多個地址。先统一參數規則,再處理已索引的残留。
- 正文重复:不同頁面寫了相同内容,通常来自采集或複製。需要判断保留哪一版,其余做跳轉或移除。
归因清楚之前,直接批量刪除容易誤伤。建议先抽一批样本,確認重复来源集中在哪個模板。
從报表到動作的先後顺序
- 拉一份索引頁面样本,按模板或目錄归類,不要逐條看。
- 标出每類的内鏈入口數量、抓取狀態和近期搜尋表現。
- 把長期無訪問、無内鏈、内容重复的頁面放進待處理清單。
- 分小批處理,每批只動一個模板或一類參數。
- 處理完观察抓取和索引變化,再决定是否繼續下一批。
這個顺序的核心是控制變量。一次改太多,後面很难判断是哪一步起了作用。
该清掉的頁面怎么收尾
不同情况對應不同手段,目标是让搜尋引擎和用戶都不要把時間花在這些 URL 上。
- 内容還有價值但地址重复:保留一個規范地址,其余用 canonical 指向它。
- 内容已被合並:舊地址做 301 跳轉到新地址,並更新内鏈。
- 内容不再需要:返回 410 或 404,同时從 sitemap 和内鏈中移除。
- 頁面必须保留但不希望被索引:加 noindex,並確認没有被 robots.txt 挡住抓取。
提醒一句:清理動作不要和改版、換模板、調參數同时進行。索引變化需要時間,多個變量叠在一起,报表會失去參考價值。
分层之後,收錄量才有意义
把索引頁面分成能用、备用和该清掉三類後,收錄量就從一個孤立數字變成了结构信息。接下来每次看报表,重点不再是涨了多少,而是能用那一档有没有增加,该清掉那一档有没有减少。這個视角比單纯追求收錄數字更接近站点运营的實际問题。