大多數站点關心的是“收錄不够”,但另一種情况同样會拖累站点:本该被挡住的低價值頁面大量進入索引,也就是常说的索引膨胀。它不會立刻带来可见的故障,却會让站点整体质量信号被稀释,也會让真正重要的頁面更难被稳定地抓取和评估。
索引膨胀通常從哪来
搜尋引擎判断“這個 URL 是否值得收錄”,主要看它是否有獨立、可用的内容。当同一套模板批量生成大量内容稀薄、彼此高度相似的頁面时,就很容易出現收錄量上涨、但有效頁面没涨的情况。
- 參數组合頁:排序參數、追踪參數、多條件篩選叠加,生成成百上千個内容雷同的 URL。
- 空结果頁:篩選後没有结果,頁面依然返回 200,正文只剩一句提示。
- 歷史遗留頁:改版、下线、合並後仍然可以訪問,内容已经過时或與現有頁面重复。
- 分頁與归档:數量庞大的归档頁、标簽頁,正文只有标题列表。
先分類,再决定留還是撤
收缩之前要先区分两種頁面:一種是确實對用戶有用、只是寫法有問题的頁面,另一種是本身就不该存在、只因為技術原因被生成的頁面。前者通常通過規范化寫法就能解决,後者才需要真正把它挡在索引之外。
處理顺序建议
- 先把同類 URL 找齐。用抓取日誌、站点地图、平台後台的收錄資料交叉對照,確認膨胀集中在哪几類模板。
- 能合並的先合並。内容高度重合的頁面,優先考虑整合成一頁,而不是简單地批量 noindex。
- 确實無價值的,再考虑挡收錄。這时才進入 noindex、robots.txt、返回正确狀態碼等具体手段。
- 處理完一批再观察一批,避免一次性大面积改動導致难以判断效果。
几種手段的区別別搞混
robots.txt 的 Disallow 只是阻止抓取,被挡住的頁面如果之前已被收錄,搜尋引擎無法讀取頁面上的 noindex,反而可能長期停留在索引里。noindex 需要蜘蛛能抓到頁面,才讀得到這條指令。而如果頁面已经彻底不需要存在,返回 404 或 410 往往比 noindex 更干脆,也更容易让索引里的记錄自然登出。
canonical 則适用于“頁面本身有價值、只是想說明谁是主版本”的情况。把它当成刪除工具来用,通常會失效,因為 canonical 只是建议而並非强制。
提醒:這些手段都不會立刻反映在索引資料上,索引的收缩通常需要數周甚至更久,观察时以趋势為主,不要因為几天没變化就反复調整策略。
收缩之後该看什么
不要只盯着收錄總量這一個數字。更有意义的观察维度包括:重要頁面的抓取频次是否回升,站内几類核心模板的收錄比例是否改善,抓取日誌里低價值 URL 的占比是否下降。收錄總量下降但核心頁面表現變好,往往是正常且积极的结果。
另外要注意抓取與收錄是两件事。把無效 URL 挡在抓取之外,可以节省抓取配額,但這本身不等于清理索引;反過来,被 noindex 的頁面仍可能被抓取一段時間。两者需要分別驗證。
常见誤区
- 看到收錄量下降就立刻回滚:如果下降的正是低價值頁面,這可能是预期效果。
- 用 robots.txt 處理已收錄頁面:容易被卡住,處理周期更長。
- 對整站目錄一刀切:可能誤伤仍有流量、仍有價值的頁面,建议按模板、按目錄分阶段處理。
- 只做一次就結束:新參數、新模板會持續产生新的低價值 URL,需要定期复查生成規則。
索引膨胀的本质是“站点生成了太多不值得存在的 URL”。與其在收錄量上做文章,不如回到源头,控制 URL 的生产規則,让每一個能被訪問到的地址都有存在的理由。