站内搜尋頁、篩選頁往往由程序批量生成,URL 數量随關鍵詞和參數组合膨胀。它們结构简單、正文高度重复,却因為内鏈和提交入口多,反而容易被發現和抓取。结果就是索引里塞進大量同质頁面,真正的商品頁、文章頁抓取机會被挤掉。
處理這類頁面,核心不是“全留”或“全挡”,而是先分類,再决定每一類的處置方式。
先把頁面拆成三類
- 站内搜尋结果頁:由搜尋框提交關鍵詞生成,關鍵詞理论上無限,頁面也就無限。
- 篩選组合頁:按品類、價格、颜色等條件组合生成,组合數量同样會快速膨胀。
- 排序與视图參數:同一结果集的排序切換、每頁條數、列表與網格切換,内容基本一致。
這三類的共同点是内容由已有頁面拼装,信息增量低;差別在于有没有稳定的用戶需求作為支撑。
判断标准:能不能成為獨立的落地頁
可以考虑保留的
- 有明确搜尋需求且長期稳定的组合,例如品牌加品類這類用戶會直接搜的條件。
- 结果稳定、數量充足,並且能补上說明文字、标题和導语,而不是只有一堆條目。
- 已经带来自然流量和轉化的少數地址,改動前先看資料再决定。
通常不收的
- 任意關鍵詞的搜尋结果頁,尤其是無结果或只有少量结果的頁面。
- 三個以上參數随意叠加、结果几乎重合的组合頁。
- 僅改變排序、分頁或视图的同一内容地址。
處置手段的顺序
顺序很重要,先做能立刻收口的動作,再處理存量索引。
- 先確認現状:用站点查询和後台索引报告看這批地址的收錄量與流量占比,没有資料时不要大動。
- 保留的頁面做增量:统一标题结构,补一段结果說明,把入口換成静態可讀的路径,减少無意义參數。
- 不收的頁面做屏蔽:站内搜尋頁和随机篩選頁可以用 robots.txt 禁止抓取;仍希望被爬到的頁面則加 noindex。两者作用不同,robots 是阻止抓取,頁面里的 noindex 需要蜘蛛能進来才生效。
- 調整内鏈與 sitemap:把參數地址從導航、相關推荐和 sitemap 里撤掉,只保留可讀的規范路径。
- 清理舊索引:已收錄的地址會在一段時間内保留,通常等重新抓取後更新;确實需要快速收口再考虑返回 410,改版走 301,避免一次性全部跳轉。
容易踩的几個坑
- 用 robots.txt 挡 noindex 頁面:蜘蛛進不来就看不到 noindex,舊索引反而更难清。
- 只加 canonical 不改内容:几十個内容几乎相同的篩選頁互相指認,規范化信号容易失效。
- 把 sitemap 当收錄開關:不提交只是减少發現渠道,不等于地址就不會被抓到。
- 一刀切全站屏蔽:连有流量的组合頁一起挡掉,损失的是已有的自然流量。
屏蔽參數頁主要是减少重复和抓取浪費,頁面能否收錄、收錄多少,最终仍取决于内容质量和用戶需求,不存在提交就一定進索引的保證。
上线前後的核對清單
- 站内搜尋頁是否已從導航和 sitemap 中移除
- 保留的篩選頁是否有獨立标题、說明文字和稳定入口
- robots 與 noindex 是否指向了正确的頁面類型
- 參數地址是否统一到一條規范路径,内鏈是否同步替換
- 改動後是否用日誌和索引报告复盘,而不是只看一次查询结果
這類工作没有一次做完的时候。關鍵詞在變,篩選條件也在變,定期回看入口结构和索引构成,比一次性大清理更稳妥。