站内搜尋頁、篩選頁、排序頁被收錄,是收錄报告里比較隐蔽的一類問题。單條 URL 看起来没毛病,但组合起来可能是几千上萬個低價值地址,既占用抓取资源,也让索引里出現大量近似頁面。
先看規模,再决定怎么處理
在動手之前,先取一份样本,判断問题有多大的量級。常见的入口有四類:
- 站内搜尋框用 GET 提交,關鍵詞直接拼進 URL;
- 篩選、排序、视图切換用的是可抓取的 a 标簽,而且參數可以無限叠加;
- 分頁參數與篩選參數组合,产生大量只有细微差別的地址;
- 這些 URL 被站内其他頁面、外部分享或抓取工具带到搜尋引擎面前。
如果样本里绝大部分頁面内容相近、没有獨立價值,處理方向就是收口;如果其中一部分對應真實需求,就要單獨留下来。
處理顺序:先管入口,再管狀態與索引信号
第一步,减少新入口
搜尋引擎發現 URL 的主要渠道仍然是連結。把篩選、排序這類交互改成按钮或表單提交,能给新地址的出現降速;表單尽量用 POST,避免參數進入 URL。在連結上加 rel="nofollow" 只能降低發現概率,不能替代後續處理。
第二步,用 noindex 處理已收錄頁面
要让已经進入索引的頁面登出,靠的是 noindex,而不是 robots.txt 屏蔽。屏蔽抓取之後,搜尋引擎讀不到 noindex,頁面可能以“無摘要”的形式長期留在结果里。
顺序上要记住:能被抓取、能讀到 noindex,才有机會被移除。先屏蔽再指望消失,通常是反的。
第三步,canonical 不是移除工具
canonical 用于合並近似版本的信号,它不保證頁面直接登出索引。對于确實不该出現的搜尋頁,noindex 更直接;對于只是參數重复的版本,可以先用 canonical 指向主版本,再观察报告變化。
哪些搜尋頁值得保留
如果某個篩選组合本身有稳定的需求,比如城市、品類、價格区間這類结构化维度,那它更接近一個正常的列表頁:有獨立结果集、内容相對稳定、标题可以單獨寫。這類頁面可以保留,但要控制组合數量,只開放少數几個维度,並给頁面补上說明文字與合理内鏈,避免整頁只剩一列連結。
收口之後怎么驗證
- 索引报告里带搜尋參數的 URL 數量是否在回落;
- 抓取統計中带搜尋參數的請求占比是否下降;
- 日誌里蜘蛛對新參數组合的訪問量是否减少;
- 抽查几個代表性 URL,確認返回的是 noindex,而不是 403、404 之類的拦截狀態。
這類問题通常不是一次處理就結束的。參數组合會随着运营活動反复出現,比較稳妥的做法是把它寫進上线检查清單:新增一個篩選维度或搜尋入口时,先想清楚這個维度要不要被收錄,再决定連結怎么放、頁面怎么标。