網站收錄

篩選參數與站内搜尋頁:要不要让這些 URL 進索引

篩選、排序、追踪參數和站内搜尋頁會成倍增加 URL 數量,但它們未必都该進索引。本文按參數是否影响内容做分類,给出判断标准與處理顺序,說明 robots.txt、noindex、canonical 的使用邊界,以及内鏈收敛和效果驗證时的注意点。

網站收錄

篩選參數與站内搜尋頁:要不要让這些 URL 進索引

站点跑一段時間後,參數 URL 往往會在索引里堆积:篩選、排序、分頁、来源追踪,同一批商品或文章會長出几十上百個地址。這些地址该不该進索引,不能一刀切,先看它們對用戶和搜尋引擎各自意味着什么。

先给參數分個類

會改變頁面内容的參數

比如颜色篩選、價格排序、翻頁這類參數。它們對應的頁面内容确實不同,也可能存在一定的搜尋需求,例如“某颜色某品類”“按销量排序”這類查询。可以保留一部分,但要控制參數组合的數量,避免同類頁面無限膨胀。

不改變頁面内容的參數

比如来源追踪、會话 ID、渠道标识、展示版本号。它們只是记錄訪問路径,頁面主体内容與不带參數的地址基本一致。這類地址對用戶没有額外價值,却會成倍增加需要抓取的 URL 數量,也容易让同一段内容出現多個入口。

判断标准其實只有一條

問自己:這個地址上的内容,是否已经有一個更規范、更稳定的地址可以代表它?如果答案是“有”,那它更像是一條訪問路径,而不是一個獨立頁面。按這個标准去筛,大部分參數 URL 的归属會很快清晰。

處理顺序可以這样排

  1. 先統計:從服務器日誌或搜尋资源平台的抓取資料里,把带參數的 URL 拉出来,按參數名归類,看每個參數产生了多少地址、被抓了多少次。
  2. 再判断價值:有真實搜尋需求、内容确實不同的,考虑保留;只是換了排序、換了来源、換了展示样式的,優先收敛。
  3. 選擇手段:不需要收錄的,可以用 robots.txt 屏蔽抓取,或在頁面上加 noindex;内容相同但需要保留给用戶訪問的,用 canonical 指向規范地址。注意 robots.txt 屏蔽之後,搜尋引擎讀不到頁面上的 noindex。
  4. 收回内鏈:站内連結、分頁連結、導航尽量只指向規范地址。如果站内到處都鏈向參數地址,前面的處理很容易被抵消。
  5. 回头看資料:處理完观察一段時間,看带參數 URL 的抓取量和索引量是否下降,規范地址的抓取是否更集中。

站内搜尋结果頁要單獨看

站内搜尋頁由用戶輸入關鍵詞生成,數量几乎無限,内容质量參差,很容易积成一堆薄頁面。常见做法是允许抓取但不收錄,或在 robots.txt 里屏蔽搜尋路径。如果站内搜尋本身能带来稳定的長尾訪問,可以挑少量高质量结果頁人工優化後再放開,但這類頁面需要單獨维護,並且要防止被外部連結直接指向带關鍵詞的搜尋地址。

几個容易踩的坑

  • 把 robots.txt 当成“不收錄”的工具:它管的是抓取,不是索引。
  • 同一批頁面同时加 noindex 和 canonical:信号容易冲突,搜尋引擎可能更倾向于保留原来的地址。
  • 篩選參數被大量内鏈,蜘蛛反复在參數组合里绕行,真正需要抓取的頁面反而排到後面。
  • 分頁頁面一律 noindex:可能切断蜘蛛對深层内容的發現路径。分頁和篩選參數的處理方式並不相同。

驗證时看什么

驗證不需要盯着單個 URL 的收錄狀態,更應该看趋势:規范地址的抓取比例是否上升,參數地址的抓取是否下降,索引里是否還残留大量只有參數不同的重复條目。如果一段時間後趋势没變,先回头检查内鏈和 sitemap 里是否還在輸出參數地址,這往往是最直接的原因。

參數 URL 的處理不是“全部留下”或“全部屏蔽”,而是先分清哪一條是内容的主地址,再把抓取和索引的入口尽量收敛到它上面。