站点收錄量突然上涨,不一定是好事。很多站長拉出索引里的 URL 一看,發現大量带問号的參數頁面:?sort=price、?page=2、?utm_source=...。它們可能只是同一個列表的不同排列,却占用了索引名額,也让报表更难分析。
先別急着屏蔽,分清三類參數
參數本身没有原罪,關键是它有没有创造獨立頁面價值。常见可以分三類:
- 追踪參數:utm_source、gclid、fbclid 等。它們只用于統計来源,不改變頁面内容,通常不應该進入索引。
- 篩選與排序參數:颜色、價格、品牌、排序方式等。有些篩選组合有真實搜尋需求,比如“某品牌+某型号”;但大量空结果、重复列表、任意组合,往往只是重复内容。
- 會话與用戶标识參數:sessionid、uid、token 等。這類 URL 對搜尋引擎没有意义,還可能生成近乎無限的组合。
判断一個參數 URL 该不该留
收口之前,先問几個問题,而不是看到問号就一刀切。
- 這個 URL 是否有獨立内容?還是只是同一批商品的另一種排序?
- 它有没有被用戶主動搜尋的可能?搜尋需求可以用關鍵詞工具或站内搜尋词驗證。
- 它有没有被站内連結、sitemap 或外鏈大量引用?如果蜘蛛到處都能看到它,收錄概率自然更高。
- 它是否产生了實际流量和轉化?完全没有訪問、也没有獨立價值的參數頁,通常不值得保留。
如果答案都是否,那么它更可能是索引里的噪音;如果某個篩選组合确實有稳定搜尋量和轉化,保留並做好規范化更合适。
收口的顺序:先减少發現,再處理已收錄
很多人的第一反應是上 robots.txt 或 noindex,但顺序反了會多做很多無用功。建议按以下顺序推進。
- 盘点:從索引、日誌和 sitemap 中把带參數的 URL 拉出来,按參數類型、目錄、流量分组。
- 定規則:明确哪些參數允许保留,哪些只用于追踪,哪些篩選组合可以收錄。最好形成一份 URL 規范文档。
- 改内鏈和 sitemap:把站内連結指向規范版本,sitemap 只放希望被收錄的 URL。蜘蛛少發現一次,就少一次重复抓取和索引的机會。
- 對已索引頁面加信号:内容确實相同的參數頁,用 canonical 指向規范 URL;不想保留的頁面,用 noindex 明确表態。注意:noindex 需要頁面能被抓取,否則搜尋引擎看不到這個指令。
- 观察:索引更新有延迟,不要今天加 noindex、明天又撤掉。给它几周時間,同时看抓取日誌里的參數 URL 是否减少。
robots.txt 禁止抓取和 noindex 不要同时用。禁止抓取後,搜尋引擎無法讀取頁面上的 noindex,已索引的 URL 可能長期留在索引里,只是没有摘要。需要移除索引时,優先保證可抓取,再用 noindex 或 canonical。
几個容易踩的坑
- 全部參數一律屏蔽:可能誤伤有搜尋需求的篩選頁,也會让部分正常頁面無法被抓取。
- 只靠 GSC 參數工具:參數工具是临时辅助,不是長期規范。真正决定 URL 是否被發現的,還是站内連結和 sitemap。
- canonical 指向不相關頁面:把參數頁 canonical 到首頁或無關分類,容易被忽略,也浪費了頁面本身的潜在價值。
- 忽略分頁參數:?page=2 這類分頁如果内容正常,通常可以保留;但無限滚動或“查看更多”生成的參數,需要額外收口。
收口之後看什么
參數 URL 的收口不是一次性任務。完成後重点观察三件事:索引里带參數的 URL 是否减少;規范 URL 的抓取和收錄是否更集中;站点整体索引质量是否更接近真實内容量。如果發現某些參數頁有稳定流量,不必强行删掉,可以把它保留為可索引頁面,並确保 canonical、内鏈和 sitemap 都指向同一個版本。
參數 URL 不是洪水猛兽,關键在于它是否提供了獨立價值。不能提供價值的,尽早收口;能提供價值的,就把它当作正常頁面来管理。