站内篩選、排序、分頁、跟踪參數很容易生成大量 URL。用戶点几下就能组合出成百上千個地址,這些地址一旦被蜘蛛大量抓取,收錄量看起来涨了,但真正有價值的詳情頁反而可能被稀释。核對收錄时,先別急着看總數,把带參數的 URL 單獨拉出来,按參數類型分類,再决定每一步怎么處理。
先把參數分成四類
不同參數對頁面内容的影响完全不同,收敛方式也不一样。
- 内容型參數:篩選颜色、尺碼、地区、分類等,選中後頁面主体内容确實發生變化,可能對應真實搜尋需求。
- 排序型參數:按價格、销量、上架時間排序,主体商品集合基本不變,只是顺序不同。
- 跟踪型參數:utm、ref、from、spm 等,僅用于渠道統計,不影响頁面内容。
- 會话或展示型參數:sessionid、view、layout、print 等,同一内容的不同展示形態。
分類之後,先處理跟踪型和會话型。它們通常没有獨立检索價值,却最容易通過外鏈、分享和站内跳轉扩散。核對时可以抽查這些 URL 是否已被索引,若已收錄,再考虑用 canonical 指向無參數版本,或在 robots.txt 中屏蔽對應參數模式。注意,robots.txt 屏蔽的是抓取,不是索引;如果頁面已被其他 URL 引用,仍可能以無參數形式進入索引,所以要和 canonical、内鏈一起看。
排序參數:優先做規范化,而不是直接屏蔽
排序參數往往和主列表頁内容高度重合。如果直接屏蔽,可能影响用戶通過排序連結分享的体驗;更稳妥的做法是让排序 URL 的 canonical 指向不带排序參數的主列表頁。
canonical 是建议,不是强制指令。如果站内大量連結都指向排序 URL,搜尋引擎仍可能選擇它作為規范頁。所以連結修正比标簽更關键。
具体操作:把列表頁預設排序设為無參數或固定參數;分頁連結只保留頁碼;排序切換用 JS 或表單提交,避免生成可抓取的 a 标簽。如果已有大量排序 URL 被收錄,先修正内鏈,再观察 canonical 是否被跟随。不要一次性屏蔽所有參數,以免誤伤真正有检索價值的篩選頁。
内容型參數:判断是否值得保留
篩選參數如果對應明确搜尋需求,比如“地区 + 职位”“品牌 + 型号”,可以保留為獨立可收錄頁面。判断标准不是參數本身,而是頁面是否有獨立标题、獨立描述、足够的内容量和内鏈支持。
- 看搜尋需求:有没有用戶會直接搜尋這個组合。
- 看内容差异:頁面主体是否明顯不同于父級列表頁。
- 看内鏈:是否有稳定入口,而不是只能靠參數拼接到達。
- 看數量:如果组合數量巨大且長尾無搜尋,優先收敛。
對于不值得保留的内容型參數,處理方式與排序參數類似:canonical 指向最接近的上級頁面,同时减少站内可抓取連結。如果參數组合數量极大,可以用 robots.txt 屏蔽部分參數,但记得配合 noindex 或 canonical,避免被抓取後仍進入索引。
用日誌和索引狀態驗證收敛效果
調整之後,不要只看收錄量下降就判断成功。更實用的核對顺序是:先看日誌里參數 URL 的抓取频次是否下降,再看索引中這些 URL 是否被替換為規范版本,最後看目标詳情頁的抓取和收錄是否回升。
- 如果抓取频次没降,检查内鏈和 sitemap 是否還在大量輸出參數 URL。
- 如果抓取降了但索引没變,可能是規范頁選擇還没更新,繼續观察並强化内鏈指向。
- 如果目标頁面也没起来,回到頁面质量和内鏈深度排查,不要只盯着參數。
參數 URL 的收敛不是一次清理就結束。新功能、新渠道、新分享方式都會带来新的參數。把參數分類和規范規則寫進上线检查清單,比事後补救更省力。