做商品列表、职位列表、房源列表的站点,過一段時間查收錄,常常會發現索引里多出成百上千條地址,点開一看,正文列表大同小异,只是篩選條件不同。這些頁面不是垃圾頁,但它們的重复度很高,會占掉本该留给更有價值頁面的位置。
參數頁為什么容易被抓走
原因通常不在蜘蛛,而在入口。列表頁往往會给出大量篩選連結,颜色、尺碼、價格区間、排序方式排列组合,理论上能生成几萬條 URL。搜尋蜘蛛顺着這些連結走,只要服務器返回 200 並且不是空列表,它就有理由抓下来。
另一個常被忽略的点是:同一套内容可能有多個參數寫法,比如 ?sort=price 和 ?order=asc&by=price 指向同一個结果,URL 却完全不同。這时候收錄分散,往往不是因為内容不够,而是地址没有收拢。
先给這些 URL 分三類
別一上来就全部 noindex,容易顺手把有流量的頁面也挡掉。更稳妥的做法是先按业務價值分類:
- 该保留的:有稳定搜尋需求、能覆盖明确主题的组合,比如“城市+戶型”“品牌+型号”。這類頁面通常有獨立的文案、标题和介绍段落。
- 可留可不留的:结果集較大的通用篩選,比如價格区間、评分排序。它們可以存在,但不值得單獨進入索引。
- 该收口的:多重條件叠加後结果很少、甚至為空,以及會话、追踪、排序類參數。這類頁面既没有稳定内容,也不适合作為落地頁。
分類时可以直接看資料:這個 URL 過去一段時間有没有自然点击?有没有被其他頁面連結?如果两者都没有,通常不需要占用索引位置。
收口手段有先後顺序
處理重复 URL,建议按下面的顺序推進,前面的手段能解决,就不急着用後面的。
- 控制入口。把不打算收錄的组合從内鏈里拿掉,改成表單提交或按钮触發,而不是直接輸出可点連結。没有連結入口,蜘蛛自然少走。
- 统一地址寫法。固定參數顺序,去掉無意义的追踪參數,避免大小寫和末尾斜杠造成同頁多址。這一步做完再谈後面的處理。
- 用 canonical 归並。让重复的组合頁指向主頁面,比如把排序、视图切換類參數归到預設地址上。canonical 是提示而不是强制,所以別把它当唯一手段。
- 限制抓取。對结果极大、几乎不产生價值的參數路径,可以在 robots.txt 里做限制,减少抓取占用。但要清楚:被 robots 挡住的頁面,如果還有外部連結指向,仍可能以無描述的形式出現在结果里。
- 最後才是 noindex。對确實想留在站内供用戶使用、但不希望進入索引的頁面,加 noindex 更直接。注意 noindex 的頁面要允许抓取,否則标簽讀不到。
一個常见誤区:把 noindex 和 robots.txt 同时用在同一批 URL 上。结果是标簽讀不到,頁面也没被挡住,白忙一场。
分頁和视图切換要單獨想
分頁是列表頁的固有结构,通常不需要当作重复内容處理,但要注意別让第一頁和带參數的首頁地址並存。视图切換(列表视图、網格视图)和排序參數則更适合归並到主地址,因為它們對用戶有即时帮助,對搜尋却没有獨立主题。
打印頁、AMP 版、移動獨立域名属于另一類情况,處理思路是让它們声明規范版本,而不是简單删掉。
處理完要看什么
收口不是一改就见效的動作,需要看一段時間的變化。可以關注三点:
- 被收口的 URL 是否逐渐從索引中登出,而不是原地不動;
- 保留下来的组合頁抓取是否更集中,日誌里重复路径是否减少;
- 站内搜尋入口是否仍然可用,別為了收口让用戶找不到篩選項。
如果發現某個被收口的组合頁其實有稳定点击,可以把它重新放開,並补上獨立的标题和說明文字。重复内容的處理没有一劳永逸的答案,更多是随业務和資料不断調整的過程。