網站收錄

參數篩選頁被收錄了一大堆:重复内容该怎么收口

电商、招聘、房产類站点常见的問题:篩選和排序參數生成了大量 URL,内容骨架几乎一样,却各自被搜尋蜘蛛抓取並進入索引。本文梳理這類頁面的分類判断,以及從入口控制、canonical 到 noindex 的收口顺序,帮助把收錄名額集中到真正有区分度的頁面上。

網站收錄

參數篩選頁被收錄了一大堆:重复内容该怎么收口

做商品列表、职位列表、房源列表的站点,過一段時間查收錄,常常會發現索引里多出成百上千條地址,点開一看,正文列表大同小异,只是篩選條件不同。這些頁面不是垃圾頁,但它們的重复度很高,會占掉本该留给更有價值頁面的位置。

參數頁為什么容易被抓走

原因通常不在蜘蛛,而在入口。列表頁往往會给出大量篩選連結,颜色、尺碼、價格区間、排序方式排列组合,理论上能生成几萬條 URL。搜尋蜘蛛顺着這些連結走,只要服務器返回 200 並且不是空列表,它就有理由抓下来。

另一個常被忽略的点是:同一套内容可能有多個參數寫法,比如 ?sort=price 和 ?order=asc&by=price 指向同一個结果,URL 却完全不同。這时候收錄分散,往往不是因為内容不够,而是地址没有收拢。

先给這些 URL 分三類

別一上来就全部 noindex,容易顺手把有流量的頁面也挡掉。更稳妥的做法是先按业務價值分類:

  • 该保留的:有稳定搜尋需求、能覆盖明确主题的组合,比如“城市+戶型”“品牌+型号”。這類頁面通常有獨立的文案、标题和介绍段落。
  • 可留可不留的:结果集較大的通用篩選,比如價格区間、评分排序。它們可以存在,但不值得單獨進入索引。
  • 该收口的:多重條件叠加後结果很少、甚至為空,以及會话、追踪、排序類參數。這類頁面既没有稳定内容,也不适合作為落地頁。

分類时可以直接看資料:這個 URL 過去一段時間有没有自然点击?有没有被其他頁面連結?如果两者都没有,通常不需要占用索引位置。

收口手段有先後顺序

處理重复 URL,建议按下面的顺序推進,前面的手段能解决,就不急着用後面的。

  1. 控制入口。把不打算收錄的组合從内鏈里拿掉,改成表單提交或按钮触發,而不是直接輸出可点連結。没有連結入口,蜘蛛自然少走。
  2. 统一地址寫法。固定參數顺序,去掉無意义的追踪參數,避免大小寫和末尾斜杠造成同頁多址。這一步做完再谈後面的處理。
  3. 用 canonical 归並。让重复的组合頁指向主頁面,比如把排序、视图切換類參數归到預設地址上。canonical 是提示而不是强制,所以別把它当唯一手段。
  4. 限制抓取。對结果极大、几乎不产生價值的參數路径,可以在 robots.txt 里做限制,减少抓取占用。但要清楚:被 robots 挡住的頁面,如果還有外部連結指向,仍可能以無描述的形式出現在结果里。
  5. 最後才是 noindex。對确實想留在站内供用戶使用、但不希望進入索引的頁面,加 noindex 更直接。注意 noindex 的頁面要允许抓取,否則标簽讀不到。
一個常见誤区:把 noindex 和 robots.txt 同时用在同一批 URL 上。结果是标簽讀不到,頁面也没被挡住,白忙一场。

分頁和视图切換要單獨想

分頁是列表頁的固有结构,通常不需要当作重复内容處理,但要注意別让第一頁和带參數的首頁地址並存。视图切換(列表视图、網格视图)和排序參數則更适合归並到主地址,因為它們對用戶有即时帮助,對搜尋却没有獨立主题。

打印頁、AMP 版、移動獨立域名属于另一類情况,處理思路是让它們声明規范版本,而不是简單删掉。

處理完要看什么

收口不是一改就见效的動作,需要看一段時間的變化。可以關注三点:

  • 被收口的 URL 是否逐渐從索引中登出,而不是原地不動;
  • 保留下来的组合頁抓取是否更集中,日誌里重复路径是否减少;
  • 站内搜尋入口是否仍然可用,別為了收口让用戶找不到篩選項。

如果發現某個被收口的组合頁其實有稳定点击,可以把它重新放開,並补上獨立的标题和說明文字。重复内容的處理没有一劳永逸的答案,更多是随业務和資料不断調整的過程。