網站收錄

篩選參數一開,收錄里多出几百個 URL:參數頁的取舍與收敛

站内一開篩選,索引里就多出一批带參數的地址。問题不在于收錄本身,而在于這批 URL 稀释抓取预算、和主頁面互相竞争。文章把參數分成内容型、排序型、追踪型三類分別處理,說明哪些值得保留索引、哪些该屏蔽,以及已经進索引的參數頁按什么顺序登出。

網站收錄

篩選參數一開,收錄里多出几百個 URL:參數頁的取舍與收敛

站内加一個篩選功能,本来是给用戶用的:選颜色、選尺碼、按價格排序,几秒钟就能把范围缩小。過一段時間去看索引,却發現多出一批带參數的地址,颜色、尺寸、排序方式任意组合,數量很快從几十變成几百。這類 URL 進索引不是简單的“多收錄几頁”,它會稀释抓取预算、让同一批内容互相竞争,也會让頁面數量統計變得没法看。

先分清參數属于哪一類

  • 内容型參數:真正切換了内容集合,比如按城市、按品類、按戶型篩選,篩選结果對應着一批用戶真實會搜的東西。
  • 排序與视图型參數:sort、order、view、每頁條數這類,内容主体没變,只是顺序或者分頁大小變了。
  • 追踪型參數:utm 系列、广告点击标识、来源标记、會话 ID,對内容毫無影响,只是记錄了用戶從哪来。

分類的意义在于後面的處理完全不同:追踪型基本可以一律不放行;排序與视图型大多不值得單獨索引;只有内容型才需要逐個判断。

判断一個參數頁值不值得留在索引里

  • 有没有獨立搜尋需求:有人會搜“某城市 三居 学区”這類组合,這個篩選頁就有存在理由;只是把结果換個排序,不會有人這样搜。
  • 内容是否自洽:篩選後结果為空、只剩一两條,或者與上級分類頁大面积重合,價值就很低。
  • 是否可稳定訪問:同一组篩選條件每次打開结果都不一样,比如库存波動、随机推荐,索引它意义不大。
  • 數量是否可控:组合數一旦上千上萬,先按路径或參數维度整体收敛,不要指望逐條去優化。

動手處理时的動作顺序

  1. 先看日誌和目标站資料。抓取量里參數 URL 占了多少、其中又有多少進了索引,這個比例决定了你要投入多大精力。
  2. 给規范地址一個明确指向。内容型篩選頁如果决定保留,就让它指向自己;排序、视图類的變体,規范指向不带參數的基准地址。注意規范标簽是建议而非命令,所以還需要後面的動作兜底。
  3. 让參數顺序固定下来。同一個條件生成两種顺序的地址,等于自己造重复頁。程序里统一排序、统一小寫、丢掉空參數。
  4. 区分 robots.txt 屏蔽和 noindex。robots.txt 挡的是抓取,已经進索引的頁面不會因為加了屏蔽就消失;而 noindex 需要頁面被爬到才生效。合理顺序是:新生成的、不想被發現的路由可以直接在 robots.txt 里挡掉;已经被收錄的,先让頁面本身返回 noindex 或跳到基准地址,等它登出索引之後,再决定要不要加屏蔽。
  5. 追踪參數單獨處理。用重定向或者規范标簽把来源标记剥掉,別让带追踪參數的地址混進索引。

已经被收錄的參數 URL 怎么收

如果這批頁面本身有價值,先別急着删,而是看它們有没有带来訪問和轉化,有的话考虑整理成一组正式的着陆頁。没有價值的,按“改指令、等重新抓取、观察登出”的节奏走。不要在同一天把規范标簽、noindex、robots 三件事一起改,出了問题會分不清是哪一步起的作用。

一次性屏蔽全部參數,可能连带把真正有用的篩選頁一起挡掉;而且屏蔽之後,日誌里也看不到這些 URL 的抓取记錄,後續排查少了一條线索。

一個可以直接照着走的核對清單

  • 參數顺序、大小寫、空值是否已经统一
  • 排序與视图類參數是否都指向了不带參數的基准地址
  • 已收錄的參數頁有没有安排登出路径
  • 站内連結(包括分頁、标簽、推荐位)里是否混進了带參數的地址
  • 日誌中參數 URL 的抓取占比是否在下降

參數頁带来的麻烦通常是慢慢累积的:今天多几十條,下個月多几百條,等到抓取明顯被占满才回头收拾,代價會大很多。定期掃一眼日誌,比事後补齐要省事。