站内一旦有了篩選、排序、分頁、追踪等參數,URL 的數量往往會成倍膨胀。這些頁面有的确實對用戶有用,有的只是同一批内容的另一種排列。放任不管,蜘蛛會把大量配額花在相似頁面上;一刀切屏蔽,又可能把真正有價值的入口挡在外面。關键在于先给參數分類,再决定放還是收。
參數 URL 的三種来源
先把站内出現的參數按来源過一遍,處理方式差別很大。
- 功能性參數:分頁、排序、每頁條數、视图切換。這類參數改變的是同一批内容的排列组合,内容主体基本重合。
- 篩選參數:價格区間、品牌、地区、属性组合。單一维度且组合數量可控时,往往能形成有獨立價值的落地頁;维度一叠加,就容易生成大量低差异頁面。
- 追踪與营销參數:来源渠道、活動标记、會话标识、分享參數。它們對頁面内容没有任何影响,属于典型的重复 URL 来源。
判断一個參數頁该不该收錄
不必纠结技術细节,先問三個問题:這個 URL 直接给用戶訪問时,頁面能否正常展示對應结果?搜尋结果里已经有同類頁面在占位吗?它的内容能否用一句话说清和其它頁面的区別?三個答案都是肯定的,才有讨论收錄的意义。任何一個含糊,優先考虑收敛。
可以放開的典型情况
- 單一篩選维度、且该维度的组合數量有限,例如按地区划分的服務頁。
- 有稳定搜尋需求,頁面标题和正文能對應到具体意图。
- 頁面能從站内連結正常到達,而不是只能靠參數拼出来。
建议收紧的典型情况
- 多维度叠加产生的组合頁,内容大量雷同。
- 排序、每頁條數、视图模式等纯展示层參數。
- 带追踪參數、會话參數的地址。
- 篩選结果為空或结果极少的頁面。
收紧的几種做法與取舍
常见手段各有副作用,用之前想清楚目的是减少抓取還是减少索引。
- canonical 指向主版本:适合内容确實重合、但希望保留用戶訪問的情况。它是提示而非强制,要保證指向的地址本身可訪問、内容一致。
- robots.txt 屏蔽參數路径:能明顯减少抓取,但蜘蛛無法再看到頁面上的 canonical 等信号,索引里已有的舊地址也不會因此自動消失。
- 頁面級 noindex:需要蜘蛛能抓到頁面才能生效,适合结果頁、组合頁這類能訪問但不希望進索引的场景。
- 連結层面控制:站内入口只指向預設版本,篩選連結用可点击但不被跟進的寫法,從源头上减少參數 URL 被發現的机會。
- 让篩選结果由 JS 驱動:减少服務端生成的獨立 URL,但要注意内容對用戶可见、對蜘蛛也尽可能可讀。
參數處理没有萬能配置。同一個站点里,分頁參數和营销參數的處理方式就應该不同,定期回看參數列表比一次性設定更重要。
放開收錄时要补的几件事
- 标题、描述、H1 要能反映该參數頁的具体范围,不要所有篩選頁共用一個模板文案。
- 结果為空或结果過少时,返回合适的狀態碼而不是一個空白頁。
- 分頁之間用規范的連結關系串联,避免同一頁通過多種參數组合反复出現。
- 把這類頁面放進站点地图时,只放你确實希望被索引的那些地址。
一條可执行的自查顺序
- 導出近期蜘蛛日誌里带參數的 URL,按參數名归组,看抓取量集中在哪几類。
- 用站点查询或索引狀態工具,確認這些參數頁里有多少已经進了索引。
- 對照上文分類,给每一组參數打上「放開/合並/屏蔽」的标簽。
- 先處理追踪參數和多维组合頁,观察一到两周的抓取结构變化,再動篩選主维度。
- 记錄每次調整的時間和范围,避免多套規則互相覆盖後说不清是哪一步起的作用。
參數 URL 的管理,本质是给蜘蛛划出一條清晰的路径:哪些地址值得花時間,哪些只是同一批内容的另一種排列。把這件事定期梳理,抓取预算的分配和索引里的頁面构成都會更可控。