不少站点的收錄問题並不是出在正文质量上,而是出在一堆带參數的地址上。同一個頁面,因為排序方式、追踪来源、篩選條件不同,被生成了几十個甚至上百個地址。蜘蛛抓到的是同一份内容,索引里留下的却是多個入口。要處理這類問题,先分清參數的類型,再决定哪些放行、哪些收敛。
第一步:把參數按用途分成三類
參數名字五花八门,但用途基本逃不出三類:
- 篩選與排序:如 ?sort=price、?color=red、?page=2,它們會改變頁面上呈現的结果。
- 追踪與来源:如 ?utm_source=、?from=、?ref=,它們不改變内容,只记錄流量来源。
- 會话與狀態:如 ?sid=、?sessionid=、?token=,同一用戶在不同时刻訪問,地址可能都不同。
分類的意义在于:追踪類和會话類參數几乎總是應该收敛,而篩選排序類要看它是否真的产生了有價值的、可以被獨立搜尋的頁面。
追踪參數:優先從源头减少
追踪參數的麻烦在于它极其容易扩散。一次外鏈投放、一次站内 banner、一次邮件推送,可能就给同一個頁面加上了不同的後缀。而站内連結如果直接複製了目前地址,這些參數就會被蜘蛛顺着爬一遍。
處理顺序建议是先管住生成端:分享、投放、内部跳轉统一使用不带追踪參數的規范地址,追踪信息用脚本在落地後附加。這样至少不會让參數顺着内鏈扩散到全站。
篩選與排序參數:判断是否值得成為獨立頁面
判断标准可以简化成一句话:這個參數组合出来的頁面,用戶會主動搜尋它吗?
- 會:比如品牌加品類的组合,或者有稳定搜尋量的規格篩選,可以考虑保留收錄,並让它可以被抓取、被内鏈指向。
- 不會:比如任意颜色、任意價格区間的排列组合,數量按乘法膨胀,單頁内容稀薄,通常應当收敛。
当组合數量呈乘法增長时,比較稳妥的做法是只放行少數有明确搜尋需求的组合,其余用 canonical 指向主列表頁,或者让它從一開始就不产生新的 URL。要留意的是,被 canonical 指向的目标頁本身必须可抓取、可正常返回,否則這個信号等于落空。
收敛手段的先後顺序
- 先在生成端控制:前端能完成的篩選尽量不跳轉、不改地址。
- 再统一内鏈:站内連結只指向規范地址,不要把带參數的地址寫進導航、面包屑或文章正文。
- 然後用 canonical 指向規范版本,並確認規范版本自身狀態正常。
- 最後才考虑 robots.txt 屏蔽或 noindex。屏蔽會让蜘蛛看不到 canonical 提示,這两者的取舍要想清楚。
如果带參數的地址已经被大量收錄,不建议一次性全站屏蔽,那样可能连带影响有效頁面的抓取額度。更稳的做法是按目錄、按參數名分批處理,观察抓取與索引的變化再推進下一步。
處理之後的观察方式
參數收敛不是改完就见效的。可以按參數名分组,观察站点地图里提交的地址數量、蜘蛛對規范版本的抓取频次,以及規范版本自身的索引狀態。如果規范版本長期不被抓取,說明内鏈和入口還没理顺,此时繼續叠加 canonical 的意义有限,應该先回头补入口。
把參數分清、把入口理顺,剩下的才是内容质量的問题。反過来,如果參數地址一直泛滥,内容做得再好,也容易被分散到多個索引入口上,看收錄表現时自然會失真。