很多站点在收錄上遇到的第一道坎,不是内容寫得好不好,而是同一批内容被參數拆成了几十上百個地址。列表頁翻頁、按價格排序、按分類篩選、再加上會话跟踪參數,每一次点击都會生成一個新 URL。蜘蛛顺着連結一路点下去,索引里很快就堆满了相似度极高的頁面。
先分清三類參數頁
參數頁不是铁板一块,處理方式也不一样:
- 分頁參數(page=2、page=3):内容确實不同,属于獨立頁面,通常值得收錄。
- 篩選參數(品牌、價格区間、尺寸组合):容易生成大量長尾组合,多數只是同一批商品的重新排列。
- 排序參數(sort=price、order=desc):内容是同一批,只是顺序不同,几乎没有獨立價值。
分頁頁该怎么處理
分頁頁承载的是不同的商品或文章,属于正常内容。需要做的是让蜘蛛能顺着翻到後面,而不是把頁碼当成垃圾參數一刀切掉。
- 頁碼用可点击的連結,不要只靠脚本動態加载。
- 第二頁之後的頁面保留自指 canonical,不要全部指向第一頁。
- 标题可以带上頁碼或区間,避免几十個頁面标题完全一样。
如果分頁頁本身没有可索引的内容,只是一個“查看更多”的入口,那它更接近導航功能,收錄價值有限。
篩選與排序參數頁的判断标准
判断一個參數頁要不要放進索引,先問三個問题:
- 它有没有自己獨立的、用戶會去搜的词?比如“3000 元以内的降噪耳机”可能有搜尋需求,“按價格從低到高”没有。
- 去掉參數之後,頁面主体内容是否几乎不變?如果只是顺序或范围變化,重复度就很高。
- 它是否會被站内連結稳定指向?没有任何頁面鏈過去的參數頁,即使被抓到也难有位置。
參數頁的取舍,本质上是問:這個地址能不能獨立回答一個真實存在的搜尋需求。答案是否定的时候,它更适合留在“可抓取但不收錄”的范围里。
常用的几種處理手段
分清楚類型之後,可用的手段並不多,但要用對:
- canonical:把排序、會话參數指向無參數的主地址。注意它只是提示,冲突时還要看頁面自身信号是否一致。
- robots.txt 禁止抓取:适合那些完全不需要被看到的路径。但被 robots.txt 拦住的地址,搜尋引擎也讀不到頁面上的 noindex。
- noindex:适合“希望被看到、但不希望被收錄”的頁面,前提是蜘蛛能抓到頁面,才能讀到這個标簽。
- 合並參數:把多選篩選做成路径形式的固定组合,减少無意义的组合爆炸。
一個简單的自查顺序
- 導出已被收錄的參數類 URL,按參數類型分组。
- 看每组有没有带来過真實点击;長期零点击且内容重复度高的,優先處理。
- 從内鏈上减少指向低價值參數頁的入口,例如預設排序的連結直接指向主地址。
- 處理完观察一段時間,再看索引里的數量變化。
參數頁處理的目标不是让收錄數字變小,而是让索引里留下的地址都是有人搜、有内容、有入口的頁面。數量降下来只是结果,不是目的。