網站收錄

分頁、篩選、排序參數頁:哪些该進索引,哪些该留在门外

分頁、篩選、排序參數经常把同一批内容拆成一堆相似地址,让索引里塞满重复頁面。本文按參數類型区分處理思路:分頁该保留、排序该收敛、篩選先看有没有獨立搜尋需求,並說明 canonical、noindex、robots.txt 各自适用的场景和一套可执行的自查顺序。

網站收錄

分頁、篩選、排序參數頁:哪些该進索引,哪些该留在门外

很多站点在收錄上遇到的第一道坎,不是内容寫得好不好,而是同一批内容被參數拆成了几十上百個地址。列表頁翻頁、按價格排序、按分類篩選、再加上會话跟踪參數,每一次点击都會生成一個新 URL。蜘蛛顺着連結一路点下去,索引里很快就堆满了相似度极高的頁面。

先分清三類參數頁

參數頁不是铁板一块,處理方式也不一样:

  • 分頁參數(page=2、page=3):内容确實不同,属于獨立頁面,通常值得收錄。
  • 篩選參數(品牌、價格区間、尺寸组合):容易生成大量長尾组合,多數只是同一批商品的重新排列。
  • 排序參數(sort=price、order=desc):内容是同一批,只是顺序不同,几乎没有獨立價值。

分頁頁该怎么處理

分頁頁承载的是不同的商品或文章,属于正常内容。需要做的是让蜘蛛能顺着翻到後面,而不是把頁碼当成垃圾參數一刀切掉。

  • 頁碼用可点击的連結,不要只靠脚本動態加载。
  • 第二頁之後的頁面保留自指 canonical,不要全部指向第一頁。
  • 标题可以带上頁碼或区間,避免几十個頁面标题完全一样。

如果分頁頁本身没有可索引的内容,只是一個“查看更多”的入口,那它更接近導航功能,收錄價值有限。

篩選與排序參數頁的判断标准

判断一個參數頁要不要放進索引,先問三個問题:

  1. 它有没有自己獨立的、用戶會去搜的词?比如“3000 元以内的降噪耳机”可能有搜尋需求,“按價格從低到高”没有。
  2. 去掉參數之後,頁面主体内容是否几乎不變?如果只是顺序或范围變化,重复度就很高。
  3. 它是否會被站内連結稳定指向?没有任何頁面鏈過去的參數頁,即使被抓到也难有位置。
參數頁的取舍,本质上是問:這個地址能不能獨立回答一個真實存在的搜尋需求。答案是否定的时候,它更适合留在“可抓取但不收錄”的范围里。

常用的几種處理手段

分清楚類型之後,可用的手段並不多,但要用對:

  • canonical:把排序、會话參數指向無參數的主地址。注意它只是提示,冲突时還要看頁面自身信号是否一致。
  • robots.txt 禁止抓取:适合那些完全不需要被看到的路径。但被 robots.txt 拦住的地址,搜尋引擎也讀不到頁面上的 noindex。
  • noindex:适合“希望被看到、但不希望被收錄”的頁面,前提是蜘蛛能抓到頁面,才能讀到這個标簽。
  • 合並參數:把多選篩選做成路径形式的固定组合,减少無意义的组合爆炸。

一個简單的自查顺序

  1. 導出已被收錄的參數類 URL,按參數類型分组。
  2. 看每组有没有带来過真實点击;長期零点击且内容重复度高的,優先處理。
  3. 從内鏈上减少指向低價值參數頁的入口,例如預設排序的連結直接指向主地址。
  4. 處理完观察一段時間,再看索引里的數量變化。

參數頁處理的目标不是让收錄數字變小,而是让索引里留下的地址都是有人搜、有内容、有入口的頁面。數量降下来只是结果,不是目的。