分頁、篩選、排序頁面是站内最容易产生大量 URL 的地方,也是收錄問题的高發区。它們既不是完全没用的頁面,也不是每一頁都值得進索引——判断标准不是“能不能抓”,而是“這一頁有没有獨立存在的检索價值”。
先把三類頁面分開看
- 分頁:列表的第 2、3、4 頁,通常只是同一批内容的不同片段。
- 篩選:按價格、颜色、地区等條件组合出来的结果頁。
- 排序:按時間、销量、热度切換顺序,内容集合往往完全一样。
三者逻辑不同,混在一起做决策,很容易把该留的屏蔽掉,或者把不该收的全放進来。
分頁頁面:第 2 頁之後通常不追求收錄
對大多數商品列表、文章列表来说,分頁頁面本身没有獨立标题和獨立摘要,用戶也很少通過“列表第 7 頁”找到你。它們的主要作用是让蜘蛛顺着連結繼續往下走,把深层詳情頁發現出来。
常见做法是:分頁頁面保留可抓取、可跟進連結,但不作為索引的重点,也不必强行给每一頁寫獨立的标题和描述。如果分頁 URL 用了參數形式,注意给第 1 頁做自指向 canonical,避免 ?page=1 和主列表頁互相竞争。
篩選頁:判断标准是“這個组合有没有人搜”
篩選頁的價值差异极大。像“城市 + 房型”“品牌 + 型号”這類有稳定搜尋需求的组合,可能值得保留;而颜色 × 尺碼 × 價格区間的排列组合,動辄成千上萬條 URL,绝大多數没有獨立需求。
判断时可以問三個問题:這個组合會不會有人在搜尋框里輸入?頁面上的内容量是否足以支撑一個獨立頁面?如果去掉篩選條件,剩下的内容是不是和主列表頁几乎一样?三個問题里有两個答不上来,就倾向于不進索引。
几種常见處理手法的邊界
- noindex:让頁面留在索引之外,但蜘蛛仍會抓取,适合内容量不足、却仍有導航價值的篩選頁。
- robots.txt 屏蔽:连抓取都禁止。适合參數组合爆炸、完全没有收錄必要的頁面;但屏蔽之後頁面上的内鏈也就断了,要確認不會影响重要頁面的發現。
- canonical 指向主列表頁:适合内容高度重合的排序頁、會话參數頁。注意 canonical 是建议而非命令,也不要和 noindex 同时使用。
- 參數規范:固定參數顺序、去掉無用跟踪參數,让同一组條件只對應一個 URL。
- 分层導航:把有價值的篩選组合做成静態入口,放在頁面上可点击的位置,而不是只留在表單里。
一個可执行的判断顺序
- 先用服務器日誌或搜尋控制台,看哪些分頁、篩選 URL 已经被抓取,抓取量有多大。
- 把有獨立搜尋需求、内容足够的组合挑出来,保留在索引里。
- 内容重复度高的排序頁,统一 canonical 到預設排序版本。
- 無需求、無内容量的參數頁,先收敛參數,再考虑 noindex。
- 確認所有重要詳情頁,仍能通過至少一條正常内鏈被走到。
處理完要观察什么
調整之後不要只盯着“收錄數量降了多少”。更值得關注的是:重要詳情頁的抓取是否變多、索引里留下的頁面是否更接近你希望被搜到的那批、以及日誌里爬虫的時間是否從無意义的參數頁轉移到了内容頁。索引數量下降但有效頁面被抓得更勤,通常說明方向是對的。
任何處理方式都不能保證收錄或排名。搜尋引擎最终按自己的判断决定是否索引,站内能做的是把信号整理清楚:让有價值的頁面只有一個地址、能被連結到、内容足够獨立。