站点收錄數量波動时,很多人第一反應是去看内容够不够、外鏈多不多,但有一類問题更常见:URL 本身产生得太多、太像,把真正需要被索引的頁面淹没了。分頁、篩選、排序參數就是典型场景。它們不是错誤,但如果全部放開给搜尋蜘蛛,收錄分散和抓取浪費几乎不可避免。
先分清:不同入口和不同頁面不是一回事
同一個商品列表,按價格排序、按销量排序、加上颜色篩選,可能生成几十個 URL。它們展示的是同一批商品,只是顺序或篩選條件不同。對用戶来说,切換排序很方便;對搜尋引擎来说,這些 URL 看起来都是獨立頁面。
如果每個參數组合都被抓取和索引,可能出現几個後果:重复内容稀释主版本、抓取预算被大量近似頁面消耗、索引里出現大量低價值 URL。反過来,如果一刀切全部屏蔽,也可能让一些有獨立搜尋價值的篩選頁失去被發現的机會。所以要先判断:這個 URL 是同一頁面的不同入口,還是真正不同的頁面。
分頁 URL 怎么處理
列表分頁通常是導航路径。第一頁有明确主题,後續頁是同一主题的延續。常见做法是让分頁 URL 可抓取、可索引,但不要把它当成獨立内容頁去竞争。如果分頁内容基本是标题列表,没有額外介绍,把後續分頁设為 noindex 或只允许抓取不索引,可以减少索引膨胀。但要注意,noindex 的頁面依然應该能被抓取,否則站内連結的發現路径會断。
有些站点把分頁 canonical 到第一頁,這要谨慎。分頁不是重复内容,强行归並可能让搜尋引擎誤判。更稳妥的是每個分頁自我引用 canonical,同时控制後續分頁的索引必要性。
篩選和排序參數:按搜尋價值决定去留
排序參數一般没有獨立搜尋價值,比如 ?orderby=price、?sort=desc。這類 URL 建议 canonical 到無參數版本,或者用 robots.txt 阻止抓取。但阻止抓取前要想清楚:如果這些參數 URL 被大量站内連結指向,阻止抓取後搜尋引擎看不到 canonical,可能仍會作為索引候選。此时更合适的方式是统一站内連結到無參數版本,再配合 canonical 或 noindex。
篩選參數更复杂。像“品牌+品類”“價格区間+品類”這類组合,如果确實有用戶搜尋,可以保留一部分有價值的頁面,给它們獨立标题和描述,並确保内容不是简單罗列。没有搜尋需求、只是内部篩選工具生成的參數,則應收敛到主版本。
判断留還是放,可以看這几個信号
- 是否有獨立搜尋需求:有人搜這個组合词,才值得單獨收錄。
- 是否與主版本高度重复:标题、正文、商品列表几乎一样,收錄意义不大。
- 是否有站内入口:孤立的參數 URL 即使被抓到,也难维持更新。
- 是否消耗抓取预算:日誌里大量參數頁被反复抓取,但很少带来点击,就要收敛。
- 是否影响主版本识別:多個 URL 内容相同,canonical 又没指對,主版本會不稳定。
操作顺序:先治理入口,再調整索引
- 從日誌和 sitemap 里梳理參數類型,分清排序、篩選、分頁、追踪參數。
- 确定每個内容集群的主版本 URL,统一站内連結指向它。
- 對無價值參數用 canonical 归並,必要时配合 noindex;不要只依赖 robots.txt。
- 對有價值篩選頁保留索引,但检查标题、正文和内鏈是否足够獨立。
- 观察一段時間,看抓取分布和索引狀態是否變化,再决定下一步。
收錄不是越多越好。把不该收錄的 URL 控制住,比事後從索引里清理更省力。
分頁、篩選、排序參數本身没有對错,關键看它們是否提供了獨立價值。如果只是同一内容的另一種排列,就让它們回到主版本;如果确實满足细分搜尋需求,再给它們獨立的收錄位置。先治理 URL 入口,再谈索引,通常比反复提交 sitemap 更有效。