站点收录量突然上涨,不一定是好事。很多站长拉出索引里的 URL 一看,发现大量带问号的参数页面:?sort=price、?page=2、?utm_source=...。它们可能只是同一个列表的不同排列,却占用了索引名额,也让报表更难分析。
先别急着屏蔽,分清三类参数
参数本身没有原罪,关键是它有没有创造独立页面价值。常见可以分三类:
- 追踪参数:utm_source、gclid、fbclid 等。它们只用于统计来源,不改变页面内容,通常不应该进入索引。
- 筛选与排序参数:颜色、价格、品牌、排序方式等。有些筛选组合有真实搜索需求,比如“某品牌+某型号”;但大量空结果、重复列表、任意组合,往往只是重复内容。
- 会话与用户标识参数:sessionid、uid、token 等。这类 URL 对搜索引擎没有意义,还可能生成近乎无限的组合。
判断一个参数 URL 该不该留
收口之前,先问几个问题,而不是看到问号就一刀切。
- 这个 URL 是否有独立内容?还是只是同一批商品的另一种排序?
- 它有没有被用户主动搜索的可能?搜索需求可以用关键词工具或站内搜索词验证。
- 它有没有被站内链接、sitemap 或外链大量引用?如果蜘蛛到处都能看到它,收录概率自然更高。
- 它是否产生了实际流量和转化?完全没有访问、也没有独立价值的参数页,通常不值得保留。
如果答案都是否,那么它更可能是索引里的噪音;如果某个筛选组合确实有稳定搜索量和转化,保留并做好规范化更合适。
收口的顺序:先减少发现,再处理已收录
很多人的第一反应是上 robots.txt 或 noindex,但顺序反了会多做很多无用功。建议按以下顺序推进。
- 盘点:从索引、日志和 sitemap 中把带参数的 URL 拉出来,按参数类型、目录、流量分组。
- 定规则:明确哪些参数允许保留,哪些只用于追踪,哪些筛选组合可以收录。最好形成一份 URL 规范文档。
- 改内链和 sitemap:把站内链接指向规范版本,sitemap 只放希望被收录的 URL。蜘蛛少发现一次,就少一次重复抓取和索引的机会。
- 对已索引页面加信号:内容确实相同的参数页,用 canonical 指向规范 URL;不想保留的页面,用 noindex 明确表态。注意:noindex 需要页面能被抓取,否则搜索引擎看不到这个指令。
- 观察:索引更新有延迟,不要今天加 noindex、明天又撤掉。给它几周时间,同时看抓取日志里的参数 URL 是否减少。
robots.txt 禁止抓取和 noindex 不要同时用。禁止抓取后,搜索引擎无法读取页面上的 noindex,已索引的 URL 可能长期留在索引里,只是没有摘要。需要移除索引时,优先保证可抓取,再用 noindex 或 canonical。
几个容易踩的坑
- 全部参数一律屏蔽:可能误伤有搜索需求的筛选页,也会让部分正常页面无法被抓取。
- 只靠 GSC 参数工具:参数工具是临时辅助,不是长期规范。真正决定 URL 是否被发现的,还是站内链接和 sitemap。
- canonical 指向不相关页面:把参数页 canonical 到首页或无关分类,容易被忽略,也浪费了页面本身的潜在价值。
- 忽略分页参数:?page=2 这类分页如果内容正常,通常可以保留;但无限滚动或“查看更多”生成的参数,需要额外收口。
收口之后看什么
参数 URL 的收口不是一次性任务。完成后重点观察三件事:索引里带参数的 URL 是否减少;规范 URL 的抓取和收录是否更集中;站点整体索引质量是否更接近真实内容量。如果发现某些参数页有稳定流量,不必强行删掉,可以把它保留为可索引页面,并确保 canonical、内链和 sitemap 都指向同一个版本。
参数 URL 不是洪水猛兽,关键在于它是否提供了独立价值。不能提供价值的,尽早收口;能提供价值的,就把它当作正常页面来管理。