站点跑一段时间后,参数 URL 往往会在索引里堆积:筛选、排序、分页、来源追踪,同一批商品或文章会长出几十上百个地址。这些地址该不该进索引,不能一刀切,先看它们对用户和搜索引擎各自意味着什么。
先给参数分个类
会改变页面内容的参数
比如颜色筛选、价格排序、翻页这类参数。它们对应的页面内容确实不同,也可能存在一定的搜索需求,例如“某颜色某品类”“按销量排序”这类查询。可以保留一部分,但要控制参数组合的数量,避免同类页面无限膨胀。
不改变页面内容的参数
比如来源追踪、会话 ID、渠道标识、展示版本号。它们只是记录访问路径,页面主体内容与不带参数的地址基本一致。这类地址对用户没有额外价值,却会成倍增加需要抓取的 URL 数量,也容易让同一段内容出现多个入口。
判断标准其实只有一条
问自己:这个地址上的内容,是否已经有一个更规范、更稳定的地址可以代表它?如果答案是“有”,那它更像是一条访问路径,而不是一个独立页面。按这个标准去筛,大部分参数 URL 的归属会很快清晰。
处理顺序可以这样排
- 先统计:从服务器日志或搜索资源平台的抓取数据里,把带参数的 URL 拉出来,按参数名归类,看每个参数产生了多少地址、被抓了多少次。
- 再判断价值:有真实搜索需求、内容确实不同的,考虑保留;只是换了排序、换了来源、换了展示样式的,优先收敛。
- 选择手段:不需要收录的,可以用 robots.txt 屏蔽抓取,或在页面上加 noindex;内容相同但需要保留给用户访问的,用 canonical 指向规范地址。注意 robots.txt 屏蔽之后,搜索引擎读不到页面上的 noindex。
- 收回内链:站内链接、分页链接、导航尽量只指向规范地址。如果站内到处都链向参数地址,前面的处理很容易被抵消。
- 回头看数据:处理完观察一段时间,看带参数 URL 的抓取量和索引量是否下降,规范地址的抓取是否更集中。
站内搜索结果页要单独看
站内搜索页由用户输入关键词生成,数量几乎无限,内容质量参差,很容易积成一堆薄页面。常见做法是允许抓取但不收录,或在 robots.txt 里屏蔽搜索路径。如果站内搜索本身能带来稳定的长尾访问,可以挑少量高质量结果页人工优化后再放开,但这类页面需要单独维护,并且要防止被外部链接直接指向带关键词的搜索地址。
几个容易踩的坑
- 把 robots.txt 当成“不收录”的工具:它管的是抓取,不是索引。
- 同一批页面同时加 noindex 和 canonical:信号容易冲突,搜索引擎可能更倾向于保留原来的地址。
- 筛选参数被大量内链,蜘蛛反复在参数组合里绕行,真正需要抓取的页面反而排到后面。
- 分页页面一律 noindex:可能切断蜘蛛对深层内容的发现路径。分页和筛选参数的处理方式并不相同。
验证时看什么
验证不需要盯着单个 URL 的收录状态,更应该看趋势:规范地址的抓取比例是否上升,参数地址的抓取是否下降,索引里是否还残留大量只有参数不同的重复条目。如果一段时间后趋势没变,先回头检查内链和 sitemap 里是否还在输出参数地址,这往往是最直接的原因。
参数 URL 的处理不是“全部留下”或“全部屏蔽”,而是先分清哪一条是内容的主地址,再把抓取和索引的入口尽量收敛到它上面。