网站收录

带参数的 URL 进了索引:收录核对先分清必要参数和跟踪参数

内页链接带上 utm、ref、session 等参数后,同一个内容可能生成多个地址。本文从抽样、看索引状态、查日志到定规范地址,梳理一套参数 URL 核对顺序,并说明哪些参数可以忽略、哪些需要保留,帮助减少重复版本对抓取和索引的干扰。

网站收录

带参数的 URL 进了索引:收录核对先分清必要参数和跟踪参数

很多站点的内页链接在分享、投放或站内推荐时,会带上 utm、ref、session、from 等参数。用户点开后地址变了,内容还是同一篇。搜索蜘蛛沿着这些链接抓取,就可能把同一个页面抓成多个地址。时间一长,索引里出现若干版本,主地址反而被稀释。核对收录时,先别急着改标题和正文,先把参数 URL 这件事理清。

先分清:是抓取多了,还是索引多了

参数 URL 被抓取,不一定进索引;但索引里出现多个参数版本,通常需要处理。核对时把两件事分开看:

  • 抓取层:服务器日志里参数 URL 的请求量是否明显偏高,是否挤占了主地址的抓取频次。
  • 索引层:用 site 查询或搜索控制台的覆盖率报告,看参数版本是否被收录、以哪个地址为主。

如果只在日志里看到抓取,索引里没有,可以先观察;如果索引里已经出现多个版本,就要进入下一步。

一套可执行的核对顺序

  1. 抽样导出参数 URL:从站内链接、广告链接、分享按钮、跳转服务里各取一批,记录参数名和出现位置。先区分必要参数和跟踪参数。
  2. 查索引状态:搜索控制台或第三方工具,看每个参数版本是否被索引、标题和摘要是否正常。不要只看一个工具,口径不同结论会偏。
  3. 看日志与响应:参数 URL 返回什么状态码、响应时间多少、抓取频次是否压过主地址。若大量参数地址返回 200,索引膨胀风险更高。
  4. 定规范地址:每个内容确定唯一主 URL。canonical 指向主地址,内链和分享链接尽量直接使用主地址,不再自动拼接跟踪参数。
  5. 处理无功能参数:对纯跟踪参数,优先清理链接来源;需要屏蔽时,先确认不会挡住主地址的发现和 canonical 传递。robots.txt 不是万能开关,用错反而让蜘蛛看不到主地址。
  6. 观察与迭代:改完后看索引和日志变化,按周或按月核对,不要期待立刻合并。

哪些参数该留,哪些该忽略

不是所有参数都要一刀切。分页、排序、筛选、语言切换等参数,有时承载了不同内容或不同入口,需要单独判断。跟踪参数、会话 ID、来源标记、随机值,通常只服务于统计或临时状态,应该忽略。判断标准可以简单问一句:去掉这个参数后,页面内容是否还一样?如果一样,它大概率不该成为独立地址。

  • 保留:分页、必要的筛选组合、多语言或多地区入口,前提是它们有独立价值和可索引内容。
  • 忽略:utm、ref、from、session、随机数、点击 ID,以及只用于跳转的中间参数。
  • 慎用:排序和视图切换,可能生成大量组合,建议用 canonical 指向默认视图,或限制可抓取范围。

常见误区

加了 canonical 不等于问题立刻消失。搜索引擎需要重新抓取、重新判断,索引合并需要时间。参数 URL 没有自然流量也不代表可以放着不管,它可能持续消耗抓取资源,让重要页面更新变慢。

另一个误区是直接用 robots.txt 屏蔽全部参数。屏蔽抓取后,蜘蛛可能无法读取参数页上的 canonical,主地址的发现也可能受影响。更稳妥的做法是先清理内链和站内跳转,再对真正无价值的参数做规范处理。

小范围验证,再定规则

站点大、模板多时,不要一次性全站改。先选一个栏目或一组模板,抽样 20 到 50 个参数 URL,按上面的顺序走一遍,看索引和日志有没有变化。确认有效后再扩展到其他模板。收录核对本来就是细活,先把参数 URL 这条线理清,再去看内容质量、内链和页面更新,判断会更准。