网站收录

带追踪参数的链接被收录:先按参数类型分,再定规范化顺序

推广链接和分享按钮常给 URL 挂上一串参数,同一页面因此出现多个地址,甚至一起进了索引。处理顺序应先把参数分成追踪、会话、功能和内容四类,再决定哪些合并到规范地址、哪些保留、哪些排除。文中给出内链、canonical、sitemap 到 noindex 的落地次序,以及改完之后该看哪些数据。

网站收录

带追踪参数的链接被收录:先按参数类型分,再定规范化顺序

推广链接、分享按钮、第三方统计常常会在 URL 后面挂一串参数。同一个页面因此出现了多个地址,如果这些地址都被抓取并进了索引,就会出现内容一样、URL 不同的局面。处理这类问题,第一步不是急着屏蔽,而是先把参数按类型分开。

先把参数分成几类

  • 追踪类:utm_source、utm_medium、gclid、fbclid 等,只记录来源,不改变页面内容。
  • 会话或身份类:sessionid、sid、token、用户 ID 等,因人而异,内容基本一致。
  • 功能类:排序、翻页、视图切换,如 sort、page、view=list,会改变呈现结果。
  • 内容类:真正定位内容的参数,如 ?id=123、?pid=456,去掉参数页面就不存在。

分类的意义在于:追踪和会话类参数通常不该产生独立地址;功能类要判断结果页是否有独立价值;内容类参数的地址本身就是要收录的目标。

不改变内容的参数:统一到规范地址

对 utm 这类参数,处理目标是让搜索引擎把带参与不带参的地址视为同一个页面。

  1. 站内链接一律不带追踪参数,尤其是导航、面包屑、正文内链和列表页。
  2. 在带参数版本上输出 canonical 指向无参地址;如果无参版本不存在,先让它可访问。
  3. 对外投放的链接无法逐一控制,可以接受,但要保证这些地址能正常返回,并且 canonical 正确。
  4. sitemap 只放规范地址,不要混入带参数的版本。

canonical 是提示而不是命令,所以链接写法和 sitemap 的一致性同样重要。如果站内到处都在链带参地址,canonical 的效力会被削弱。

改变内容的参数:先判断值不值得收

排序、筛选、翻页参数会产生新的结果页。这些页面内容由同一批条目拼出来,容易出现大量近似页面。判断时可以参考几点:该结果是否有稳定的搜索需求、是否有用户会直接分享这个地址、内容是否只是换个顺序。

  • 有独立需求、内容稳定的结果页,可以保留,并给出清晰的标题和描述。
  • 只是顺序不同、内容高度重叠的结果页,应收敛到一个地址,不要放任各种参数组合被抓。
  • 翻页页面保留,但要保证列表项本身可以被独立发现。

落地顺序:从可逆到不可逆

建议按影响范围从小到大处理。先改内链和 sitemap,这一步是可逆的;再补 canonical;确认之后才考虑 robots.txt 或 noindex。robots.txt 只是禁止抓取,已经进索引的地址不会因此删除,而且被屏蔽后页面上的 canonical 和 noindex 也读不到。因此对希望保留的地址不要用 robots,对确实不要的页面优先用 noindex。

参数处理的核心不是“消灭带参数的 URL”,而是让同一份内容只有一个被推荐的主地址,其余地址要么被合并,要么被明确排除。

改完之后看什么

处理不会立刻反映到索引里。之后可以定期查看索引报告和抓取日志:带参地址的抓取占比是否下降,规范地址是否稳定被抓,canonical 是否被跟随。同时检查服务器有没有因为参数组合过多而产生大量重复抓取。如果日志里带参地址依然活跃,先回去看内链和外链,而不是继续加规则。