网站收录

参数 URL 的收录取舍:哪些该放行,哪些在抓取层就拦掉

参数 URL 容易在抓取和收录之间被混为一谈。本文把常见参数按用途分类,给出放行、收敛和拦截的判断顺序,并说明 robots、noindex、canonical 与 sitemap 各自该管哪一段,方便站点运营定期抽查和调整。

网站收录

参数 URL 的收录取舍:哪些该放行,哪些在抓取层就拦掉

带参数的 URL 在站内很常见:筛选、排序、分页、跟踪来源、会话标识,随手一点就可能生成一个新地址。讨论收录时,容易把“蜘蛛抓不抓”和“索引收不收”混在一起,结果规则互相打架。更稳的做法是先按参数用途分类,再分别决定抓取层和索引层怎么处理。

抓取允许不等于希望被收录

robots.txt 的 Disallow 管的是抓取,不是索引。一个 URL 被 Disallow 后,蜘蛛通常拿不到页面内容,也就看不到页面里的 noindex。反过来,noindex 需要蜘蛛至少抓取一次才能读到。所以如果某个参数 URL 确定不想进索引,优先让它可抓取,再用 noindex;如果它只是数量太大、抓取成本高,才考虑在抓取层拦掉。

常见参数类型与处理方向

  • 筛选和排序参数:如果筛选结果能形成稳定、有搜索需求的页面,可以保留;如果只是同批商品的换序展示,通常用 canonical 指回主列表页,或让内链只指向默认排序。
  • 跟踪参数:如来源、活动、渠道标识。这类参数不改变页面内容,适合在规范 URL 中统一去掉,内链和 sitemap 都不要带。
  • 会话 ID 和临时令牌:会为同一页面生成大量地址,通常直接在抓取层限制,同时保证正常用户访问不受影响。
  • 站内搜索和结果页:多数时候不该被索引,可以用 noindex,但不必急着 Disallow,除非蜘蛛已经大量抓取。
  • 分页参数:要单独判断,第 2 页以后是否值得收录,取决于内容是否独立、是否有用户直接访问的需求。

用一套顺序做判断

  1. 这个参数 URL 是否有独立且稳定的内容,而不是同一批内容的重新排列?
  2. 用户会不会直接搜索到它,或者从站外链接进入?
  3. 它会不会批量生成近似页面,把抓取预算拉走?
  4. 站内有没有稳定的入口和链接指向它,还是只靠参数拼接?
  5. 半年后是否还有人维护,还是活动结束就变成死链接?

五个问题里,如果多数答案是否定的,就不必让它进入索引。判断完再选手段:抓取层拦截、页面级 noindex、canonical 收敛,三种方式的目标不同,不要混着用。

索引层的几个配合点

canonical 是建议信号,不是强制指令。如果页面内容确实不同,硬指 canonical 通常无效;如果内容相同,内链、sitemap 和 canonical 最好指向同一个规范 URL。sitemap 只放希望被收录的规范地址,不要把带跟踪参数的版本也塞进去。内链也一样,默认排序、默认筛选的链接优先。

不要用 robots.txt 屏蔽一个 URL,又指望页面里的 noindex 生效。蜘蛛拿不到页面,就看不到 noindex。

定期抽查,别只看规则

规则定完之后,还要看实际结果。日志里可以观察蜘蛛抓了哪些参数、返回什么状态码、同一类参数是否被反复抓取。索引抽查则看目标 URL 是否进入索引、展示的是哪个版本。把同一批 URL 隔一段时间再对一次,比一次性改完更可靠。

参数 URL 的处理很少一步到位。先分类,再按“抓取层管成本、索引层管质量”的思路小步调整,观察一段时间再收窄或放宽,通常比一次性全站规则更可控。