站点运营

站点运营:URL 参数自查,别让蜘蛛在参数组合里打转

带参数的 URL 常常能生成大量地址,让蜘蛛在相似页面之间反复游走。这篇文章从参数分类、自查步骤、处理方式到内链一致性,整理一套可直接照着做的检查清单,帮站长把抓取预算留给真正有价值的页面。

站点运营

站点运营:URL 参数自查,别让蜘蛛在参数组合里打转

站点跑起来之后,很多人会发现抓取日志里出现大量内容几乎一样、只有尾巴上参数不同的地址。它们不是错误页面,也不会报 404,但会让蜘蛛在同一个内容上反复走。参数本身没错,问题在于我们是否清楚哪些参数该被当成页面的一部分,哪些只是工具留下的痕迹。

参数为什么会变成抓取陷阱

一个列表页加上筛选、排序、每页条数、来源追踪,组合起来就是几十上百个地址。这些地址对用户可能都有意义,对搜索引擎来说却是同一份内容的多个副本。如果站内链接和外部入口又把它们混着指,蜘蛛就会把有限的抓取额度花在这些近似地址上,真正的内容页反而排到后面。

先把参数分三类

  • 跟踪类:utm_source、gclid、from、spm 之类,只用于统计来源,不影响页面内容。这类参数通常不应该产生独立可抓取的地址。
  • 筛选排序类:价格区间、品牌、排序方式、每页条数。它们会改变列表内容,但大量组合容易稀释权重,需要判断哪些值得被收录。
  • 会话与临时类:sessionid、token、时间戳、随机数。这类参数最好根本不进链接,一旦出现在可抓取地址里,就是无穷尽的地址生成器。

自查可以按这个顺序走

  1. 从服务器日志或抓取统计里导出最近一段时间被抓取的地址,按参数名做一次聚合,看看哪些参数出现频次最高。
  2. 逐个参数打开对应页面,确认内容是否真的发生变化。内容不变却生成了新地址,就是首先要处理的对象。
  3. 检查站内链接:导航、面包屑、相关推荐、分页按钮,是否把带跟踪参数的地址写进了 href。
  4. 检查外链与投放素材落地页,确认是否需要统一到干净地址,避免蜘蛛从外部顺着参数版本进来。
  5. 检查站点地图与主动提交的地址列表,确认里面没有混入参数版本。

三类参数,三种处理思路

跟踪类参数,优先从源头去掉:站内链接不要带,统计代码在跳转或上报时处理,而不是把参数写死在页面里。如果已经有历史地址存在,可以用 canonical 指向干净版本,让蜘蛛知道哪一份是正本。

筛选排序类参数,重点在取舍。与主列表高度重合、搜索量又低的组合,可以通过 robots.txt 屏蔽部分参数路径,或者在服务端对无意义组合直接返回主列表。真正有独立价值、有搜索需求的筛选页,再考虑开放抓取并配上独立的标题与描述。

会话与临时类参数,应该尽量不出现在可抓取链接中。若历史遗留,可在 robots.txt 中按参数名屏蔽,同时确认这些地址没有被内链引用。

屏蔽参数前先看清代价:robots.txt 挡住的是抓取,不是索引。如果别处还有指向该地址的链接,它仍可能出现在结果里,只是你无法用页面上的指令去影响它。所以从链接源头清理,通常比单纯屏蔽更彻底。

内链与提交要保持一致

参数问题的根源往往不在服务器,而在链接习惯。同一篇文章,导航里给的是干净地址,列表页给的是带 utm 的地址,分享按钮又给一个带 from 的地址,蜘蛛收到的就是三条互相矛盾的线索。把内链规则统一成一套,比事后写规则更省事。

提交站点地图和主动推送时,也只放干净版本。提交列表本身如果混入参数地址,等于亲手把蜘蛛引向副本。

处理完之后看变化

改完不必急着下结论。隔一段时间再看抓取日志,观察参数类地址的出现频次是否下降,内容页的抓取次数是否上来,索引里是否还挂着重复条目。参数治理很少一次做完,新功能上线、投放活动、第三方工具接入,都可能重新引入一批参数。把它当成一项定期复查的日常动作,比一次性清理更实用。