网站收录

筛选参数一开,收录里多出几百个 URL:参数页的取舍与收敛

站内一开筛选,索引里就多出一批带参数的地址。问题不在于收录本身,而在于这批 URL 稀释抓取预算、和主页面互相竞争。文章把参数分成内容型、排序型、追踪型三类分别处理,说明哪些值得保留索引、哪些该屏蔽,以及已经进索引的参数页按什么顺序退出。

网站收录

筛选参数一开,收录里多出几百个 URL:参数页的取舍与收敛

站内加一个筛选功能,本来是给用户用的:选颜色、选尺码、按价格排序,几秒钟就能把范围缩小。过一段时间去看索引,却发现多出一批带参数的地址,颜色、尺寸、排序方式任意组合,数量很快从几十变成几百。这类 URL 进索引不是简单的“多收录几页”,它会稀释抓取预算、让同一批内容互相竞争,也会让页面数量统计变得没法看。

先分清参数属于哪一类

  • 内容型参数:真正切换了内容集合,比如按城市、按品类、按户型筛选,筛选结果对应着一批用户真实会搜的东西。
  • 排序与视图型参数:sort、order、view、每页条数这类,内容主体没变,只是顺序或者分页大小变了。
  • 追踪型参数:utm 系列、广告点击标识、来源标记、会话 ID,对内容毫无影响,只是记录了用户从哪来。

分类的意义在于后面的处理完全不同:追踪型基本可以一律不放行;排序与视图型大多不值得单独索引;只有内容型才需要逐个判断。

判断一个参数页值不值得留在索引里

  • 有没有独立搜索需求:有人会搜“某城市 三居 学区”这类组合,这个筛选页就有存在理由;只是把结果换个排序,不会有人这样搜。
  • 内容是否自洽:筛选后结果为空、只剩一两条,或者与上级分类页大面积重合,价值就很低。
  • 是否可稳定访问:同一组筛选条件每次打开结果都不一样,比如库存波动、随机推荐,索引它意义不大。
  • 数量是否可控:组合数一旦上千上万,先按路径或参数维度整体收敛,不要指望逐条去优化。

动手处理时的动作顺序

  1. 先看日志和目标站数据。抓取量里参数 URL 占了多少、其中又有多少进了索引,这个比例决定了你要投入多大精力。
  2. 给规范地址一个明确指向。内容型筛选页如果决定保留,就让它指向自己;排序、视图类的变体,规范指向不带参数的基准地址。注意规范标签是建议而非命令,所以还需要后面的动作兜底。
  3. 让参数顺序固定下来。同一个条件生成两种顺序的地址,等于自己造重复页。程序里统一排序、统一小写、丢掉空参数。
  4. 区分 robots.txt 屏蔽和 noindex。robots.txt 挡的是抓取,已经进索引的页面不会因为加了屏蔽就消失;而 noindex 需要页面被爬到才生效。合理顺序是:新生成的、不想被发现的路由可以直接在 robots.txt 里挡掉;已经被收录的,先让页面本身返回 noindex 或跳到基准地址,等它退出索引之后,再决定要不要加屏蔽。
  5. 追踪参数单独处理。用重定向或者规范标签把来源标记剥掉,别让带追踪参数的地址混进索引。

已经被收录的参数 URL 怎么收

如果这批页面本身有价值,先别急着删,而是看它们有没有带来访问和转化,有的话考虑整理成一组正式的着陆页。没有价值的,按“改指令、等重新抓取、观察退出”的节奏走。不要在同一天把规范标签、noindex、robots 三件事一起改,出了问题会分不清是哪一步起的作用。

一次性屏蔽全部参数,可能连带把真正有用的筛选页一起挡掉;而且屏蔽之后,日志里也看不到这些 URL 的抓取记录,后续排查少了一条线索。

一个可以直接照着走的核对清单

  • 参数顺序、大小写、空值是否已经统一
  • 排序与视图类参数是否都指向了不带参数的基准地址
  • 已收录的参数页有没有安排退出路径
  • 站内链接(包括分页、标签、推荐位)里是否混进了带参数的地址
  • 日志中参数 URL 的抓取占比是否在下降

参数页带来的麻烦通常是慢慢累积的:今天多几十条,下个月多几百条,等到抓取明显被占满才回头收拾,代价会大很多。定期扫一眼日志,比事后补齐要省事。