网站收录

筛选参数与站内搜索结果页:程序化 URL 的收录判断

筛选、排序、标签聚合和站内搜索结果页往往由模板批量生成,同一批内容可能对应多个网址。本文按内容独立性和搜索需求把它们分成三类,分别给出保留、canonical 收敛、noindex 三种处理方式,并列出配置中容易踩的坑与验证方法。

网站收录

筛选参数与站内搜索结果页:程序化 URL 的收录判断

很多站点的 URL 数量远大于内容数量,原因多半出在程序化生成的页面上:一套筛选条件、一个排序参数、一次站内搜索,就能拼出一个新网址。这类 URL 不是垃圾,但也不是每一页都值得占用索引位置。判断的核心其实只有两点:这页有没有稳定的独立内容,以及用户会不会拿它当搜索入口。

先把程序化 URL 分成三类

  • 筛选与排序参数页:颜色、价格区间、排序方式等。内容通常与主列表页高度重合,只是顺序或子集不同。
  • 标签与聚合页:由主题词把内容聚在一起,可能有独立价值,也可能只是把已有文章换个顺序排列。
  • 站内搜索结果页:内容随查询词变化,是给站内用户用的工具,一般没有对应的外部搜索需求。

三类页面的处理方式不应该一样,混在一起讨论“要不要收录”很容易得出错误结论。

判断是否值得收录的四个问题

  • 有人在搜索引擎里搜这个词吗?如果有稳定的搜索量,页面才有机会自己带来流量。
  • 它和父级列表页的内容差异有多大?如果只是排列组合,重复度会很高。
  • 有没有稳定的站内入口?只靠参数拼接、没有任何页面链进来的 URL,抓取优先级会很低。
  • 参数组合是否可控?无限组合意味着无限 URL,爬虫预算会被快速消耗。

三种处理方式

值得保留的:做好内容和内链

有搜索需求、内容确实不同的筛选页或标签页可以保留,但要给它一段说明文字、合理的标题,并确保有站内链接指向。否则它即使被收录,也很难获得展现。

重复度高的:用 canonical 收敛

把参数页或排序页的 canonical 指向对应的主列表页,让权重集中到一处。前提是两者内容确实高度一致,指向不相关页面反而会造成混乱。

没有独立价值的:退出索引

站内搜索结果页、无意义参数组合通常适合加 noindex。注意 noindex 需要页面能被抓取才能被读到,如果同时在 robots.txt 里屏蔽,爬虫看不到这个标签,页面仍可能因为外部链接以“仅 URL”的形式出现在索引里。

robots.txt 管的是能不能抓,noindex 管的是能不能进索引。想让它退出索引,就别挡住抓取。

几个容易踩的坑

  • 全站参数页统一 noindex,结果把有搜索价值的聚合页也一起关掉了。
  • canonical 和 noindex 同时出现在同一页,两个信号互相冲突,最终按 noindex 处理。
  • 筛选页全部屏蔽后,内容页的站内链接路径变少,反而拖慢了新内容的发现。
  • 上线后不复查,参数规则改了但旧配置还留在模板里。

怎么验证处理是否有效

  1. 在索引覆盖率报告里看“已排除”的原因分布,确认是被 noindex 还是被判为重复。
  2. 抽查一批参数 URL,看 canonical 指向是否符合预期。
  3. 对比处理前后抓取日志中参数页的请求占比,确认爬虫预算是否回流到内容页。
  4. 保留的聚合页观察一到两个抓取周期,看是否进入索引并有展现。

程序化 URL 的处理没有统一答案,关键是把“有独立价值”和“只是排列组合”分开对待。与其一刀切地全开或全关,不如按类型定规则,再定期用报告和日志回头验证。