网站收录

内部搜索页和筛选参数页被收录:判断该留还是该挡的思路

站内搜索页、筛选排序页和追踪参数常被爬虫抓取并进入索引,既占用抓取资源,也让索引报告难以解读。本文把参数 URL 分成内容重复型、独立价值型和无限生成型三类,说明判断该留还是该挡的顺序,以及 noindex、canonical、robots.txt 与内链调整之间该怎么配合。

网站收录

内部搜索页和筛选参数页被收录:判断该留还是该挡的思路

站点上线一段时间后,索引里出现大量带参数的 URL,是运营中很常见的情况。这些地址往往来自站内搜索结果、商品筛选、排序切换或推广链接的追踪参数。它们本身不算错误,但如果不加区分地让爬虫全部抓取和收录,容易挤占抓取资源,也让索引报告变得难以解读。

参数页为什么容易进入索引

爬虫的判断逻辑比较直接:只要一个 URL 在页面上有链接、能返回正常状态码、内容与其他页面有区别,它就有机会被抓取。参数页通常同时满足这几个条件——筛选按钮是链接、页面内容由真实数据渲染、不同筛选组合展示不同结果。

  • 站内搜索结果页:由关键词生成,数量随用户输入不断增长
  • 筛选与排序页:同一批内容的多种排列组合
  • 追踪参数:utm、ref、from 之类,内容与主页面完全相同
  • 会话或分页参数:翻页、每页条数切换

这几类里,只有与正常浏览路径相关的那部分,才值得考虑是否保留在索引中,其余的更多是工具性或统计用途。

先给参数分个类

内容重复型

追踪参数、排序参数(例如 sort=price)、列表与网格视图切换。这类 URL 与主页面内容一致或高度相似,通常不需要单独被索引。

有独立价值型

某个筛选组合对应相对稳定的需求,比如固定的品类加价格区间,页面有稳定的内部链接和访问量。这类页面可以保留,并用规范链接指向它。

无限生成型

站内搜索 ?q=xxx,理论上可以对应任意关键词,数量不可控,一般不适合进入索引。

处理顺序比处理手段更重要

  1. 先确认是否已被索引。用 site: 查询或索引报告确认现状,避免对尚未收录的 URL 做多余操作。
  2. 判断该页是否真的需要出现在搜索结果里。需要就保留并加规范链接,不需要就进入下一步。
  3. 对已索引但不想保留的页面,优先使用 noindex。让爬虫能读到标签,页面才有机会逐步移出索引。
  4. 确认 noindex 生效后,再考虑用 robots.txt 减少抓取。顺序颠倒,爬虫读不到标签,URL 可能长期停留在索引里。
  5. sitemap 中只保留规范、希望被收录的 URL。把参数组合写进站点地图,等于主动扩大抓取范围。
  6. 内链尽量指向不带参数的规范地址。筛选入口可以用按钮或表单实现,减少可爬链接的数量。
robots.txt 管的是能不能抓,noindex 管的是能不能收录。两个用反了,常见表现就是“明明已经屏蔽,索引里还是有一堆参数页”。

验证和后续观察

处理之后不建议立刻下结论。索引更新有自己的节奏,通常需要几周才能看到数量变化。可以定期看这几处:

  • 索引报告里参数页 URL 的数量趋势
  • 抓取统计中,参数页与内容页各自的抓取占比
  • 站内搜索页是否还在被反复抓取

如果参数页抓取量下降,但内容页的抓取量没有增加,可能是内部链接结构过度依赖参数入口,需要回头检查导航和列表页的链接写法,把可抓路径重新引回规范页面。

参数页的处理核心不是“全部屏蔽”,而是分清哪些是重复、哪些有独立价值、哪些根本不该被生成成可抓链接。分类清楚之后,再组合使用 noindex、canonical、robots.txt 和内链调整,索引结构会清晰很多,收录数字也更容易解读。