网站收录

站内搜索页和筛选页被大量收录:先分类,再决定收还是放

站内搜索页和筛选页常被大量抓取,处理时不宜一刀切。本文按 URL 特征把这类页面分成搜索词结果页、单条件筛选、多条件组合、排序参数和会话参数几类,给出保留与收敛的判断标准,以及 canonical、noindex、robots 屏蔽和链接控制的搭配方式和处理顺序。

网站收录

站内搜索页和筛选页被大量收录:先分类,再决定收还是放

很多站点在查收录数据时,会突然发现一批意料之外的 URL:站内搜索结果页、带筛选条件的列表页、各种排序组合。它们的共同点是能被生成、能被链接到、也能被蜘蛛顺着抓到,于是慢慢出现在索引里。处理这类页面,最怕两种做法:一种是一刀切全部屏蔽,另一种是放着不管任其增长。更实际的思路是先把它们分类,再按类别决定留还是收。

为什么这类页面容易被大量抓取

站内搜索和筛选本来是为了帮用户缩小范围,但技术上它们大多通过 URL 查询参数实现。用户在页面上点几下,就会产生一个新的 URL;如果这些链接以普通 a 标签形式存在,蜘蛛同样可以点击、跟随、抓取。一个内容量中等的站点,筛选维度只要有三四个,组合出来的 URL 数量就可能远超正文页本身。

另一个原因是这些页面往往并不孤立:它们和列表页、详情页之间有正常的内链,蜘蛛在抓列表页时顺手就把它们带走了。所以问题通常不是蜘蛛主动去找,而是站点自己把它们递了过去。

先分类,再判断

把这类 URL 按特征分成几组,处理起来会清晰很多:

  • 搜索词结果页:例如 ?q=关键词,内容随用户输入变化,理论上接近无限。
  • 单条件筛选:例如 ?color=red,维度固定、取值有限。
  • 多条件组合:例如 ?color=red&size=m&sort=price,组合数量呈倍数增长。
  • 排序参数:例如 ?sort=new,内容与默认页高度重合,只是顺序不同。
  • 会话与追踪参数:例如 ?sid=、?from=,同一个页面被复制成多份。

分类之后,判断标准主要看三点:这个页面有没有独立的搜索需求、内容是否足够独特、数量是否可控。三点都满足的,可以考虑保留;只满足一部分的,适合做收敛;都不满足的,收掉更省事。

可以考虑保留的情况

某些筛选维度本身就是用户会直接搜索的词,例如品牌加型号、城市加服务类型。这类页面如果能稳定提供该组合下的真实结果,并且有独立的标题、描述和一定量的正文内容,它就有成为着陆页的价值。但前提是数量有限、组合有意义,而不是让程序自动拼出成千上万个。

建议收敛的情况

排序参数、会话参数、无意义的多条件组合,通常没有独立价值。它们与主列表页内容高度重复,只改变呈现顺序或来源标记,留在索引里只会增加重复内容的比例,影响对站点整体内容质量的判断。

处理方式的搭配

  • canonical 指向主列表页:适合内容基本一致、只是参数不同的页面,让索引归属集中到主页面。
  • noindex:适合页面本身有内容、但不希望出现在搜索结果里的情况。需要注意页面必须能被抓取,蜘蛛才能读到这个标签。
  • robots.txt 屏蔽:适合组合数量巨大、没有收录价值、也不想消耗抓取资源的路径。屏蔽后蜘蛛读不到 noindex,已收录的旧 URL 可能长期留在索引里,需要配合其他处理。
  • 链接层面控制:筛选链接改为按钮或表单提交,或对链接加 nofollow,从源头减少被发现的机会。
处理这类页面的目标是让抓取和索引集中在真正有内容的 URL 上,而不是把某个数字压下去。不同做法有各自的副作用,改之前先想清楚希望达到什么状态。

一个可以参考的处理顺序

  1. 导出一段时间内的抓取与收录数据,按 URL 特征归类。
  2. 统计每类的数量和内容重合度,区分值得留和应该收的。
  3. 对应该收的,先判断是否还在被大量抓取,再决定用链接控制、canonical 还是屏蔽。
  4. 调整后观察一段时间,看正文页的抓取量是否因此变多。
  5. 复查索引中旧 URL 的变化,没处理的再补一轮。

改完之后看什么

这类调整的效果不会立刻显现。比起盯着收录总数,更值得关注的是正文页的抓取频次、索引里有效 URL 的占比,以及新内容从发布到被处理的节奏是否变顺。如果调整后正文页抓取没有明显变化,说明瓶颈可能不在这些参数页上,需要回到内链结构和内容本身去看。

最后提醒一点:站内搜索页和筛选页并不是天然有害,它们只是容易被无限制地生成。把它当成一类需要管理的 URL 类型,分类、取舍、观察,通常比一次性全部关掉要稳妥。