网站收录

站内搜索结果页和标签聚合页:放开收录还是挡住

站内搜索页、标签页和自动生成的聚合页常常占据收录量的大头,却缺少独立价值。本文从抓取日志出发,说明怎样判断这些 URL 该保留还是收敛,以及 robots.txt 屏蔽与 noindex 的区别和常见误用。

网站收录

站内搜索结果页和标签聚合页:放开收录还是挡住

很多站点做收录自查时,第一反应是看数量:收录多了觉得是好事,收录少了就急着找原因。但收录量本身并不等于有效页面量。站内搜索结果页、标签聚合页、按时间或条件自动生成的列表页,往往占了收录的大头,却几乎没有独立价值。先把这类 URL 理清楚,比盯着总数更有意义。

这些批量生成的页面从哪来

常见来源有几类,它们通常共用同一套模板,只是路径或参数不同:

  • 站内搜索结果页:用户搜一个词就生成一个 URL,词库有多大,潜在 URL 就有多少。
  • 标签页、作者页、专题聚合页:由内容属性自动汇总,条目多时可能有价值,条目少时就是空壳。
  • 排序、筛选、分页参数:同一批内容被拆成多种组合。
  • 日历归档、按年月归档的列表页:早期博客系统自带,现在多数是历史遗留。

判断标准:这个 URL 有没有独立用途

不要用“是列表页还是正文页”来分类,而要看它能不能独立满足一次访问需求:

  • 有稳定检索需求的站内搜索页:比如用户反复搜索的少数关键词,结果页内容相对固定,可以考虑保留。
  • 主题明确的标签页:标签下的条目足够多,且这些条目确实围绕同一主题,页面有可读的说明文字。
  • 人工维护的聚合页:有编辑挑选、排序和描述,而不是纯粹按发布时间倒序拼出来。

相反,如果页面只是把已有内容换个顺序再列一遍,标题和正文由模板拼成,没有增量信息,那它大概率只会稀释抓取资源。

具体怎么处理

  1. 先看日志:确认蜘蛛是否在反复抓这些 URL,抓取频率是否挤占了正文页的额度。没有数据支撑就先不要动手。
  2. 选择正确的屏蔽手段:已经完全不想让它出现在索引里,用 noindex;只是想省抓取资源、仍希望链接被发现,用 robots.txt 屏蔽抓取。两者作用不同。
  3. 不要混用:同一批 URL 既在 robots.txt 里被禁止抓取,又指望 noindex 生效,结果是蜘蛛读不到页面上的 noindex,URL 仍可能以无摘要形式停留在索引里。
  4. 给保留的聚合页加内容:补一段真实描述、控制条目数量、加上指向核心内容的链接,并让 canonical 明确指向自身,避免与正文页互相竞争。
  5. 站内搜索页默认收紧:整体设为 noindex, follow,让链接继续被跟踪;只对少数确有检索价值的查询放开。
处理顺序建议是:先确认抓取情况,再决定是挡抓取还是挡索引,最后才考虑是否需要清理已经存在的索引。反过来做,很容易误伤正文页的内链入口。

收尾后的观察点

调整之后不要只看总数变化。更值得关注的是:正文页的抓取频次有没有上升,日志里低价值 URL 的访问占比有没有下降,站内搜索页是否还在以近似无限的组合被访问。这些指标比收录数字更能说明处理是否有效。索引调整本身需要时间,不必因为一两天没变化就反复改动规则。