搜索抓取

空分类、标签页与日期归档:把蜘蛛引向薄页面的几条常见路径

标签聚合、日期归档、空分类、分页列表和站内搜索结果页,是站点里最常见的几类薄页面。它们由 CMS 自动生成,数量容易膨胀,会形成大量抓取路径。本文说明蜘蛛走进这些页面后会发生什么,并给出 Sitemap、内链、noindex 与分页深度几个可落地的处理思路。

搜索抓取

空分类、标签页与日期归档:把蜘蛛引向薄页面的几条常见路径

站点里总有一类页面:本身没有多少正文,主要内容是一串链接。标签聚合页、日期归档页、空分类页、分页列表、站内搜索结果页,都属于这一类。它们往往由 CMS 自动生成,数量随着内容增加而不断膨胀。蜘蛛沿着内链或 Sitemap 走进来,看到的是一页链接,而不是一页内容。

这类页面本身不一定是问题。问题在于它们会形成一条条抓取路径,把蜘蛛的时间和请求分摊到低价值地址上,同时稀释站内重要页面的入口信号。

蜘蛛走进薄页面后会发生什么

蜘蛛打开这类页面时,处理方式和其他 HTML 页面没有区别:下载 HTML、解析链接、把新发现的 URL 放进待抓取队列、按规则决定是否回访。区别在结果上——页面里可提取的正文很少,可提取的链接很多,于是它更像一个中转站,而不是终点。

如果标签页或归档页每次更新都会改变链接顺序,蜘蛛每次回访看到的链接集合都在变,回访的价值就更低。如果这类页面的 URL 还能被参数、排序方式、分页翻出多个变体,同一批链接会用不同地址反复出现。

几种常见类型与处理思路

标签聚合页

标签页适合把同一主题的内容串起来。如果标签数量远超内容数量,或者一个标签下只有一两篇文章,可以考虑合并标签、取消自动生成,或者保留页面但限制它进入 Sitemap 和内链的主要位置。

常用的做法是把低价值标签页做成 noindex, follow:页面仍可被抓取、被当作路径使用,但不进入索引,避免和分类页、详情页争夺同一批关键词。

日期归档页

按年月归档的页面,对读者来说价值通常不高,对蜘蛛来说则是稳定的链接列表。内容量不大的站点,可以考虑不生成归档页,或者在归档页上只保留少量链接,把入口从主导航移出。

空分类与零结果页

空分类页和筛选后没有结果的页面,容易返回一个空列表。这类页面建议返回合适的状态码,并给出返回上一级分类的链接;长期空置的分类页可以考虑合并到父分类。

分页列表

分页是发现老内容的重要通道,但也容易变成一条很长的链。可以在列表页保留“下一页”和页码链接,但在某个深度之后停止向外延伸,同时确保每篇文章至少能从分类第一页或相关推荐里进入。

站内搜索结果页

站内搜索结果页通常由参数触发,结果集不稳定。这类页面一般不需要被索引,也不建议放进 Sitemap。用 noindex 处理比用 robots.txt 屏蔽更合适,因为屏蔽会让蜘蛛看不到页面上的链接,也不利于后续排查。

几个可以立刻检查的点

  • Sitemap 里是否混入了标签、归档、分页和搜索结果地址。
  • 主导航、面包屑、页脚是否把低价值页面放在了最显眼的位置。
  • 薄页面上的链接是否指向了重复地址,比如带参数、带排序、带会话 ID 的版本。
  • 同一批文章是否同时出现在分类页、标签页、归档页和推荐位中,形成多条重复路径。
  • 这类页面的更新是否过于频繁,导致蜘蛛每次来都看到一批新链接。

该保留还是该收口

判断标准不复杂:这个页面有没有真实用户访问,有没有搜索需求,能不能带来阅读或转化。有,就把它当成正式页面维护,给它稳定的标题、描述和内容;没有,就减少它的入口,让它慢慢退出主要抓取路径。

薄页面的问题通常不是蜘蛛抓不抓,而是蜘蛛把时间花在这里值不值。

处理这类页面,重点是让抓取路径保持清晰:主干分类和详情页有稳定入口,标签、归档、分页各有明确职责,低价值地址不占用主要位置。做完这些,日志里反复出现的地址会少一些,真正需要抓取的页面被走到的机会也更大一些。