站点里总有一类页面:本身没有多少正文,主要内容是一串链接。标签聚合页、日期归档页、空分类页、分页列表、站内搜索结果页,都属于这一类。它们往往由 CMS 自动生成,数量随着内容增加而不断膨胀。蜘蛛沿着内链或 Sitemap 走进来,看到的是一页链接,而不是一页内容。
这类页面本身不一定是问题。问题在于它们会形成一条条抓取路径,把蜘蛛的时间和请求分摊到低价值地址上,同时稀释站内重要页面的入口信号。
蜘蛛走进薄页面后会发生什么
蜘蛛打开这类页面时,处理方式和其他 HTML 页面没有区别:下载 HTML、解析链接、把新发现的 URL 放进待抓取队列、按规则决定是否回访。区别在结果上——页面里可提取的正文很少,可提取的链接很多,于是它更像一个中转站,而不是终点。
如果标签页或归档页每次更新都会改变链接顺序,蜘蛛每次回访看到的链接集合都在变,回访的价值就更低。如果这类页面的 URL 还能被参数、排序方式、分页翻出多个变体,同一批链接会用不同地址反复出现。
几种常见类型与处理思路
标签聚合页
标签页适合把同一主题的内容串起来。如果标签数量远超内容数量,或者一个标签下只有一两篇文章,可以考虑合并标签、取消自动生成,或者保留页面但限制它进入 Sitemap 和内链的主要位置。
常用的做法是把低价值标签页做成 noindex, follow:页面仍可被抓取、被当作路径使用,但不进入索引,避免和分类页、详情页争夺同一批关键词。
日期归档页
按年月归档的页面,对读者来说价值通常不高,对蜘蛛来说则是稳定的链接列表。内容量不大的站点,可以考虑不生成归档页,或者在归档页上只保留少量链接,把入口从主导航移出。
空分类与零结果页
空分类页和筛选后没有结果的页面,容易返回一个空列表。这类页面建议返回合适的状态码,并给出返回上一级分类的链接;长期空置的分类页可以考虑合并到父分类。
分页列表
分页是发现老内容的重要通道,但也容易变成一条很长的链。可以在列表页保留“下一页”和页码链接,但在某个深度之后停止向外延伸,同时确保每篇文章至少能从分类第一页或相关推荐里进入。
站内搜索结果页
站内搜索结果页通常由参数触发,结果集不稳定。这类页面一般不需要被索引,也不建议放进 Sitemap。用 noindex 处理比用 robots.txt 屏蔽更合适,因为屏蔽会让蜘蛛看不到页面上的链接,也不利于后续排查。
几个可以立刻检查的点
- Sitemap 里是否混入了标签、归档、分页和搜索结果地址。
- 主导航、面包屑、页脚是否把低价值页面放在了最显眼的位置。
- 薄页面上的链接是否指向了重复地址,比如带参数、带排序、带会话 ID 的版本。
- 同一批文章是否同时出现在分类页、标签页、归档页和推荐位中,形成多条重复路径。
- 这类页面的更新是否过于频繁,导致蜘蛛每次来都看到一批新链接。
该保留还是该收口
判断标准不复杂:这个页面有没有真实用户访问,有没有搜索需求,能不能带来阅读或转化。有,就把它当成正式页面维护,给它稳定的标题、描述和内容;没有,就减少它的入口,让它慢慢退出主要抓取路径。
薄页面的问题通常不是蜘蛛抓不抓,而是蜘蛛把时间花在这里值不值。
处理这类页面,重点是让抓取路径保持清晰:主干分类和详情页有稳定入口,标签、归档、分页各有明确职责,低价值地址不占用主要位置。做完这些,日志里反复出现的地址会少一些,真正需要抓取的页面被走到的机会也更大一些。