蜘蛛在站内移动,靠的是一层层的链接。首页往下走,往往先遇到分类页、标签页、归档页这类中间层页面,再通过它们到达具体内容。很多站点把注意力都放在内容页和 Sitemap 上,中间层却长期没人管,抓取路径的问题多半出在这里。
中间层页面在抓取路径中的位置
从抓取角度看,一个 URL 大概分两件事:能不能被发现,被发现后值不值得抓。首页和 Sitemap 决定发现的大方向,中间层决定的是具体走法——蜘蛛有没有路通到深层页面,走多少步能到,路上会碰到多少重复或低质地址。
中间层页面本身通常不是目标页面,它的主要作用是传递入口。但蜘蛛不会区分意图,它只按链接抓,所以这些页面也会被真正抓取、渲染,占用请求次数。
三种常见的中间层形态
分类页
分类页一般是结构最清晰的中间层,层级固定、链接集中,是蜘蛛快速铺开抓取的主要通道。分类页出问题,常见于两种情况:一是分类拆得过细导致页数膨胀,二是分类下内容太少,页面只剩几行标题加一句描述。
标签页
标签页由内容自动生成,数量随时变化。它的好处是能把同一个话题下的内容横向串起来,坏处是容易长出大量只挂一两篇文章的标签页。这类页面对 URL 发现帮助有限,却要占抓取次数。
归档页
按月份、年份生成的归档页结构重复,内容与分类页高度重叠。如果站点同时存在分类页、标签页、归档页和分页页,同一个 URL 往往有好几条路径可以到达,蜘蛛容易重复访问。
中间层对抓取的两个相反作用
- 指路:把深层内容从“只有 Sitemap 知道”变成“从首页点几下就能到”,显著改善 URL 发现。
- 分流:链接位置和数量决定蜘蛛更愿意往哪走,导航和面包屑通常比页脚、边栏更受重视。
- 消耗:页面越多、内容越薄,抓取次数被摊得越散,真正需要更新的内容反而排在后面。
- 负载:静态生成的中间层如果数量巨大,蜘蛛集中抓取时对服务器压力的影响并不小。
失控时的几个信号
不需要复杂工具,从日志和内部链接分布就能看出苗头:
- 日志里出现大量由参数拼接、排序、筛选产生的地址,而且都返回 200。
- 一批中间层页面收录正常,点进去只有一两条内容,且长期不更新。
- 同一个内容 URL 有多条进入路径,抓取频率被分散。
- 蜘蛛对中间层的抓取次数明显多于内容页,抓取高峰时服务器响应变慢。
整理顺序:先收敛,再补入口
处理中间层,建议按下面的顺序走,避免一边删一边新长出来:
- 先看数量。统计分类、标签、归档各有多少页面,其中多少页面下内容少于三条。
- 再定保留标准。只保留有稳定内容量、真有人会点进去的中间层,其余用 noindex 处理或干脆不生成。
- 合并同类。归档页与分类页功能重叠时,优先保留结构更清晰的那一类。
- 补入口。确认重要内容在导航、面包屑或正文里至少有一条稳定链接,而不是只靠 Sitemap。
- 观察日志。调整后看蜘蛛对内容页的抓取比例是否上升,中间层请求是否下降。
中间层不是越多越好,也不是越少越好。判断标准很简单:这个页面能不能帮蜘蛛走到它原本走不到的地方,或者帮用户找到他本来找不到的内容。两个都答不上来,就值得重新考虑。
和 Sitemap、服务器一起看
中间层只是路径的一段。Sitemap 负责把 URL 清单讲清楚,内链负责把路径铺开,服务器稳定性决定这条路能不能顺利走完。三者配合得好,蜘蛛能在有限次数里覆盖到重点内容;任何一环出问题,表现往往都是抓取变少、更新变慢,而不是立刻报错。
整理中间层不必一次做完,先把数量最大、内容最少的那一类收敛掉,再观察一两周日志,通常就能看到抓取分布的变化。