很多站点的标签页和日期归档页,是内容系统顺手生成的副产品:发布文章时勾了标签,系统就多出一个 /tag/xxx 页面;按月归档打开,就多出一批 /2024/05/ 这样的列表。它们确实方便读者顺主题或时间浏览,但同时也是一批数量可观、结构高度相似的 URL。搜索蜘蛛在自主爬行时,通常会从文章底部的标签链接、侧边栏的归档入口、订阅源以及分页链接碰到它们。这批 URL 的发现与抓取质量,值得单独拿出来管一管。
为什么标签页和归档页容易成为批量入口
原因并不复杂:它们在页面上的位置往往很好找。文章正文结束后的标签区、侧边栏的归档下拉、页脚的年度归档,都是蜘蛛容易走到的浅层链接。一个中等规模的内容站,文章可能只有几百篇,但标签页加上月份归档页,很容易就上千。这些页面模板相同、内容结构相近,如果任其自然生长,抓取预算会被大量消耗在重复度较高的列表上。
先给标签分个类
处理之前,建议先把现有标签翻一遍,大致按三类看待:
- 主题标签:持续有新内容沉淀,能代表站点某条内容线,比如几个固定的核心栏目词。
- 窄标签:只关联一两篇文章,或者和另一个标签高度重合,属于顺手写下的关键词。
- 时间归档:纯按年月切分,本身没有主题含义,价值主要在浏览体验。
分类之后,策略就清楚了:主题标签值得维护,窄标签尽量合并或回收,时间归档可以保留给读者,但不必全部送到搜索蜘蛛面前。
三种处理方式的取舍
- 保留并充实:给核心标签页加上一段简短说明,说明这个标签收录什么内容、适合谁看,而不是只丢一个标题列表。
- 合并与收敛:把同义词、单复数、中英文混写的标签合并到同一个 URL,旧地址用 301 指向新地址,避免多个页面讲同一件事。
- 保留可访问但不主动收录:对价值有限的归档页可以加 noindex,让蜘蛛能读但不必进入索引。需要注意的是,用 robots.txt 直接屏蔽抓取,会让蜘蛛看不到页面上的 noindex 声明,通常不是首选做法。
分页与 URL 规范别忽略
标签页一旦内容多了,就会产生分页。这里有两个细节:一是分页地址尽量保持稳定,不要因为每页条数调整就整体换一套 URL;二是分页页的 canonical 应指向自身,而不是全部指向列表第一页,否则后续分页可能长期不被抓取。如果站点使用无限滚动加载,最好同时保留一组可点击的分页链接,让入口不依赖脚本执行。
和站点地图、内链配合
把确实想被发现的标签页放进站点地图,是明确告诉搜索蜘蛛“这些值得来”的方式;窄标签和冗余归档则不必放进去。内链方面,可以在模板里控制标签的输出数量,例如文章底部只显示三到五个最相关的标签,其余收进详情或折叠区。这既让读者不至于被一堆链接干扰,也减少了站点尾部链接的总量。
用日志观察再调整
上线一段时间后,翻一遍服务器日志,看看蜘蛛实际访问了哪些标签页和归档页,返回状态是否正常,抓取频次集中在哪些地址上。如果发现某些归档页被抓取多次却始终没有内容更新,就可以考虑进一步收缩。调整不必一次做完,按季度复盘一轮,逐步把入口结构收敛到合理范围即可。
标签页和归档页本身没有对错,问题通常出在“默认全开”和“从不回看”。把入口数量控制住,把有价值的主题聚合维护好,抓取预算自然就用在更值得的地方。