栏目结构在搭建的时候通常是清晰的,但站点运营一两年之后,往往会多出一批计划外的页面:编辑随手填的标签、系统自动生成的日期归档、作者列表页、临时专题页。这些页面平时几乎没人访问,对蜘蛛来说却是实打实的可抓取 URL。数量一旦上去,抓取预算就被摊薄在价值不高的地址上。
先把归档类页面盘清楚
不同 CMS 的叫法不一样,但归属大致相同:
- 分类归档:栏目下一级或多级分类;
- 标签归档:由编辑或系统根据关键词生成;
- 作者归档:多作者站点常见,单作者站点往往也会生成一个;
- 日期归档:按年、月甚至按日生成;
- 专题与合集页:围绕某个事件或主题临时聚合。
把它们列成一张表,标上 URL 规则、页面数量、平均条目数和是否有独立搜索需求,后面的判断会轻松很多。
什么情况算薄内容
不需要套复杂的评分模型,几条对得上就该留意:
- 列表里只有三五条,而且短期内不会增加;
- 页面除了标题链接,没有导语、没有说明文字,用户看完不知道这一页是干什么的;
- 同一批文章同时出现在分类页、标签页和专题页里,内容高度重合;
- 该页面没有对应的搜索需求,用户基本不会主动搜到它。
三种处理路径
保留并补强
对确实有搜索需求的归档页,可以补一段一两百字的说明,讲清这个栏目收录什么、按什么逻辑组织;同时控制每页条目数量,条目太多就分页,分页链接保持可抓取。这样它就从一张标题清单变成了有独立价值的入口页。
合并与裁撤
拼写相近、含义重叠的标签可以合并到一个主标签,旧地址用 301 指向新地址。日期归档如果没人看,可以直接把入口从模板里去掉,同时确认列表页不再输出相关链接;已经产生收录的,视情况做重定向或者让它自然淡出。裁撤之前先看成因,别把还在被外部引用的地址一刀切掉。
限制抓取与收录
决定不收录的归档页,用 noindex 或 robots.txt 处理,但要分清两者的用途:noindex 针对收录,不针对抓取,蜘蛛仍会照常访问页面;robots.txt 屏蔽抓取之后,页面上的 noindex 标签也就读不到了,容易出现“已经屏蔽、索引里却还留着”的尴尬。另外,noindex 页面上的内链依然会引导蜘蛛继续爬,如果不想让某个内容集合被大量展开,模板层面的链接输出也要一并调整。
自查清单
- 导出站点全部归档类 URL,按类型统计数量与平均条目数;
- 核对同一批文章被多少个地址重复承载;
- 检查归档页模板是否输出了导语和分类说明;
- 确认分页序列的链接可被抓取,不依赖 JavaScript 点击加载;
- 确认 noindex、robots.txt、canonical 三者的策略不互相打架;
- 检查 Sitemap 是否还在推送已决定不收录的归档地址。
改完之后怎么验证
调整后的一两周里,重点看抓取日志中归档类地址的请求占比是否下降、重点内容页的抓取频次有没有回升,以及索引报告里被排除的页面是否与预期一致。索引状态变化需要时间,不必每天盯着看,按周对比更实际。
归档页本身不是问题,无人维护又大量重复的归档页才是。定期把它们拿出来过一遍,比反复折腾首页要有效得多。