很多站点收录量不小,但真正能带来流量的页面很少,问题往往出在一批“薄内容”页面上。它们能被抓取、能被索引,却几乎没有独立信息量,既稀释了站内链接的传递效果,也让蜘蛛把抓取配额花在低价值 URL 上。处理这类页面,关键不是删得越多越好,而是先分清哪些确实该留。
先判断“薄”在哪一层
“薄”不是按字数算的。一个三百字的商品页,如果有独立参数、真实库存和用户评价,它的信息量可能比两千字的拼凑文章更高。判断时可以看三点:
- 独立信息量:去掉页头页脚、导航和模板文案之后,剩下多少只属于这个 URL 的内容。
- 可替代性:站内是否存在另一个 URL,能完整满足同一搜索意图。
- 入口价值:它是否承担站内导航作用,是否被其他页面引用。
三点里满足两条以上,基本可以归为偏薄的页面,进入下一步评估;如果只是字数少但确实有独立价值,不要急着动手。
三类常见的薄内容来源
标签页与聚合页
标签、分类、年份归档这类页面本身没有独立内容,靠列表撑着。少数有明确检索需求的标签可以保留,其余大量同质标签页会让索引里堆满重复列表。
短内容与模板复制
公告、短讯、活动页、帮助中心的重复问答,正文很短,主要靠模板填充。站内同类页面越多,单页被索引的收益越低。
多版本复制
同一份内容因为地区、语言、渠道参数各生成一套 URL,彼此差异只有一两行。这种情况下真正的问题不是内容薄,而是重复,需要先确定主版本再谈收口。
处理顺序:先补、再合、最后收口
- 补内容:如果页面有明确搜索需求,先补充真实信息,例如参数、价格区间、常见问题、图文说明。补完之后观察一个抓取周期,再决定是否保留。
- 合并:多个 URL 讲同一件事时,选信息最全的那个作为主版本,其余用 301 指过去,同时更新站内链接,避免旧 URL 继续被引用。
- 收口:确实没有保留价值、也不适合合并的页面,用 noindex 让它退出索引。canonical 解决的是重复版本的归属问题,不是用来屏蔽页面的,两者不要混用。
先合并再收口,通常比直接批量 noindex 更稳妥。很多页面被 noindex 之后,站内依然有大量链接指向它,蜘蛛还是会反复来抓,只是不再收录。
别一次性全量处理
批量提交几千条 noindex 或 301,容易出现两个后果:一是站点抓取节奏被打乱,二是万一判断错了,想恢复索引同样需要时间。更稳妥的做法是按模板分组,一次处理一类,例如先处理没有检索量的标签页,观察一到两周的抓取与收录反馈,再决定是否扩大范围。
同时要清楚,收口的目标是让索引里留下有价值的页面,不是把收录量做低。如果某类页面确实有稳定的长尾流量,即便内容简短,也应当保留。
收口之后核对哪些指标
- 抓取频次:被收口的 URL 是否还在大量消耗抓取日志。
- 索引状态:状态是否从已编入索引变为已排除,附带的原因是什么。
- 站点层收录量:总收录下降的同时,有效页面的展现与点击是否稳定。
- 内链残留:站内是否还有入口指向已收口页面,需要一并清理或替换。
最后提醒一句:这类判断只能建立在站内自查的日志与索引状态之上,任何工具给出的收录数字都只是参考样本。与其盯着收录总数,不如把注意力放在“这个 URL 到底解决了什么问题”上。