网站收录

内容偏薄的页面该不该收录:先分清三种“薄”,再决定补、合并还是屏蔽

收录数量上不去,很多时候不是蜘蛛没来,而是页面在索引选择阶段被过滤。本文把内容偏薄的页面拆成三种情况:信息量少、站内高度同质、可解析内容少,并给出补内容、合并、规范化、屏蔽的处理顺序,以及改完之后该观察哪些指标。

网站收录

内容偏薄的页面该不该收录:先分清三种“薄”,再决定补、合并还是屏蔽

收录数量上不去时,很多人的第一反应是“蜘蛛没来”。但把索引覆盖报告和服务器日志放在一起看,往往不是这样:抓取量并不低,卡点在后面——页面被抓到了,却在索引选择那一关被过滤掉。内容偏薄的页面,是这类情况里占比最高的一类。

一、先把三种“薄”分开

“薄”只是一个笼统的说法,成因不同,处理方式完全不同。建议先按下面三类归类:

  • 页面本身信息少:正文只有一两句话、一张参数表或一个下载按钮,其余全是导航、推荐位和页脚。
  • 页面在站内高度同质:同一套模板批量生成的地区页、标签页、筛选页,彼此只差一两个词。
  • 内容不少,但可解析部分少:正文靠交互加载、关键信息放在图片里、脚本没渲染出来,抓到的 HTML 和用户看到的页面对不上。

这三类的处理方向分别是:补内容、做收敛、解决可解析性。混在一起讨论,就很容易一拍脑袋给整站加 noindex。

二、索引系统大致在看什么

索引的目标是留下能回答查询的页面。判断依据通常包括:页面自身有多少独特信息、这些信息能不能被解析、与其他已被索引的 URL 差异有多大,以及有没有人会去搜它。

正文占比

正文之外的部分——导航、推荐位、评论区、页脚——各站都一样,对索引来说不产生区分度。一个页面整页几万字符,正文只占三百字符,落到索引系统眼里的“有效内容”就是后者。

差异度

如果几十个 URL 的正文有九成以上相同,索引通常会留下其中一个,其余的即便被抓取,也会被判定为重复。这更像是去重机制,而不是针对某个页面的惩罚。

需求匹配

有一类页面本来就不该出现在搜索结果里,比如“提交成功”“购物车为空”“查询无结果”。它们没有对应的搜索意图,硬让它们进索引,价值有限。

三、处理顺序:补 → 合并 → 规范 → 屏蔽

建议按成本从低到高来,而不是一上来就删页面或加 noindex。

  1. 能补信息的先补:给地区页补上本地联系方式、服务范围、常见问题,让它拥有只有这一页才有的内容。
  2. 内容确实雷同的合并:把多个只有细微差别的 URL 收敛到一个主地址,其余做 301,而不是让它们各自存在、互相稀释。
  3. 有多个访问地址的做规范化:用 canonical 统一主地址,同时处理大小写、尾斜杠、无意义参数这些细节。
  4. 确认没有搜索价值的再屏蔽:加 noindex 或从站点结构中下线,做之前先确认这个 URL 没有外部链接、没有自然流量。

删除要谨慎。页面下线后返回 404 或 410,索引里的旧记录会逐步消失;如果还有外链指向它,更稳妥的做法是先做 301 指向相关页面。

四、几个容易做反的操作

  • 给全部薄页面统一加 noindex:容易连同一些有搜索需求、只是暂时内容不足的页面一起屏蔽。分目录、分模板评估更可靠。
  • 用 robots.txt 屏蔽整批 URL:被屏蔽的地址不再被抓取,但已存在的索引记录不会立刻移除,页面之间的链接关系也被切断。目标是移除索引时,noindex 更直接。
  • 把正文藏进图片或纯交互里:折叠内容通常仍可解析,图片里的文字则需要额外处理。
  • 只盯收录数,不看这些页面有没有流量:没有需求支撑的页面进入索引,对站点整体帮助有限。

五、改完之后怎么看效果

  • 用抓取统计观察这批 URL 的抓取频率和响应码有没有变化。
  • 在索引覆盖报告里看对应状态的数量变化,观察周期按周计,不要按天。
  • 抽样用页面标题或某句独有内容去搜索,确认索引里留下的版本和新版本一致。
收录是索引选择的结果,不是提交动作的结果。让一个页面变厚、变独特,比反复提交更容易见效;但任何调整都没有确定的生效时间。

薄页面本身不是原罪。真正需要回答的只有两个问题:这个 URL 有没有人需要,它和其他页面有没有区别。这两个问题想清楚了,补、合并还是屏蔽,选择也就清楚了。