很多站点排查收录问题时,第一反应是内容太少了,于是一路加字数。但搜索引擎判断页面质量,看的不是绝对字数,而是这个页面里有多少是它自己独有的、围绕同一个主题的正文,有多少是每个页面都一样的模板。把这两个量算成比例,比单纯数正文长度更有参考价值。
为什么要看比例,而不是只看字数
一个两千字的页面,如果有一千五百字是导航、推荐位、相关文章和公共话术,实际独有内容只有五百字;而一个八百字的页面,如果七百字都在回答同一个问题,它的有效内容密度反而更高。字数可以堆,比例不容易堆。这也是为什么同一个模板下的页面,往往是一部分收录正常、一部分长期没有动静。
三个可以自己算出来的数字
- 正文比例:正文区字数除以页面可见总字数。粗略做法是把页面剥掉导航、页脚、侧栏后的可见文字,和整页可见文字做对比。
- 模板占比:同一模板下若干页面里完全相同的文字块,占单页可见文字的比重。抽三到五个同模板 URL 逐块比对,就能估出大概范围。
- 重复块数量:页面上换个页面也不会变的模块个数,比如通用免责声明、统一 FAQ、跨类目的推荐列表。
这三个数字不需要精确到小数点,只要能被反复测量、能在改动前后做对比,就有用。
模板占比过高的几种常见形态
模板占比高本身不是错误,导航和页脚本来就要重复。问题出在重复的部分把独有内容挤到了次要位置:
- 正文只有两三段,下面是几十条与当前主题无关的推荐链接;
- 列表页里每张卡片都带同一段营销文案,只有标题不同;
- 详情页顶部先放一大段品牌介绍,用户和爬虫都要往下滚很久才看到主体;
- 分类页和标签页共用同一段说明文字,只换了标题里的关键词。
这类页面不是打不开,而是打开之后没有明确的信息主体。抓取通常能正常完成,问题更多出在处理和筛选阶段。
重复块不等于重复内容
需要区分两件事:结构性重复,也就是模板、导航、页脚这类;以及内容性重复,也就是正文本身和别的页面几乎一样。前者一般不必特意处理,后者才需要判断去留。判断顺序建议是先确认这批页面是否对应独立的搜索需求,再决定是合并、加规范标签,还是保留但把正文做出差异。反过来做,先删页面再看需求,很容易把还有入口价值的地址删掉。
一个可执行的自查顺序
- 选一个模板,挑五个 URL,手动统计正文比例和重复块数量,得到模板级基线。
- 按正文比例从低到高排序,先看最低的那一批,确认它们是否承担独立需求。
- 对承担独立需求的页面,把独有内容前移,压缩与主题无关的推荐模块。
- 对不承担独立需求的页面,考虑合并进主页面,或用规范标签指向主页面,而不是简单删除。
- 改完后按目录分组抽样,隔几周再看一次抓取与索引状态,不要用单天数据下结论。
比例只是自查工具,不是评分公式。搜索引擎没有公开的正文比例及格线,任何声称达到某个数值就能被收录的说法都不可信。
容易被忽略的一点
统计时用的是可见文字,不是 HTML 体积。模板里塞进去的大段结构化数据、默认折叠的内容、写在图片上的文字都不会体现在可见文字里,但它们同样影响页面的实际呈现。如果发现某个模板的 HTML 很大而可见文字很少,通常说明结构本身有问题,值得单独拿出来看。
改版或者多语言站点容易让这个问题放大:同一套模板套在几十种页面上,重复块会被复制很多次。这时候与其逐个改页面,不如先在模板层面把重复块压缩一轮,再针对少数重点页面做差异化,投入产出比会更高。