网站收录

正文被模板挤到角落:收录核对时先算一遍主内容占比

抓取正常、返回 200、site 也能查到,页面表现却一直很弱,问题往往出在主内容占比太低。本文把抓取、索引、展示三层分开,给出量正文占比的具体步骤、模板重复带来的归并与代表页轮换问题,以及按模板、内容、URL 归一化推进的处理顺序。

网站收录

正文被模板挤到角落:收录核对时先算一遍主内容占比

抓取日志里有记录、页面返回 200、site 查询也能查到,但表现一直很弱——这类页面在收录核对里经常出现。很多时候问题不在于“有没有被抓到”,而在于这个地址里真正属于它自己的内容有多少。

抓取、索引、展示是三件事

核对之前先把三层分开,能省掉不少无效动作。

  • 抓取层:蜘蛛来过、读过 HTML,日志里有响应码和字节数。这只说明地址可达。
  • 索引层:页面被纳入候选库,可以被检索到。同一主题的多个地址在这里可能被聚到一起,只留一个代表。
  • 展示层:在什么查询、什么位置出现,由相关性、内容质量、用户信号共同决定,不是收录核对能直接控制的。

正文占比主要影响后两层:内容太薄的页面即使进了索引,也容易被同类地址盖过去。

正文占比怎么量

  1. 取一份原始 HTML(不是渲染后的 DOM),复制成纯文本。
  2. 把导航、页脚、面包屑、推荐列表、评论、版权声明逐块标出来。
  3. 用主内容字数除以全文总字数,得到一个粗略比例。
  4. 同一模板抽 5 到 10 个页面重复,看这个比例是稳定还是忽高忽低。

如果一批页面的正文占比长期低于两成,就值得回头看看:是模板把主体挤得太靠后,还是页面本身只是聚合了一堆摘要。

模板重复带来的连带问题

同一套模板下,若每页正文只有两三段,其余全是相同的导航与推荐,搜索引擎看到的差异度就很低。常见后果有三个:

  • 多条地址被判为高度相似,只保留一条作为代表,其余进入“已排除”。
  • 代表页来回轮换,今天留下 A,明天可能变成 B,收录状态看上去在横跳。
  • 抓取配额被大量低差异页面消耗,真正需要更新的地址反而排队靠后。

这三个现象根子上是一件事:页面之间缺少足够的区分信息。

动手改的顺序

  1. 先动模板。把主内容放到更靠前的位置,压缩首屏之外的重复块。
  2. 再补内容。摘要式页面扩写成完整正文,或者明确标为聚合入口并指定 canonical。
  3. 然后做归一化。大小写、结尾斜杠、参数、http 与 https 统一到一个地址,减少同页多址。
  4. 最后才是观察。改完给抓取和重新评估留一个周期,不用当天就下判断。
收录核对能影响的是发现、抓取和归并这几个环节;能不能进索引、以什么形式出现,最终还是由搜索引擎判断,没有“改完一定收录”这回事。

把问题从“有没有被抓”升级成“这个页面对搜索来说值不值得留”,核对才会从数数字变成能落到具体改动上的工作。