站点运营

站点运营:标题层级自查,让蜘蛛一眼看清页面重点

标题层级是编辑最容易顺手写错、也最难自查的一环。本文从 H1 的唯一性讲起,逐项检查 H2/H3 的顺序、跳级、空标题与模板文字混用的问题,并给出一份可以照着做的清单,帮你在不改版的前提下把页面结构理顺。

站点运营

站点运营:标题层级自查,让蜘蛛一眼看清页面重点

很多站点的标题层级是「写的时候顺手加的」:编辑用编辑器默认样式加粗一下当成小标题,模板自带一个 H1,栏目标题又是一个 H1,最后页面上出现两个 H1、一堆同级的 H2,从属关系完全对不上。对读者来说,这可能只是字号大小的问题;但对爬虫来说,标题标签是它判断页面主题和内容从属关系的第一手线索。结构乱了,它对这页在讲什么就只能靠猜。

先确认一件事:标题是给谁看的

H1 到 H6 的作用其实有两个:一是告诉读者这一块讲什么,二是告诉搜索引擎这一块在页面里的位置有多重要。这两件事并不冲突。视觉上的字号、颜色交给 CSS 去管,标签级别只负责表达结构。把这两件事分开想,很多纠结就没了。

H1:一页一个,说清这页是什么

  • 逐个模板检查:文章页、栏目页、列表页、专题页,各自输出了几个 H1。
  • 如果模板已经用站点名做了 H1,正文标题就不要再写一个 H1,可以降为 H2 或改用带样式的段落。
  • H1 应该是这个页面最准确的一句话概括,而不是全站统一的站点名。
  • 关键词自然出现一次就够,反复堆在 H1 里只会让主题变模糊。

H2 与 H3:别跳级,也别靠字号区分

常见的问题有两类。一类是跳级:从 H1 直接跳到 H3,中间没有 H2,层级断了一截。另一类是视觉上分不出来:全站只有一个字号,H2 和 H3 看起来一模一样,编辑只能靠加粗和空行来「假装」层级。

建议的做法是约定清楚:H2 用来切分正文的大块,H3 用来切分 H2 内部的小节。不要为了视觉大小去挑标签级别,那是 CSS 的工作。

  • 检查是否存在 H1 → H3 → H2 这类顺序混乱的情况。
  • 检查一篇长文的 H2 数量是否合理,太少说明没分段,太多说明分得太碎。
  • 检查是否存在「标题下面没有正文」的空标题,这种多半是模板留下的占位。

标题与正文要对得上

有些标题是模板自动生成的,比如「相关阅读」「猜你喜欢」「上一篇 / 下一篇」,这些本质上是一组链接,用普通容器加样式就可以,不必占用 H2 或 H3。真正需要标题层级的是正文内容。

一个简单的判断方法:把这个标题单独拿出来,读者能不能大致猜到下面那段在讲什么?猜不到,它多半是模板文字,不是内容标题。

图片、表格、代码块旁边的标题

图片说明、表格名称、代码块说明,如果不是章节标题,就不要用 H2/H3 包起来,用 figcaption 或普通段落更合适。否则爬虫会读到一堆碎片化的「标题」,真正的章节结构反而被稀释了。

一份可以照着做的自查清单

  1. 抽 5 到 10 个代表性页面,覆盖首页、栏目页、文章页、专题页,逐页数 H1 数量,确认都只有 1 个。
  2. 把页面的标题大纲提取出来,只看标题不看正文,读一遍逻辑是否顺。
  3. 检查有没有跳级和空标题。
  4. 检查「相关阅读」「推荐」「评论」这类模板文字是否误用了 H2。
  5. 对比移动端和 PC 端输出的标题层级是否一致。
  6. 在浏览器里临时关掉 CSS 看一遍,纯文本结构是否还清楚。
  7. 确认 H1、title、正文主题这三者说的是同一件事。

改完之后怎么观察

结构上的调整不用期待立刻有什么变化。更实际的做法是:改完顺手在服务器日志或站长后台里看看这些页面的抓取是否正常,标题在搜索结果里的呈现是否贴切。如果发现某个页面的摘要和正文对不上,可以先回到标题层级上找原因。

标题层级不是什么玄学,它就是一份写给机器看的目录。目录清楚了,URL 发现、抓取和后续的内容运营才有稳定的基础。