很多站点的标题层級是「寫的时候顺手加的」:編輯用編輯器預設样式加粗一下当成小标题,模板自带一個 H1,栏目标题又是一個 H1,最後頁面上出現两個 H1、一堆同級的 H2,從属關系完全對不上。對讀者来说,這可能只是字号大小的問题;但對爬虫来说,标题标簽是它判断頁面主题和内容從属關系的第一手线索。结构乱了,它對這頁在讲什么就只能靠猜。
先確認一件事:标题是给谁看的
H1 到 H6 的作用其實有两個:一是告诉讀者這一块讲什么,二是告诉搜尋引擎這一块在頁面里的位置有多重要。這两件事並不冲突。视觉上的字号、颜色交给 CSS 去管,标簽級別只负责表達结构。把這两件事分開想,很多纠结就没了。
H1:一頁一個,说清這頁是什么
- 逐個模板检查:文章頁、栏目頁、列表頁、专题頁,各自輸出了几個 H1。
- 如果模板已经用站点名做了 H1,正文标题就不要再寫一個 H1,可以降為 H2 或改用带样式的段落。
- H1 應该是這個頁面最准确的一句话概括,而不是全站统一的站点名。
- 關鍵詞自然出現一次就够,反复堆在 H1 里只會让主题變模糊。
H2 與 H3:別跳級,也別靠字号区分
常见的問题有两類。一類是跳級:從 H1 直接跳到 H3,中間没有 H2,层級断了一截。另一類是视觉上分不出来:全站只有一個字号,H2 和 H3 看起来一模一样,編輯只能靠加粗和空行来「假装」层級。
建议的做法是约定清楚:H2 用来切分正文的大块,H3 用来切分 H2 内部的小节。不要為了视觉大小去挑标簽級別,那是 CSS 的工作。
- 检查是否存在 H1 → H3 → H2 這類顺序混乱的情况。
- 检查一篇長文的 H2 數量是否合理,太少說明没分段,太多說明分得太碎。
- 检查是否存在「标题下面没有正文」的空标题,這種多半是模板留下的占位。
标题與正文要對得上
有些标题是模板自動生成的,比如「相關阅讀」「猜你喜欢」「上一篇 / 下一篇」,這些本质上是一组連結,用普通容器加样式就可以,不必占用 H2 或 H3。真正需要标题层級的是正文内容。
一個简單的判断方法:把這個标题單獨拿出来,讀者能不能大致猜到下面那段在讲什么?猜不到,它多半是模板文字,不是内容标题。
图片、表格、代碼块旁邊的标题
图片說明、表格名稱、代碼块說明,如果不是章节标题,就不要用 H2/H3 包起来,用 figcaption 或普通段落更合适。否則爬虫會讀到一堆碎片化的「标题」,真正的章节结构反而被稀释了。
一份可以照着做的自查清單
- 抽 5 到 10 個代表性頁面,覆盖首頁、栏目頁、文章頁、专题頁,逐頁數 H1 數量,確認都只有 1 個。
- 把頁面的标题大纲提取出来,只看标题不看正文,讀一遍逻辑是否顺。
- 检查有没有跳級和空标题。
- 检查「相關阅讀」「推荐」「评论」這類模板文字是否誤用了 H2。
- 對比移動端和 PC 端輸出的标题层級是否一致。
- 在浏览器里临时關掉 CSS 看一遍,纯文本结构是否還清楚。
- 確認 H1、title、正文主题這三者说的是同一件事。
改完之後怎么观察
结构上的調整不用期待立刻有什么變化。更實际的做法是:改完顺手在服務器日誌或站長後台里看看這些頁面的抓取是否正常,标题在搜尋结果里的呈現是否贴切。如果發現某個頁面的摘要和正文對不上,可以先回到标题层級上找原因。
标题层級不是什么玄学,它就是一份寫给机器看的目錄。目錄清楚了,URL 發現、抓取和後續的内容运营才有稳定的基础。