结构化数据(很多人习惯叫 Schema 标记)不是排名开关。它的作用是给搜索引擎提供一份“页面在讲什么”的说明,在条件合适时,可能让搜索结果展示得更完整一些。真正麻烦的地方在于:标记往往由模板统一生成,而内容是一条条编辑出来的,两边一旦对不上,就给搜索引擎送去了互相矛盾的信号。
下面这份自查,不需要你懂代码,只要能打开页面源码、看懂几条字段,就能完成大部分核对。
先想清楚:标记补的是什么信息
页面上肉眼可见的内容,是搜索引擎判断主题的主要依据;结构化数据是补充说明,用来消除歧义。比如一篇文章,正文里有标题、作者、发布时间、更新时间,人一眼能看懂,机器则需要靠标记确认字段归属。
所以判断标记是否合格,标准很简单:标记里的每一条信息,都能在页面上找到对应的可见内容。找不到对应内容的字段,就该考虑删掉,或者把页面展示补齐。
三类最常见的问题
一、标记与可见内容不一致
这是最普遍也最容易被忽略的一类,典型表现包括:
- 标记里的标题写的是栏目名或模板默认值,和页面 h1、title 完全不是一回事;
- 发布时间取系统入库时间,但页面上显示的是编辑手动填写的日期,两者相差很大;
- 作者字段填的是 admin、editor 这类后台账号名,页面上署名却是真人姓名;
- 评分、评论数、价格等字段是写死的示例值,页面上并没有对应展示。
这类问题的共性,是模板和内容两条线各走各的。解决思路通常是统一取数来源:页面上显示什么,标记里就取同一个字段。
二、必填字段缺失或类型选错
不同类型要求的必填字段不一样,文章、产品、问答、面包屑、机构信息各自的字段结构差别不小。常见错误是选了和页面性质不匹配的类型,比如把一篇教程标成产品,把栏目列表页标成文章。类型选错,后面的字段怎么填都别扭。
另一个高频问题是有名字没细节:产品没有价格和库存状态,文章没有作者和日期,机构信息没有地址。字段长期空着,能拿到的展示机会自然会打折。
三、全站套用同一套标记
有的站点为了省事,全站用同一个模板输出同一套字段,栏目页、详情页、标签页、关于页全都一样。这不一定是错,但意义有限,还可能让本来不该被当作内容的页面(比如登录页、站内搜索页)也带上标记。
一份可以照着做的自查清单
- 挑 5 到 10 个代表性页面:首页、一个栏目页、一篇常规文章、一篇带图文的文章、一个产品页(如果有)。
- 打开页面源码,找到结构化数据部分,把字段逐条抄出来,和页面可见内容做比对。
- 确认类型与页面性质匹配,栏目页、列表页不要硬套详情页的类型。
- 检查日期字段:发布时间、更新时间是否和页面显示一致,格式是否规范。
- 检查作者、机构、品牌等实体字段,是否用了页面上真实存在的名称。
- 检查是否存在页面上根本没有的评分、价格、库存、评论数。
- 检查同一个页面是否重复输出两套互相冲突的标记。
- 确认搜索页、登录页、内部工具页等无须标记的页面没有被批量套上。
- 用官方的结构化数据测试工具跑一遍,看有没有报错和警告。
- 把发现的问题记下来,按“会影响理解”和“只是提示性警告”分优先级,先修前者。
验证与维护的节奏
结构化数据不是配置一次就完事的东西。模板改版、字段调整、内容迁移,任何一个环节都可能让标记和内容脱节。比较省事的做法是把它纳入日常巡检:每次模板上线后抽一个页面验证,每季度随机抽几个页面复查一遍。
另外,验证工具给出的警告不必都立刻处理。有些是工具的建议项,实际业务里未必适用;有些则指向真正的问题。判断标准仍然是那句老话——标记里的信息,页面上能不能看到。
把结构化数据当成“给页面做的翻译”,而不是“给搜索引擎做的包装”。翻译失真,比不翻译更麻烦。
和 URL 发现、抓取的关系
需要提醒的是,结构化数据解决的是“理解”问题,不解决“发现”问题。页面如果本身没有被正常抓取到,标记写得再规范也派不上用场。所以站点运营的常见顺序是:先把 URL 发现和抓取通路理顺,比如 sitemap、内部链接、robots 规则这些基础项,再来打磨页面标记。两件事各管一段,不要指望其中一个去补另一个的短板。
回到最朴素的判断:页面上真实展示的信息,用标记准确地再说一遍,不多说也不少说。做到这一点,结构化数据该发挥的作用基本就到位了。