结构化数据是页面的自我描述,不是加分项
搜索蜘蛛抓取页面时,会同时读取 HTML 正文和页面里的结构化数据标记(常见形式是 JSON-LD,也有微数据和 RDFa)。标记做的事情,是把页面上已经写出来的信息——标题、作者、发布时间、面包屑、评分、价格——用统一的字段再说一遍。它不能替页面创造内容,所以判断标准很简单:标记里的每一个字段,都应当能在页面上找到对应的可见信息。
如果标记和正文各说各话,搜索引擎要么忽略这套标记,要么对整页的信任度打折,两种情况都不划算。
几类常见的标记与内容不一致
1. 时间字段和实际发布日期对不上
datePublished 写成模板生成时间或站点搬迁时间,dateModified 每次保存草稿都自动刷新,结果是页面显示二〇二三年五月发布,标记里却是抓取当天。时间字段一旦失真,再想拿它判断内容新旧就没有意义了。
2. 作者与发布方两套说法
页脚署名是某某编辑部,标记里的 author 还留着建站时的默认值;主体名称变更过,publisher 没有同步更新。这类字段不显眼,但会直接影响内容归属的判断。
3. 评分、评论、价格没有对应内容
页面上没有真实评论,却输出了 aggregateRating;商品早已调价或下架,Product 标记里的价格和库存状态还停在旧值。这不只是标记不准的问题,一旦被判定为误导性标记,整站相关标记都可能被降权处理。
4. 多套标记并存,字段互相打架
主题自带一套 JSON-LD,SEO 插件又输出一套,同一个页面上出现了两个 Article 或两个 BreadcrumbList。搜索引擎无法判断该合并还是取其一,最省事的处理方式就是都不用。
5. 页面类型与标记类型不匹配
栏目列表页标成 Article,文章页标成 Product,或者把问答类标记堆在没有任何问答结构的页面上。类型选错了,后面的字段填得再全也没有用。
一轮可落地的自查怎么做
- 先抽 10 到 20 个代表性 URL:首页、栏目页、文章页、商品或服务页各取几个,不要只看首页。
- 用浏览器查看源代码,搜索 application/ld+json,把标记内容复制出来格式化。
- 逐字段对照页面上看得见的信息,重点看时间、作者、主体名称、面包屑路径这几项。
- 用官方富媒体结果测试工具跑一遍,记录缺失字段和取值无效的提示。
- URL 量大时,可以写一段脚本批量抓取页面、解析标记,先输出字段缺失或与页面标题不符的清单,再人工复核。
- 把结果和抓取日志对照:标记报错的页面,如果恰好也是蜘蛛反复抓取的对象,处理优先级就更高。
日常维护的几个习惯
- 换模板、上插件、内容改版时,把结构化数据列入上线检查项,而不是上线后再补。
- 时间字段只保留两个来源:人工填写的发布时间,以及数据库里真实存在的时间戳,避免系统自动刷新覆盖。
- 只标记页面上确实存在的内容,没有评价就不加评分,没有价格就不加价格字段。
- 同一页面只保留一套标记,主题和插件二选一,避免重复输出。
- 下线或归档的页面,标记一并清理,不要留下指向已删除资源的引用。
结构化数据不解决抓取通路问题,但它能减少页面自相矛盾的地方。对于正在用 sitemap、内链和日志去扩大 URL 发现范围的人来说,让已经被抓到的页面表述一致,是成本很低、也很容易漏掉的一步。