结构化資料是頁面的自我描述,不是加分項
搜尋蜘蛛抓取頁面时,會同时讀取 HTML 正文和頁面里的结构化資料标记(常见形式是 JSON-LD,也有微資料和 RDFa)。标记做的事情,是把頁面上已经寫出来的信息——标题、作者、發布時間、面包屑、评分、價格——用统一的字段再说一遍。它不能替頁面创造内容,所以判断标准很简單:标记里的每一個字段,都應当能在頁面上找到對應的可见信息。
如果标记和正文各说各话,搜尋引擎要么忽略這套标记,要么對整頁的信任度打折,两種情况都不划算。
几類常见的标记與内容不一致
1. 時間字段和實际發布日期對不上
datePublished 寫成模板生成時間或站点搬迁時間,dateModified 每次儲存草稿都自動刷新,结果是頁面顯示二〇二三年五月發布,标记里却是抓取当天。時間字段一旦失真,再想拿它判断内容新舊就没有意义了。
2. 作者與發布方两套说法
頁脚署名是某某編輯部,标记里的 author 還留着建站时的預設值;主体名稱變更過,publisher 没有同步更新。這類字段不顯眼,但會直接影响内容归属的判断。
3. 评分、评论、價格没有對應内容
頁面上没有真實评论,却輸出了 aggregateRating;商品早已調價或下架,Product 标记里的價格和库存狀態還停在舊值。這不只是标记不准的問题,一旦被判定為誤導性标记,整站相關标记都可能被降權處理。
4. 多套标记並存,字段互相打架
主题自带一套 JSON-LD,SEO 插件又輸出一套,同一個頁面上出現了两個 Article 或两個 BreadcrumbList。搜尋引擎無法判断该合並還是取其一,最省事的處理方式就是都不用。
5. 頁面類型與标记類型不匹配
栏目列表頁标成 Article,文章頁标成 Product,或者把問答類标记堆在没有任何問答结构的頁面上。類型選错了,後面的字段填得再全也没有用。
一轮可落地的自查怎么做
- 先抽 10 到 20 個代表性 URL:首頁、栏目頁、文章頁、商品或服務頁各取几個,不要只看首頁。
- 用浏览器查看源代碼,搜尋 application/ld+json,把标记内容複製出来格式化。
- 逐字段對照頁面上看得见的信息,重点看時間、作者、主体名稱、面包屑路径這几項。
- 用官方富媒体结果測試工具跑一遍,记錄缺失字段和取值無效的提示。
- URL 量大时,可以寫一段脚本批量抓取頁面、解析标记,先輸出字段缺失或與頁面标题不符的清單,再人工复核。
- 把结果和抓取日誌對照:标记报错的頁面,如果恰好也是蜘蛛反复抓取的對象,處理優先級就更高。
日常维護的几個习惯
- 換模板、上插件、内容改版时,把结构化資料列入上线检查項,而不是上线後再补。
- 時間字段只保留两個来源:人工填寫的發布時間,以及資料库里真實存在的時間戳,避免系統自動刷新覆盖。
- 只标记頁面上确實存在的内容,没有评價就不加评分,没有價格就不加價格字段。
- 同一頁面只保留一套标记,主题和插件二選一,避免重复輸出。
- 下线或归档的頁面,标记一並清理,不要留下指向已刪除资源的引用。
结构化資料不解决抓取通路問题,但它能减少頁面自相矛盾的地方。對于正在用 sitemap、内鏈和日誌去扩大 URL 發現范围的人来说,让已经被抓到的頁面表述一致,是成本很低、也很容易漏掉的一步。