网站收录

把正文做成图片或 PDF:搜索引擎能读到多少内容

正文被做成图片、扫描件 PDF 或视频时,可被直接读取的文本会大幅减少。这篇文章说明图片文字、PDF 和音视频内容分别能被读到什么程度,并给出一份自查顺序,帮你判断哪些信息不该只放在非文本载体里。

网站收录

把正文做成图片或 PDF:搜索引擎能读到多少内容

内容不以文字形式存在,可读入口就少了

搜索引擎判断一个页面值不值得收录、该匹配哪些查询,主要依据是页面里可以直接读取的文本。当正文被做成图片、扫描件 PDF 或视频时,这些信息并没有以文字形式进入 HTML,抓取系统能拿到的往往只剩文件名、周边说明和替代文本。这不等于完全读不到,但等于把可控的部分交了出去。

图片里的文字,能被读到多少

对搜索系统来说,一张图首先是一张图。能获取信息的渠道通常是这几条:

  • 文件名:img-01.png 和 安装步骤-第三步.png 提供的信息量差别很大。
  • alt 文本:用来描述图片内容,也能改善可访问性,但不适合堆关键词。
  • 图片周围的正文与标题:上下文会影响图片被理解成什么。
  • 页面整体主题:同一张图放在不同页面,含义可能完全不同。

OCR 在部分场景会被用来识别图片中的文字,但它更多是辅助理解,并不保证当作页面正文参与排序。把整段攻略、参数表、价目表做成图片,等于让这部分内容在文本层面几乎消失。

PDF 的情况:能被索引,但和页面是两份东西

文本型 PDF 通常可以被抓取并建立索引,甚至单独出现在搜索结果里。不过有几点需要留意:

  • PDF 是独立的 URL,和它所在的产品页、文章页各有各的索引状态。页面被收录不代表 PDF 被收录,反过来也一样。
  • 扫描件 PDF 本质是图片,需要 OCR 才能提取文字,效果取决于清晰度和排版质量。
  • PDF 更新后同样需要等待重新抓取,直接覆盖同名文件,比不断新增 v1、v2、v3 更好管理。
  • PDF 在移动端的阅读体验通常较差,用户打开后快速跳出,也会影响页面的整体表现判断。

视频与音频:需要一层文字

视频里的讲解、音频里的访谈,搜索系统默认拿不到其中的内容。可行的做法是提供字幕文件,或者在页面上放文字稿、要点摘要,让核心信息至少以文本形式存在一次。

自查顺序

  1. 临时不加载图片、只看文本,检查页面还剩多少可用文字。如果连核心结论都找不到,风险就比较明显。
  2. 检查关键图片的 alt 是否在描述内容,而不是重复标题或堆砌关键词。
  3. 确认重要 PDF 是否有对应的 HTML 页面,至少也要在页面上给出文字摘要。
  4. 用搜索引擎的 filetype 语法看一下 PDF 是否被单独收录,版本是不是最新的。
  5. 替换资料时尽量保持 URL 稳定,避免同一份文件产生多个可访问地址。

更稳妥的取舍

图片、PDF、视频本身没有问题,它们是内容形式的一部分。问题在于把唯一一份信息放进了里面。比较稳的做法是:正文用文字写清楚,图片承担说明和示例,PDF 作为下载附件而不是唯一载体,视频配一份文字稿。这样既照顾阅读体验,也不至于把收录完全寄托在 OCR 上。

一个简单的判断方法:把页面里的图片和附件全部去掉,如果剩下的文字仍然能回答用户的问题,收录和匹配就基本不会被形式拖累。