網站收錄

把正文做成图片或 PDF:搜尋引擎能讀到多少内容

正文被做成图片、掃描件 PDF 或视频时,可被直接讀取的文本會大幅减少。這篇文章說明图片文字、PDF 和音视频内容分別能被讀到什么程度,並给出一份自查顺序,帮你判断哪些信息不该只放在非文本载体里。

網站收錄

把正文做成图片或 PDF:搜尋引擎能讀到多少内容

内容不以文字形式存在,可讀入口就少了

搜尋引擎判断一個頁面值不值得收錄、该匹配哪些查询,主要依據是頁面里可以直接讀取的文本。当正文被做成图片、掃描件 PDF 或视频时,這些信息並没有以文字形式進入 HTML,抓取系統能拿到的往往只剩文件名、周邊說明和替代文本。這不等于完全讀不到,但等于把可控的部分交了出去。

图片里的文字,能被讀到多少

對搜尋系統来说,一張图首先是一張图。能获取信息的渠道通常是這几條:

  • 文件名:img-01.png 和 安装步骤-第三步.png 提供的信息量差別很大。
  • alt 文本:用来描述图片内容,也能改善可訪問性,但不适合堆關鍵詞。
  • 图片周围的正文與标题:上下文會影响图片被理解成什么。
  • 頁面整体主题:同一張图放在不同頁面,含义可能完全不同。

OCR 在部分场景會被用来识別图片中的文字,但它更多是辅助理解,並不保證当作頁面正文參與排序。把整段攻略、參數表、價目表做成图片,等于让這部分内容在文本层面几乎消失。

PDF 的情况:能被索引,但和頁面是两份東西

文本型 PDF 通常可以被抓取並建立索引,甚至單獨出現在搜尋结果里。不過有几点需要留意:

  • PDF 是獨立的 URL,和它所在的产品頁、文章頁各有各的索引狀態。頁面被收錄不代表 PDF 被收錄,反過来也一样。
  • 掃描件 PDF 本质是图片,需要 OCR 才能提取文字,效果取决于清晰度和排版质量。
  • PDF 更新後同样需要等待重新抓取,直接覆盖同名文件,比不断新增 v1、v2、v3 更好管理。
  • PDF 在移動端的阅讀体驗通常較差,用戶打開後快速跳出,也會影响頁面的整体表現判断。

视频與音频:需要一层文字

视频里的讲解、音频里的訪谈,搜尋系統預設拿不到其中的内容。可行的做法是提供字幕文件,或者在頁面上放文字稿、要点摘要,让核心信息至少以文本形式存在一次。

自查顺序

  1. 临时不加载图片、只看文本,检查頁面還剩多少可用文字。如果连核心结论都找不到,風險就比較明顯。
  2. 检查關键图片的 alt 是否在描述内容,而不是重复标题或堆砌關鍵詞。
  3. 確認重要 PDF 是否有對應的 HTML 頁面,至少也要在頁面上给出文字摘要。
  4. 用搜尋引擎的 filetype 语法看一下 PDF 是否被單獨收錄,版本是不是最新的。
  5. 替換资料时尽量保持 URL 稳定,避免同一份文件产生多個可訪問地址。

更稳妥的取舍

图片、PDF、视频本身没有問题,它們是内容形式的一部分。問题在于把唯一一份信息放進了里面。比較稳的做法是:正文用文字寫清楚,图片承担說明和示例,PDF 作為下载附件而不是唯一载体,视频配一份文字稿。這样既照顾阅讀体驗,也不至于把收錄完全寄托在 OCR 上。

一個简單的判断方法:把頁面里的图片和附件全部去掉,如果剩下的文字仍然能回答用戶的問题,收錄和匹配就基本不會被形式拖累。