内容不以文字形式存在,可讀入口就少了
搜尋引擎判断一個頁面值不值得收錄、该匹配哪些查询,主要依據是頁面里可以直接讀取的文本。当正文被做成图片、掃描件 PDF 或视频时,這些信息並没有以文字形式進入 HTML,抓取系統能拿到的往往只剩文件名、周邊說明和替代文本。這不等于完全讀不到,但等于把可控的部分交了出去。
图片里的文字,能被讀到多少
對搜尋系統来说,一張图首先是一張图。能获取信息的渠道通常是這几條:
- 文件名:img-01.png 和 安装步骤-第三步.png 提供的信息量差別很大。
- alt 文本:用来描述图片内容,也能改善可訪問性,但不适合堆關鍵詞。
- 图片周围的正文與标题:上下文會影响图片被理解成什么。
- 頁面整体主题:同一張图放在不同頁面,含义可能完全不同。
OCR 在部分场景會被用来识別图片中的文字,但它更多是辅助理解,並不保證当作頁面正文參與排序。把整段攻略、參數表、價目表做成图片,等于让這部分内容在文本层面几乎消失。
PDF 的情况:能被索引,但和頁面是两份東西
文本型 PDF 通常可以被抓取並建立索引,甚至單獨出現在搜尋结果里。不過有几点需要留意:
- PDF 是獨立的 URL,和它所在的产品頁、文章頁各有各的索引狀態。頁面被收錄不代表 PDF 被收錄,反過来也一样。
- 掃描件 PDF 本质是图片,需要 OCR 才能提取文字,效果取决于清晰度和排版质量。
- PDF 更新後同样需要等待重新抓取,直接覆盖同名文件,比不断新增 v1、v2、v3 更好管理。
- PDF 在移動端的阅讀体驗通常較差,用戶打開後快速跳出,也會影响頁面的整体表現判断。
视频與音频:需要一层文字
视频里的讲解、音频里的訪谈,搜尋系統預設拿不到其中的内容。可行的做法是提供字幕文件,或者在頁面上放文字稿、要点摘要,让核心信息至少以文本形式存在一次。
自查顺序
- 临时不加载图片、只看文本,检查頁面還剩多少可用文字。如果连核心结论都找不到,風險就比較明顯。
- 检查關键图片的 alt 是否在描述内容,而不是重复标题或堆砌關鍵詞。
- 確認重要 PDF 是否有對應的 HTML 頁面,至少也要在頁面上给出文字摘要。
- 用搜尋引擎的 filetype 语法看一下 PDF 是否被單獨收錄,版本是不是最新的。
- 替換资料时尽量保持 URL 稳定,避免同一份文件产生多個可訪問地址。
更稳妥的取舍
图片、PDF、视频本身没有問题,它們是内容形式的一部分。問题在于把唯一一份信息放進了里面。比較稳的做法是:正文用文字寫清楚,图片承担說明和示例,PDF 作為下载附件而不是唯一载体,视频配一份文字稿。這样既照顾阅讀体驗,也不至于把收錄完全寄托在 OCR 上。
一個简單的判断方法:把頁面里的图片和附件全部去掉,如果剩下的文字仍然能回答用戶的問题,收錄和匹配就基本不會被形式拖累。