内容不以文字形式存在,可读入口就少了
搜索引擎判断一个页面值不值得收录、该匹配哪些查询,主要依据是页面里可以直接读取的文本。当正文被做成图片、扫描件 PDF 或视频时,这些信息并没有以文字形式进入 HTML,抓取系统能拿到的往往只剩文件名、周边说明和替代文本。这不等于完全读不到,但等于把可控的部分交了出去。
图片里的文字,能被读到多少
对搜索系统来说,一张图首先是一张图。能获取信息的渠道通常是这几条:
- 文件名:img-01.png 和 安装步骤-第三步.png 提供的信息量差别很大。
- alt 文本:用来描述图片内容,也能改善可访问性,但不适合堆关键词。
- 图片周围的正文与标题:上下文会影响图片被理解成什么。
- 页面整体主题:同一张图放在不同页面,含义可能完全不同。
OCR 在部分场景会被用来识别图片中的文字,但它更多是辅助理解,并不保证当作页面正文参与排序。把整段攻略、参数表、价目表做成图片,等于让这部分内容在文本层面几乎消失。
PDF 的情况:能被索引,但和页面是两份东西
文本型 PDF 通常可以被抓取并建立索引,甚至单独出现在搜索结果里。不过有几点需要留意:
- PDF 是独立的 URL,和它所在的产品页、文章页各有各的索引状态。页面被收录不代表 PDF 被收录,反过来也一样。
- 扫描件 PDF 本质是图片,需要 OCR 才能提取文字,效果取决于清晰度和排版质量。
- PDF 更新后同样需要等待重新抓取,直接覆盖同名文件,比不断新增 v1、v2、v3 更好管理。
- PDF 在移动端的阅读体验通常较差,用户打开后快速跳出,也会影响页面的整体表现判断。
视频与音频:需要一层文字
视频里的讲解、音频里的访谈,搜索系统默认拿不到其中的内容。可行的做法是提供字幕文件,或者在页面上放文字稿、要点摘要,让核心信息至少以文本形式存在一次。
自查顺序
- 临时不加载图片、只看文本,检查页面还剩多少可用文字。如果连核心结论都找不到,风险就比较明显。
- 检查关键图片的 alt 是否在描述内容,而不是重复标题或堆砌关键词。
- 确认重要 PDF 是否有对应的 HTML 页面,至少也要在页面上给出文字摘要。
- 用搜索引擎的 filetype 语法看一下 PDF 是否被单独收录,版本是不是最新的。
- 替换资料时尽量保持 URL 稳定,避免同一份文件产生多个可访问地址。
更稳妥的取舍
图片、PDF、视频本身没有问题,它们是内容形式的一部分。问题在于把唯一一份信息放进了里面。比较稳的做法是:正文用文字写清楚,图片承担说明和示例,PDF 作为下载附件而不是唯一载体,视频配一份文字稿。这样既照顾阅读体验,也不至于把收录完全寄托在 OCR 上。
一个简单的判断方法:把页面里的图片和附件全部去掉,如果剩下的文字仍然能回答用户的问题,收录和匹配就基本不会被形式拖累。