网站收录

内容装在图片、PDF 和附件里:能被索引的文字有多少

把重要信息做成图片、PDF 或视频的站点不少,但爬虫读到的往往只是文件名和链接。本文说明不同内容载体在抓取与收录上的差别:图片依赖 alt 与图注,文档需要文字层,视频和画布几乎不产出可读文字,并给出把非文字内容转成可索引文字的检查顺序。

网站收录

内容装在图片、PDF 和附件里:能被索引的文字有多少

不少站点把重要信息做成图片、PDF 或者视频,页面上看起来信息很足,但爬虫拿到的只是一堆文件名和没有解释的链接。抓取本身可能没出问题,可读到的文字太少,后面的索引和展现就会受限。下面整理不同内容载体在收录上的差别,以及可以补哪些文字。

爬虫读的是文本,不是画面

爬虫拿到 HTML 后,会解析标签、提取正文、识别链接。图片、视频、Canvas 画布,以及部分靠脚本插入的内容,都不会自动变成文本。也就是说,用户眼睛看到的,和爬虫读到的,可能是两套东西。

一个简单的判断方法:把页面的样式和图片都关掉,剩下的文字能不能说清这页在讲什么。如果关掉之后几乎是空白,这页进入索引的难度通常比较大。

图片里的文字:靠 alt、图注和周边正文补

价格表、流程图、活动规则这类做成图片的内容,图上的字不会被直接读取。能帮上忙的主要是这几处:

  • alt 属性:用一句话说明图片内容,不要堆词,也不要写成“图片1”。
  • 图注与上下文:图片前后的正文段落,往往比 alt 更能说明它在页面里的位置和作用。
  • 文件名:有意义的名字比 IMG_2043.jpg 稍好,但作用有限,不值得过度优化。

如果一张图承担了核心信息,更稳妥的做法是在同一页用文字把要点复述一遍,而不是只依赖 alt。

PDF、表格与附件:可以被索引,但有条件

主流搜索引擎确实会索引 PDF 等文档格式,前提是能被正常抓取、内容可提取、体积不过大。常见毛病有三个:扫描件没有文字层,整页等于一张图;文件太大,抓取被截断;文档本身缺少标题和基本信息。

  1. 扫描件加上 OCR 文字层,或者用 HTML 页面重写关键内容。
  2. 给文档起一个规范的标题,并在下载页写清楚文件里有什么、适合谁看。
  3. 下载地址保持稳定,避免每次生成有时效的临时链接。
  4. 重要的表格数据,尽量同时提供 HTML 版本。

视频、Canvas 与动态图表

视频要靠页面上的文字支撑,比如标题、简介、要点和字幕;纯 Canvas 或图片渲染的图表,爬虫基本拿不到数值。折叠区域如果内容本来就写在 HTML 里、只是被样式隐藏,通常还能读到;如果必须先点击、由脚本再插入内容,那就属于渲染执行的问题,需要单独排查。

把非文字内容翻译成可索引文字

不用把所有内容重新写一遍,抓住重点即可:核心结论、关键数据、适用条件,用几句话写在图文旁边。用户能快速了解,页面也多了一段可读文本。

要区分“抓取成功”和“进入索引”:爬虫来过、返回 200,说明抓取这一环没问题;页面上缺少可读文字,问题往往出在后面的内容判断环节,日志里不一定看得出来。

自查顺序

  1. 关闭图片和样式,看页面还剩多少有效文字。
  2. 核心图片是否有 alt,图片前后是否有说明。
  3. PDF 和附件能否直接打开、是否带文字层、体积是否过大。
  4. 下载页是否用文字描述了文件内容。
  5. 重要信息是否只存在于视频或画布里,需要补写文字版。