网站收录

图片、PDF 与视频也能被收录:非 HTML 资源的索引规则

图片、PDF、视频等非 HTML 资源同样会进入索引,但发现入口、抓取方式和排查重点与网页并不相同。本文按资源类型梳理常见的收录卡点:图片依赖标签暴露、PDF 需要真实文本层、视频靠承载页面,并给出一套从发现到抓取的检查顺序。

网站收录

图片、PDF 与视频也能被收录:非 HTML 资源的索引规则

多数人谈收录时只盯着 HTML 页面,但索引里同样存着大量非 HTML 资源:图片、PDF、Office 文档、视频。这些资源的收录逻辑和网页不完全一样,出问题时排查方向也不同。

图片收录:卡点通常在“被发现”这一步

图片不是凭空被抓取的对象,它需要一个入口。最常见的入口是在 HTML 里出现标准的 img 标签,或者被 a 标签直接链接。如果图片地址是页面加载后由 JavaScript 拼出来的,而爬虫没有执行到那一步,图片就可能长期不被发现。

常见卡点可以按顺序查:

  • 图片所在页面本身没被抓取或没进索引,图片也很难被单独发现;
  • 懒加载把真实地址放在自定义属性里,src 长期为空;
  • 图片路径被 robots.txt 屏蔽,或返回 403、404;
  • 地址是 data URI、base64 内嵌,或每次请求都变化的临时链接;
  • 图片尺寸过小、与正文无关,即使被抓取也难进入图片索引。

alt 文本不直接决定收录,但它能帮助理解图片内容,也给图片一个更稳定的语义描述,值得认真写。

PDF 与文档:能读到的文本才可能被索引

PDF 里的文字对搜索引擎是可读的,前提是文件里真有文本层。扫描件、图片拼成的 PDF 就接近一个空页面,占着 URL 却没有可用内容。

另外几点容易被忽略:文件体积过大时,抓取可能只取到一部分;同一 URL 上的文档被替换后,索引更新往往比网页慢;文件名和目录尽量保持可读性,不要用一串哈希值。如果文档内容重要,更稳妥的做法是让 HTML 页面承载核心内容,PDF 只作为下载附件,而不是唯一载体。

视频收录:靠承载页面,而不是靠文件本身

视频文件一般不会被单独索引成一个可点击的结果。用户看到的视频结果,多来自承载视频的页面,并配合结构化数据描述时长、缩略图、发布日期等信息。如果视频托管在第三方平台,收录归属通常算在平台侧,你的站点只获得一个外链入口。

排查非 HTML 收录问题的顺序

  1. 确认资源是否在 HTML 里以标准标签暴露,地址是否稳定;
  2. 确认 robots.txt、meta 指令、登录墙没有误挡资源路径;
  3. 确认资源返回 200,Content-Type 正确,没有被 CDN 改写成错误类型;
  4. 在访问日志里找该资源 URL 的抓取记录,区分“没来抓”和“抓了没收”;
  5. 回到承载页面,看页面本身是否已被收录。

一个常见误解

把图片、文档列进站点地图,并不等于它们会被收录。站点地图只是提供一条发现线索,最终能否进入索引,仍取决于资源能否被正常抓取和解析。

结论很简单:非 HTML 资源的收录,先保证“能被发现、能被读到”,再谈其他。资源本身质量再高,如果地址是动态生成的、放在屏蔽目录下,或者只是一个没有文本层的扫描件,索引里就始终不会有它的位置。