网站收录

非 HTML 资源的收录:PDF、图片和视频该不该进索引

站点的 PDF 说明书、产品图、演示视频同样是被爬虫抓取的独立 URL,只是进入的是网页、图片、视频等不同索引。本文说明这类资源的收录前提、重复版本与历史遗留文件的处理方式,并给出按用途判断放行、以及排查非 HTML 资源收录状态的先后顺序。

网站收录

非 HTML 资源的收录:PDF、图片和视频该不该进索引

讨论收录时,注意力常集中在 HTML 页面上,但站点的 PDF 说明书、产品图、演示视频同样是可被抓取的 URL。它们进入的是不同的索引(网页、图片、视频),展示位置、判断标准和治理方式都不太一样。

非 HTML 资源为什么会被抓取

爬虫判断的是 URL 是否可达、robots.txt 是否放行、响应是否正常,而不是扩展名。只要某份 PDF 或图片能被链接触达,它就是一个独立的候选资源。区别在于入索引之后:

  • 网页索引:文本层完整的 PDF、HTML 附件可能被全文检索。
  • 图片索引:取决于图片本身的清晰度、周边文字和所在页面主题。
  • 视频索引:需要可访问的播放地址、明确的标题和缩略图,视频站点地图有助于发现。

PDF 是最容易被忽略的一类

  • 它是独立 URL,母页面上的 canonical、内链信号都不会自动转移过去。
  • 同一份文档上传到多个栏目,就会产生多个近似版本,形成重复内容。
  • 扫描件没有文本层,即使被收录也难以命中关键词,收录价值低。
  • 旧版本文档长期在线,可能和现行页面在搜索结果里同时出现。

一个可操作的判断:用户是否会主动搜索这份文档?会,就让它可抓取,并在标题、文件名上写清版本和用途;不会,只是页面附件,就用 410、robots.txt 或 noindex 收口,别让它在索引里长期占位。

图片和视频的收录前提

  1. 图片使用可解析的 img 标签,而不是纯 CSS 背景图,src 是稳定的 URL。
  2. alt 与周边正文用来描述图片内容,别堆关键词。
  3. 视频提供可直接访问的播放页或文件地址,配好标题、时长、缩略图。
  4. 用图片、视频站点地图补充抓取入口,尤其是藏在深层的资源。

需要注意:图片或视频被索引,不等于所在页面会被收录;反过来,页面没被收录,图片也常常跟着进不了索引。两者相关,但不重合。

该不该放行:按用途分三类

  • 有独立搜索需求:产品手册、研究报告、教程视频。保留抓取,做好标题与描述。
  • 只是页面附件:合同模板、表单下载、图集原图。随页面存在即可,不必专门优化。
  • 历史遗留与重复版本:旧版文档、重复上传的图片。清理或屏蔽,避免稀释站点整体质量。

排查顺序建议

  1. 先用站点地图或服务器日志整理出被抓取的非 HTML URL 清单。
  2. 按扩展名和目录分组,看哪些目录数量异常。
  3. 逐个确认是否被 robots.txt 拦截、是否返回 200、是否有可用文本层。
  4. 对比是否与现行页面内容重复,决定保留、合并还是下线。
  5. 要保留的资源补内链和站点地图条目;不要的直接用 410 或屏蔽,给附件加 canonical 通常没有意义。
非 HTML 资源不需要“全部收录”,也不该“一律屏蔽”。按用户是否会主动搜索来判断,比按文件类型一刀切更靠谱。

最后提醒一句:这类资源的收录状态在常规的页面索引报告里往往看不全,需要在图片、视频索引或资源级查询中单独核对。数据对不上时,先确认清楚你看的是哪一个索引。