网站收录

PDF、图片、视频也会进索引:非 HTML 资源的收录怎么处理

很多运营只盯着 HTML 页面的收录,忽略了挂在站上的 PDF、图片、视频也会被蜘蛛抓取并进入索引。本文说明这些文件进入索引的路径,区分“阻止抓取”和“阻止索引”的区别,并给出该收的怎么优化、不该收的怎么处理的具体做法与检查顺序。

网站收录

PDF、图片、视频也会进索引:非 HTML 资源的收录怎么处理

聊到收录,多数人默认说的是 HTML 页面。但搜索引擎索引里还有另一大类内容:PDF、Word 转出的文档、图片、视频文件。只要这些文件挂在可公开访问的 URL 上,被内链、站点地图或者别处的链接指到,蜘蛛就可能把它抓下来,抽取其中的信息并建入索引。这部分内容平时没人管,出问题时往往已经挂了好几年。

非 HTML 文件是怎么进入索引的

蜘蛛拿到一个指向文件的 URL,不会因为后缀不是 .html 就走开。它会下载文件,然后按类型处理:PDF 和 Office 文档会抽取可选的文字层,图片会结合文件名、alt 属性、周边正文和页面标题来理解,视频则更多依赖承载它的那个页面。也就是说,一个文件是否被收录,判断依据和普通页面没有本质区别——能不能被抓到、内容能不能被理解、值不值得放进索引。

这也是为什么很多站点在统计收录量时,会发现索引里混着一批自己没打算公开的 URL。

容易“意外”被收录的几类文件

  • 旧版报价单、产品手册、白皮书的历史版本,和现行页面内容互相矛盾。
  • 内部培训资料、会议纪要导出的 PDF,本来只在内部流转,被顺手放进了公开目录。
  • 批量导出的商品图,同一张图带上尺寸后缀变成几十个地址,形成大量重复。
  • 设计稿、扫描件、测试用的示例文件,上传后忘了清理。

这些问题里,重复内容只是小事,真正麻烦的是不该公开的信息被索引。文件一旦进了索引,就算后来从服务器删掉,索引条目也可能保留一段时间,中间这段时间是敞开的。

先分清:阻止抓取和阻止索引不是一回事

处理非 HTML 文件时,最容易踩的坑是把 robots.txt 当成万能开关。它只是告诉蜘蛛不要来抓,并不能让已经被索引的条目消失。

  • robots.txt:阻止抓取。对尚未被发现的文件有效;对已经收录的文件,蜘蛛因为不再抓取,反而看不到你后来加的移除指令,索引条目可能长期挂在那里。
  • X-Robots-Tag 响应头:这是非 HTML 文件最实用的手段。它通过 HTTP 响应头生效,可以对 PDF、图片、视频直接下 noindex 指令,不依赖页面里的 meta 标签——因为文件本身不是 HTML,页面级 noindex 根本管不到它。
  • 登录墙与访问权限:从源头解决。内部资料不放在公开可访问的路径下,比事后补救省事得多。
一句话记住:robots.txt 让蜘蛛不来,X-Robots-Tag 让文件不被索引。想移除已经收录的文件,两个要配合用,而且要等蜘蛛重新抓取时才生效。

希望被收录的图片和 PDF,该做什么

反过来,图片搜索往往能带来一批被忽略的流量,PDF 里的长文档也有被检索的价值。想让它被正常收录,重点在于让蜘蛛读懂它。

  • 文件名用有意义的词,别用 IMG_2031 这类无信息命名。
  • 图片写清 alt,并且让周围正文和它相关,不要堆关键词。
  • PDF 尽量保留可选中的文字层,扫描图转出的纯图片 PDF,蜘蛛很难提取内容。
  • 重要文档配一个 HTML 页面承载,把摘要、要点、下载入口放在页面上,文件作为附件。这样内容更新、结构标记和内链都更灵活。
  • 图片和文档各自有站点地图或站点地图扩展,可以补上抓取入口。

视频和音频:文件本身通常不是入口

视频文件的收录路径和图片不完全一样。蜘蛛很少把视频文件本身当独立页面处理,更多是通过承载它的页面来判断。所以要保证:有一个稳定的页面放播放器,页面上有标题、简介、文字说明;相关的结构化数据填写完整,站点地图里给出视频信息。文件地址换来换去、播放器嵌在弹窗里,都会让收录变得不稳定。

一个可以照做的检查顺序

  1. 把站内所有非 HTML 资源列出来,至少覆盖 upload、download、media、files 这类常见目录。
  2. 逐个分类:该公开的、该移除的、该用 HTML 页面替换的。
  3. 该移除的,加上 X-Robots-Tag,必要时配合 robots.txt,并考虑单独提交移除请求。
  4. 该保留的,补齐文件名、alt、文字说明和站点地图入口。
  5. 过一段时间再看索引状态,确认处理是否生效——这类改动通常不会立刻反映出来。

非 HTML 资源的收录问题,平时不出声,出事就是信息层面的问题。把它纳入日常的收录检查范围,比等到搜索结果里翻出自己的内部文件再去补救要省力得多。