网站收录

非 HTML 文件被收录了:PDF、图片和附件该留还是该清

很多运营只盯 HTML 页面,直到用 site: 一查才发现索引里躺着大量 PDF、图片和早期文档。这类非 HTML 文件搜索引擎同样会抓取解析,处理方式也和普通页面不同。本文先帮你分清哪些该留、哪些该清,再对比 robots.txt、X-Robots-Tag、权限控制和删除几种手段的实际差别,给出一套可以照着走的排查与执行顺序。

网站收录

非 HTML 文件被收录了:PDF、图片和附件该留还是该清

日常盯收录,多数人只看 HTML 页面。等到某天用 site: 查一下,才发现索引里还躺着几十个 PDF、一堆商品图,甚至几份早期的 Word 报价单。这些都是非 HTML 文件,搜索引擎同样会抓取和解析,值得单独花点时间理一遍。

非 HTML 文件为什么也会进索引

搜索引擎的抓取器不只认 HTML。PDF 会被提取正文并参与网页搜索,图片会进入图片搜索,Office、TXT 以及部分压缩包里的内容也可能被读取。判断标准和普通页面其实一样:URL 可以公开访问、没有被 robots 规则挡住、没有 noindex 类指令,就有机会被抓取和收录。所以附件出现几条索引记录,本身不是出错,而是默认行为。

先分清哪些该留、哪些该清

不建议看到非 HTML 结果就一律屏蔽,先按用途分成两类:

  • 建议保留:对外的产品手册、白皮书、规范文档、公开的图片素材。这类文件往往能带来搜索流量,也常被当作独立的落地内容使用。
  • 建议清理:内部培训资料、过期报价单、含客户信息的表格、临时发给某个人的文件、测试上传的附件、由参数批量生成的缩略图。

判断依据不是文件格式,而是这个文件是否希望被陌生人搜到。

从哪些入口排查

  • site:你的域名 filetype:pdf(其他格式同理)大致看数量。
  • 翻服务器日志,按扩展名过滤,看哪些文件被反复抓取。
  • 看搜索控制台的页面报告,附件有时会被归到单独的类别里。
  • 图片资源另看图片搜索的表现数据,别和文档混在一起判断。

几种处理方式,效果不一样

robots.txt 屏蔽抓取

挡住抓取路径,成本最低,但对已经进索引的文件作用有限:记录可能还在,只是摘要不再更新。适合那些希望彻底不对外、并且后续会从索引里自然淡出的文件。

X-Robots-Tag 响应头

这是对 PDF 这类文件最直接的办法。在服务器或对象存储上给对应文件加上 X-Robots-Tag: noindex,效果类似页面的 noindex。前提是你能控制响应头,纯静态托管要先确认平台是否支持。

挪位置或改权限

把文件移进需要登录才能访问的目录,或者换成带权限校验的下载链接。外部访问不到,索引迟早会失效。要注意旧的直链如果还能打开,等于没处理。

直接删除并返回 404 或 410

文件确实不要了,删掉并让服务器返回 404 或 410 都可以,410 表达得更明确。如果只返回 200 的空壳页面,反而容易被当成软 404,处理起来更麻烦。

图片别一刀切

图片搜索是一条真实的流量来源。清理之前先看数据:有曝光、有点击的图优先保留;只是体积大、命名混乱但内容有用的图,考虑压缩和重命名;真正该清的是重复、过期、无意义的占位图。

处理指令只是把门关上,已经进索引的记录不会马上消失,通常需要一段时间才会淡出。期间可以用 URL 检查工具确认单个地址的当前状态。

一个可以照着走的顺序

  1. 先导出清单,按访问量或时间排序,优先处理高风险的敏感文件。
  2. 确认每个文件到底要留还是要清,别用一条规则覆盖全部。
  3. 要清的,优先用 X-Robots-Tag 或权限控制;确定废弃的再删除。
  4. 要留的,把命名、目录和落地页关系整理规范,顺带补上合适的描述信息。
  5. 隔几周再查一次,确认记录在减少,而不是换了个地址继续出现。

附件和图片的收录管理,本质还是那道老题:先想清楚这个 URL 是否值得被搜到,再决定用什么手段。想清楚了,操作反而简单。