日常盯收录,多数人只看 HTML 页面。等到某天用 site: 查一下,才发现索引里还躺着几十个 PDF、一堆商品图,甚至几份早期的 Word 报价单。这些都是非 HTML 文件,搜索引擎同样会抓取和解析,值得单独花点时间理一遍。
非 HTML 文件为什么也会进索引
搜索引擎的抓取器不只认 HTML。PDF 会被提取正文并参与网页搜索,图片会进入图片搜索,Office、TXT 以及部分压缩包里的内容也可能被读取。判断标准和普通页面其实一样:URL 可以公开访问、没有被 robots 规则挡住、没有 noindex 类指令,就有机会被抓取和收录。所以附件出现几条索引记录,本身不是出错,而是默认行为。
先分清哪些该留、哪些该清
不建议看到非 HTML 结果就一律屏蔽,先按用途分成两类:
- 建议保留:对外的产品手册、白皮书、规范文档、公开的图片素材。这类文件往往能带来搜索流量,也常被当作独立的落地内容使用。
- 建议清理:内部培训资料、过期报价单、含客户信息的表格、临时发给某个人的文件、测试上传的附件、由参数批量生成的缩略图。
判断依据不是文件格式,而是这个文件是否希望被陌生人搜到。
从哪些入口排查
- 用 site:你的域名 filetype:pdf(其他格式同理)大致看数量。
- 翻服务器日志,按扩展名过滤,看哪些文件被反复抓取。
- 看搜索控制台的页面报告,附件有时会被归到单独的类别里。
- 图片资源另看图片搜索的表现数据,别和文档混在一起判断。
几种处理方式,效果不一样
robots.txt 屏蔽抓取
挡住抓取路径,成本最低,但对已经进索引的文件作用有限:记录可能还在,只是摘要不再更新。适合那些希望彻底不对外、并且后续会从索引里自然淡出的文件。
X-Robots-Tag 响应头
这是对 PDF 这类文件最直接的办法。在服务器或对象存储上给对应文件加上 X-Robots-Tag: noindex,效果类似页面的 noindex。前提是你能控制响应头,纯静态托管要先确认平台是否支持。
挪位置或改权限
把文件移进需要登录才能访问的目录,或者换成带权限校验的下载链接。外部访问不到,索引迟早会失效。要注意旧的直链如果还能打开,等于没处理。
直接删除并返回 404 或 410
文件确实不要了,删掉并让服务器返回 404 或 410 都可以,410 表达得更明确。如果只返回 200 的空壳页面,反而容易被当成软 404,处理起来更麻烦。
图片别一刀切
图片搜索是一条真实的流量来源。清理之前先看数据:有曝光、有点击的图优先保留;只是体积大、命名混乱但内容有用的图,考虑压缩和重命名;真正该清的是重复、过期、无意义的占位图。
处理指令只是把门关上,已经进索引的记录不会马上消失,通常需要一段时间才会淡出。期间可以用 URL 检查工具确认单个地址的当前状态。
一个可以照着走的顺序
- 先导出清单,按访问量或时间排序,优先处理高风险的敏感文件。
- 确认每个文件到底要留还是要清,别用一条规则覆盖全部。
- 要清的,优先用 X-Robots-Tag 或权限控制;确定废弃的再删除。
- 要留的,把命名、目录和落地页关系整理规范,顺带补上合适的描述信息。
- 隔几周再查一次,确认记录在减少,而不是换了个地址继续出现。
附件和图片的收录管理,本质还是那道老题:先想清楚这个 URL 是否值得被搜到,再决定用什么手段。想清楚了,操作反而简单。