网站收录

图片和 PDF 等非 HTML 文件被收录:先判断留不留,再选对屏蔽方式

核对收录时容易忽略图片、PDF、附件这类非 HTML 文件,它们同样是独立 URL,也会被抓取和索引。本文给出判断该不该保留的标准,以及从抽样确认、查找发现路径到选择屏蔽方式的核对顺序,并说明 robots.txt 与 noindex 混用时容易踩的坑。

网站收录

图片和 PDF 等非 HTML 文件被收录:先判断留不留,再选对屏蔽方式

核对收录时,很多人只盯着 HTML 页面,但图片、PDF、表格附件、压缩包这类文件同样是独立 URL,同样可能被抓取、被索引,甚至出现在搜索结果里。等到发现索引里多出一批这类地址再来处理,返工成本会高不少。

这些文件为什么会进索引

搜索引擎看待 URL 并不区分后缀。只要一个地址可以被公开访问,又通过内链、目录列表、Sitemap、外链或页面资源引用等路径被发现,它就有机会进入抓取队列并最终被索引。常见的来源有几类:

  • 页面上直接链接的 PDF 手册、报价表、报名表;
  • 上传后没有做访问控制的图片目录和附件目录;
  • 站点地图或采集工具自动带上的媒体文件地址;
  • 被外部站点转载、引用时留下的资源直链。

先判断:该不该留在索引里

不是所有非 HTML 文件都要清理。判断标准不是“能不能被收录”,而是用户通过搜索找到它时,拿到的是不是一个完整、可用的结果。

通常值得保留的:

  • 产品规格书、公开白皮书等本身就有独立检索需求的资料;
  • 能带来图片搜索流量的主图、示意图;
  • 已经做过整理、只保留一个规范版本的附件。

通常建议收拢或清理的:

  • 仅作页面装饰的内部用图、图标切图;
  • 同一份资料存在 v1、v2、最终版、最终版2 等多个可访问版本;
  • 后台导出、临时上传、测试用的表格与压缩包;
  • 还有对应 HTML 页面在正常服务、内容高度重复的附件。
附件类资源最常见的问题不是“被抓到”,而是同一份内容有多个版本同时可访问。先合并入口、留下唯一版本,再谈要不要屏蔽。

核对顺序

  1. 抽样确认索引状态。从服务器日志或上传目录里挑一批文件地址,逐个查是否已在索引中,而不是凭感觉判断。
  2. 确认发现路径。如果这些地址只出现在上传目录里,说明是目录被遍历或直链传播;如果出现在正文、Sitemap 里,就要先改源头。
  3. 看有没有对应的 HTML 页面。如果同一份内容已有正常页面,附件属于“另一个版本”,优先让页面成为主入口。
  4. 决定动作。要保留的,补上规范的链接入口和文件名、说明文字;要移除的,先取消公开可访问,再考虑索引层面的信号。
  5. 复核。处理完成后隔一段时间再抽查同一批地址,确认索引状态确实变化,而不是只看一次。

屏蔽方式别选错

用 robots.txt 的 Disallow 禁止抓取,会让搜索引擎读不到页面上的 noindex 指令,地址可能长期留在索引里,只是摘要无法更新。想从索引中移除,优先使用 noindex 类信号:PDF 可以在 HTTP 响应头里加 X-Robots-Tag,图片同理;同时把文件从公开目录移走,或改为需要登录才能访问。

如果两者已经同时用上,先撤掉 Disallow、恢复抓取,等 noindex 生效后再考虑是否重新屏蔽。

核对节奏

这类资源不需要天天查,按季度抽样一次即可,重点关注新上传目录和活动专题页带出的附件。核对时把“被发现”和“已收录”分开记录,才能判断问题出在链接入口还是索引环节。