网站收录

PDF、图片和下载附件被收录:先分清哪类要留、哪类要处理

站点里的 PDF、图片和下载附件同样会被抓取和收录。这篇文章说明它们进入索引的原因,怎么按用途分三类判断,以及在什么情况下值得保留、什么情况下该用响应头或目录级屏蔽来处理。

网站收录

PDF、图片和下载附件被收录:先分清哪类要留、哪类要处理

站点里除了 HTML 页面,还有一批容易被忽略的可抓取资源:产品手册 PDF、白皮书、图片原图、Excel 模板、压缩包、音视频文件。它们有可访问的 URL,也可能被站内链接指向,因此出现在搜索结果里并不奇怪。

这些文件为什么会被收录

搜索引擎并不只处理 HTML。只要 URL 返回 200、内容可以被解析(PDF 和多数图片格式都算),并且存在入口链接,它就可能被抓取并进入索引。常见的入口包括页面上的下载按钮、正文里的图片链接、附件列表页、站内搜索的直达链接,甚至是早年上传后忘记删除的测试文件。

很多站点是在查“收录为什么这么杂”时才发现,索引里躺着几十个 PDF 和图片。它们本身不是错误,问题在于你是否清楚它们的存在。

先按用途把文件分成三类

  • 用户确实需要的:报价单、说明书、报名表。这类文件能带来有实际价值的搜索流量,通常值得保留收录。
  • 页面辅助素材:正文配图、图标、样式用小图。它们对用户有用,但作为独立搜索结果的意义有限。
  • 历史遗留物:旧版模板、测试文件、内部培训资料、重复导出的多个版本。这类文件往往既没人维护,也没人会搜。

分类之后再决定动作,比一刀切地“全部屏蔽”更稳妥。

图片和 PDF 的处理逻辑不太一样

图片被收录通常不算坏事,尤其是产品图、示意图,用户可能在图片搜索里找到你。要留意的只有两点:一是同一张图被反复上传成多个 URL,形成重复;二是图片体积过大,拉高抓取与加载成本。

PDF 则需要更谨慎,它可能同时带来三类问题:

  • 文件内容与线上页面高度重复,搜索结果里两个版本同时出现;
  • 早期版本的 PDF 仍在索引中,内容已经过时,容易误导用户;
  • 文件体积大,抓取一次的成本远高于普通页面。

如果确实不想让它们出现在搜索结果里

  1. 单文件处理:对 PDF 可以返回 X-Robots-Tag: noindex 响应头,这是最直接的办法;HTML 里写 meta robots 对 PDF 无效。
  2. 成批处理:把附件统一放在固定目录下,例如 /files/、/download/,用 robots.txt 按目录屏蔽抓取。代价是屏蔽之后搜索引擎不会再读取文件内容,图片搜索带来的流量会一起消失。
  3. 从链接层面收敛:如果文件已经没人使用,更彻底的做法是删除文件、去掉相关链接,让它返回 404,而不是一边留着一边屏蔽。
  4. 规范版本:同一份资料有多个版本时,页面上只保留最新版链接,旧文件归档到一个说明页,避免用户和搜索引擎同时找到过期内容。
robots.txt 屏蔽的是抓取,不是已经收录的结果。已经进入索引的 URL,屏蔽之后仍可能出现在搜索结果里,只是摘要信息会逐渐失效。

几个容易踩的坑

  • 用 robots.txt 屏蔽了整个 /uploads/ 目录,结果正文配图也被挡住,页面看起来“没有图片”。
  • 给图片加了 noindex,同时删掉 alt 文本和周边说明文字,图片搜索里再也找不到它。
  • 把 PDF 的 URL 写进 sitemap,却又用 robots.txt 屏蔽同一路径,两处信号互相矛盾。
  • 附件下载需要登录,未登录访问返回 200 的错误页,形成软 404,反而更浪费抓取。

一个可执行的检查顺序

  1. 拉取一段时间的抓取日志或索引报告,筛出非 HTML 后缀的 URL。
  2. 按上面的三类给它们打标签,标出哪些有真实搜索需求。
  3. 对遗留文件先删链接、再删文件,最后确认返回状态码符合预期。
  4. 调整 sitemap 与 robots.txt,让两处信号保持一致。
  5. 过几周再复查一次,确认索引数量变化在预期范围内。

这类文件的数量通常不多,但它们对抓取预算的占用、对搜索结果杂讯的影响,往往比想象中明显。花一次时间梳理清楚,之后只要在上传新附件时顺手归好目录,基本就不会再失控。