网站收录

非 HTML 资源被收录:图片、PDF 与附件的索引核对顺序

图片、PDF、表格附件同样有 URL,也可能进入搜索索引。这篇整理了非 HTML 资源被收录后的核对顺序:先确认索引里到底是什么,再分别用响应头、robots 规则、sitemap 与内链入口定位来源,区分该保留与该收口的文件,并记录观察节奏,避免误伤有用资源。

网站收录

非 HTML 资源被收录:图片、PDF 与附件的索引核对顺序

做收录核对时,多数人只盯着 HTML 页面,但图片、PDF、Office 附件、音视频文件同样有独立 URL,同样会被蜘蛛抓取。它们不参与常规网页排名,却可能出现在图片结果、文件直链或下载类结果里。当你在搜索里看到一份内部报表、一张临时截图时,问题通常不在页面模板,而在附件目录、响应头和入口链接上。

先确认索引里的到底是什么

不同资源类型的成因不一样,先分类,后面的处理才不会用错工具。

  • 图片结果:通常来自页面内的 img 标签、图片 sitemap 或 CDN 上的可公开访问路径,常见于产品图、插图、缩略图。
  • PDF 直链:说明书、白皮书、报价单这类文件被内链指向后,容易被单独抓取,并带着文件内的标题被索引。
  • 附件与导出文件:后台导出的表格、临时生成的报表、上传后未清理的旧文件,往往是被动暴露的一类。
  • 音视频与其他格式:播放页之外的源文件地址如果可以直接访问,也属于同一类问题。

哪些非 HTML 资源可以保留

并不是所有附件都该收口。产品说明书、公开的数据文件、帮助中心里被正常引用的 PDF,本身就是内容的一部分,它们被索引是合理的。判断标准可以简单一些:这个文件如果被用户直接搜到,是否仍然成立、是否仍然是最新版本。

如果答案是肯定的,重点就放在版本更新和文件内的元信息上,而不是想办法让它消失在索引里。比较常见的问题是旧版本说明书还在,而新版本已经替换了页面链接,两边同时存在。

不该出现在索引里的附件

这类文件的共同点是:本来是给内部或特定流程用的,却因为放在可公开访问的目录下而被抓走。

  • 后台导出的报表、对账单、名单类文件;
  • 测试阶段上传的样张、占位图、临时压缩包;
  • 按日期或随机字符串生成的临时目录下的文件;
  • 带有内部参数或未脱敏信息的文档。

核对顺序:从响应头查到入口

  1. 先划定范围。用站内查询加上服务器日志,把被索引的非 HTML URL 列出来,按目录归类,比逐个处理快得多。
  2. 检查响应头。非 HTML 文件没法加 meta 标签,控制手段主要是 X-Robots-Tag。确认这个头是否真的回传到了文件本身,而不是只加在了 HTML 页面上。
  3. 检查 robots.txt。Disallow 能阻止抓取,但已经进入索引的 URL 不会因此自动消失,反而可能因为抓不到而无法读取 noindex。需要移除时,先让页面可抓取并返回 noindex,或者直接返回 404 / 410。
  4. 检查 sitemap。有些站点会把附件目录整体写进 sitemap,或者由生成工具自动收录所有上传文件。这类提交等于主动告诉蜘蛛来抓,需要单独筛一遍。
  5. 检查内链与下载按钮。很多附件之所以被抓,是因为页面上的下载链接直接指向文件地址。改成带说明的落地页,或者加一层权限校验,通常比事后收口更省事。
  6. 检查 CDN 与回源配置。源站加了限制,边缘节点仍可能保留可公开访问的副本,两边规则要一致。

几个容易弄反的细节

Disallow 与 noindex 同时用

这是最常见的顺序错误。Disallow 会阻止蜘蛛读取文件里的规则,noindex 也就无从生效,结果是 URL 长期留在索引里。正确做法是:需要移除的,先允许抓取并给出 noindex;确实要长期屏蔽的目录,再考虑整体 Disallow。

旧附件目录没清干净

上传目录按年份或月份分文件夹时,旧目录常常只从页面撤了链接,文件本身还在。链接断了,URL 却仍然可访问,收录状态也就一直挂着。

文件内部也带信息

PDF 的作者、标题、内嵌链接都可能被抓取并用于结果展示。整理文件时顺手确认这些字段,比事后改标题更有效。

记录观察节奏

非 HTML 资源的索引变化比 HTML 页面更慢,也更容易受缓存影响。建议把处理动作和日期记在同一张表里,按目录分批观察,而不是每天查一次就下结论。如果一批文件同时被收口,其余目录的状态可以顺带核对,避免同类问题反复出现。

把附件当成页面来管理:有入口、有版本、有归属目录。规则清晰之后,收录核对就只剩下确认执行到位。