网站收录

图片、PDF 与附件也被收录:非 HTML 资源的取舍与自查

很多人只检查 HTML 页面的收录,却忽略了图片、PDF、Office 文件和压缩包同样会进索引。这类资源有的能带来访问,有的只是占用抓取时间。本文给出判断口径:哪些值得保留、哪些适合收紧,以及用 robots.txt 和 X-Robots-Tag 处理时的差异和自查顺序。

网站收录

图片、PDF 与附件也被收录:非 HTML 资源的取舍与自查

聊收录的时候,大多数人只盯着 HTML 页面,忽略了图片、PDF、Office 文件和压缩包这类非 HTML 资源。搜索引擎同样会把它们纳入索引,有的出现在图片搜索里,有的直接出现在网页结果中,也有的只是安静地占用抓取时间。要不要处理,取决于这些资源对业务有没有实际价值。

非 HTML 资源为什么会被收录

只要服务器返回 200、内容可解析,搜索引擎就可能把它收录。图片有相对独立的图片索引,PDF 和文档则可能进入普通的网页结果。常见的触发场景包括:

  • 正文里直接链接了 PDF,链接周边没有加任何限制;
  • 图片以独立 URL 存在,且附近有描述性文字;
  • 文件目录可以被访问,或者存在自动生成的附件列表页;
  • 同一个附件被内链多次引用,爬虫顺着链接反复访问。

这些资源被收录本身不是错误。真正需要关心的是:它带来了什么,又占用了多少抓取预算。

先分清哪些该留、哪些该挡

比较实用的做法是按价值分三类,而不是一刀切。

  • 保留:产品手册、白皮书、规格表、报名表这类用户会主动搜索和下载的文件。它们适合保留,最好配一个 HTML 落地页承接介绍和转化,让文件本身承担下载,而不是承担全部流量。
  • 收紧:纯装饰图、缩略图、同一份文档的多个导出格式、测试用的临时附件。它们被收录通常没有正面作用,还容易和正式版本形成内容重复。
  • 观察:拿不准的可以先不动,记录它们在一段时间里的抓取次数和点击情况,再决定。

处理手段不一样,别用错

对非 HTML 资源来说,能用的手段比页面少,效果也不完全等同。

robots.txt

适合按目录或文件类型整批屏蔽,例如限制某个上传目录。需要注意的是,被 robots.txt 屏蔽的 URL 仍可能出现在索引里,只是搜索结果中不显示摘要。如果目标是彻底不出现,这个方式不一定够。

X-Robots-Tag

PDF 和文档无法在正文里放 meta 标签,但可以在 HTTP 响应头里下发 X-Robots-Tag: noindex。它比 robots.txt 更接近“不收录”的目标,前提是服务器配置正确,并且爬虫每次都能读到响应头。配置后建议用抓取工具确认一次返回结果,避免只改了一半。

图片的处理

图片一般没有合适的位置放 noindex,通常靠 robots.txt 控制目录,或者干脆不让装饰图以独立 URL 被链接。真正希望被搜到的产品图,反而要补上清晰的文件名、alt 和周边说明文字,缺了这些,收录了也很难被匹配到。

自查顺序

  1. 从服务器日志里找出抓取次数靠前的非 HTML URL,按目录和文件类型归类;
  2. 估算各类资源占用的抓取比例,判断是否挤占了重要页面的抓取;
  3. 对照业务需求,把资源标成保留、收紧、观察三类;
  4. 对要收紧的,先检查内链、站点地图和页面引用,一并清理或替换;
  5. 改完之后留出一段时间观察,不要频繁来回调整规则。
收录数量不是越多越好,非 HTML 资源也一样。让有价值的文件被搜到、被下载,让低价值的文件少占用抓取,比单纯追求收录条数更有意义。

最后提醒一点:非 HTML 资源的收录变化通常比页面更慢,处理之后不要急着下结论。先把口径和分类定清楚,再根据日志和搜索表现慢慢调整,比一次性大批量屏蔽稳妥得多。