网站收录

PDF、图片、附件被收录了:非 HTML 资源该怎么管

很多站点在核对收录情况时,发现索引里混着 PDF、图片直链和附件文件。这类非 HTML 资源确实会被搜索引擎发现并纳入索引。本文梳理它们进索引的常见路径,区分哪些可以保留、哪些值得处理,并说明 robots.txt、X-Robots-Tag、状态码在处理时的实际差别与排查顺序。

网站收录

PDF、图片、附件被收录了:非 HTML 资源该怎么管

用 site: 指令抽查收录情况时,很多人会看到 PDF、JPG、DOCX 甚至 ZIP 出现在结果里。第一反应往往是“这些东西怎么也被收录了”。实际上,搜索引擎能解析的远不止 HTML 页面,图片、PDF、办公文档都在处理范围内。它们的收录问题,处理逻辑和网页并不完全一样。

这些文件是怎么被发现的

非 HTML 资源进入索引,前提都是先被当成一个 URL 发现。常见的发现路径有几类:

  • 页面里的链接或按钮直接指向 xxx.pdf、xxx.jpg 这类直链
  • sitemap 里同时提交了文件地址
  • 上传目录、附件目录被开放列目录,蜘蛛顺着目录层级爬完
  • 外部站点直接引用了你的图片或文档地址

发现之后,文件本身能正常返回、内容可被提取,就具备了进索引的基础条件。图片则主要依赖文件名、alt 文本、周边正文和结构化数据来判断主题。

先分类,再决定管不管

不是所有被收录的文件都要清理。先按用途分一下,处理成本会低很多。

  • 有独立价值的文档:产品手册、规格书、公开报告、白皮书。这类文件本身是内容资产,被收录通常是好事,重点是保证链接可访问、文件名和标题可读。
  • 图片直链与缩略图:一般不需要刻意追求收录,但也不必紧张。数量不大时基本不影响什么。
  • 用户上传的临时附件:头像原图、订单导出、后台临时文件。这类通常没有检索价值,值得处理。
  • 可被批量遍历的目录:uploads、files、download 这类目录如果可直接列出内容,是最需要优先处理的一类,因为它会持续产生新的可抓取 URL。

几种处理手段的差别

robots.txt

Disallow 只阻止抓取,不阻止索引。如果某个文件地址被外部链接指向,它仍可能以“仅有 URL、没有摘要”的形式出现在结果里。用 robots 挡目录时,要清楚这一点。

X-Robots-Tag

PDF、图片这类文件放不进 meta 标签,但服务端可以返回 X-Robots-Tag 响应头,值设为 noindex。这是对非 HTML 文件更直接的手段,前提是服务器能针对这些文件类型单独配置响应头。

入口与状态码

把附件的入口从直链改成 HTML 详情页,是一种结构性做法:直链不作为主要导航出现,发现路径自然变窄。文件确实下架时,返回 404 或 410 比返回一个空白页更清楚,返回 200 的空壳会让搜索引擎反复抓取。

排查顺序

  1. 用 site:你的域名 filetype:pdf 等方式抽样,先看被收录的到底是哪几类文件
  2. 索引报告里一般没有按文件类型分组,需要回到服务器日志,统计 .pdf、.jpg 等后缀的抓取频次和状态码
  3. 判断问题出在发现路径(内链、目录、sitemap)还是文件本身(有无价值、是否已删除)
  4. 再决定是保留、加 noindex 头,还是调整入口链接
  5. 改动后隔一段时间再抽样核对,不要改完当天就下结论
处理非 HTML 资源的目标不是把索引清空,而是让有价值的文件更容易被找到,让无检索价值的直链不再持续占用抓取与索引资源。

几个常见的误判

  • 把图片被收录当成重复内容问题来处理,方向跑偏。
  • 用了 robots.txt 就以为文件会从索引里消失,实际可能仍然可见。
  • 只改了 sitemap,忘了页面上还有大量指向旧直链的内链。
  • 素材站、图库站和普通企业站的情况不同,前者本来就需要图片被检索,不能照搬“全部挡住”的做法。

把这几类文件单独拉出来看一遍,你会发现多数问题不是文件太多,而是入口没有设计过:什么该被导流到详情页,什么该保持直链,什么该彻底关掉,提前定好规则,后面就省事得多。