用 site: 指令抽查收录情况时,很多人会看到 PDF、JPG、DOCX 甚至 ZIP 出现在结果里。第一反应往往是“这些东西怎么也被收录了”。实际上,搜索引擎能解析的远不止 HTML 页面,图片、PDF、办公文档都在处理范围内。它们的收录问题,处理逻辑和网页并不完全一样。
这些文件是怎么被发现的
非 HTML 资源进入索引,前提都是先被当成一个 URL 发现。常见的发现路径有几类:
- 页面里的链接或按钮直接指向 xxx.pdf、xxx.jpg 这类直链
- sitemap 里同时提交了文件地址
- 上传目录、附件目录被开放列目录,蜘蛛顺着目录层级爬完
- 外部站点直接引用了你的图片或文档地址
发现之后,文件本身能正常返回、内容可被提取,就具备了进索引的基础条件。图片则主要依赖文件名、alt 文本、周边正文和结构化数据来判断主题。
先分类,再决定管不管
不是所有被收录的文件都要清理。先按用途分一下,处理成本会低很多。
- 有独立价值的文档:产品手册、规格书、公开报告、白皮书。这类文件本身是内容资产,被收录通常是好事,重点是保证链接可访问、文件名和标题可读。
- 图片直链与缩略图:一般不需要刻意追求收录,但也不必紧张。数量不大时基本不影响什么。
- 用户上传的临时附件:头像原图、订单导出、后台临时文件。这类通常没有检索价值,值得处理。
- 可被批量遍历的目录:uploads、files、download 这类目录如果可直接列出内容,是最需要优先处理的一类,因为它会持续产生新的可抓取 URL。
几种处理手段的差别
robots.txt
Disallow 只阻止抓取,不阻止索引。如果某个文件地址被外部链接指向,它仍可能以“仅有 URL、没有摘要”的形式出现在结果里。用 robots 挡目录时,要清楚这一点。
X-Robots-Tag
PDF、图片这类文件放不进 meta 标签,但服务端可以返回 X-Robots-Tag 响应头,值设为 noindex。这是对非 HTML 文件更直接的手段,前提是服务器能针对这些文件类型单独配置响应头。
入口与状态码
把附件的入口从直链改成 HTML 详情页,是一种结构性做法:直链不作为主要导航出现,发现路径自然变窄。文件确实下架时,返回 404 或 410 比返回一个空白页更清楚,返回 200 的空壳会让搜索引擎反复抓取。
排查顺序
- 用 site:你的域名 filetype:pdf 等方式抽样,先看被收录的到底是哪几类文件
- 索引报告里一般没有按文件类型分组,需要回到服务器日志,统计 .pdf、.jpg 等后缀的抓取频次和状态码
- 判断问题出在发现路径(内链、目录、sitemap)还是文件本身(有无价值、是否已删除)
- 再决定是保留、加 noindex 头,还是调整入口链接
- 改动后隔一段时间再抽样核对,不要改完当天就下结论
处理非 HTML 资源的目标不是把索引清空,而是让有价值的文件更容易被找到,让无检索价值的直链不再持续占用抓取与索引资源。
几个常见的误判
- 把图片被收录当成重复内容问题来处理,方向跑偏。
- 用了 robots.txt 就以为文件会从索引里消失,实际可能仍然可见。
- 只改了 sitemap,忘了页面上还有大量指向旧直链的内链。
- 素材站、图库站和普通企业站的情况不同,前者本来就需要图片被检索,不能照搬“全部挡住”的做法。
把这几类文件单独拉出来看一遍,你会发现多数问题不是文件太多,而是入口没有设计过:什么该被导流到详情页,什么该保持直链,什么该彻底关掉,提前定好规则,后面就省事得多。