站点里除了 HTML 页面,还有一批容易被忽略的可抓取资源:产品手册 PDF、白皮书、图片原图、Excel 模板、压缩包、音视频文件。它们有可访问的 URL,也可能被站内链接指向,因此出现在搜索结果里并不奇怪。
这些文件为什么会被收录
搜索引擎并不只处理 HTML。只要 URL 返回 200、内容可以被解析(PDF 和多数图片格式都算),并且存在入口链接,它就可能被抓取并进入索引。常见的入口包括页面上的下载按钮、正文里的图片链接、附件列表页、站内搜索的直达链接,甚至是早年上传后忘记删除的测试文件。
很多站点是在查“收录为什么这么杂”时才发现,索引里躺着几十个 PDF 和图片。它们本身不是错误,问题在于你是否清楚它们的存在。
先按用途把文件分成三类
- 用户确实需要的:报价单、说明书、报名表。这类文件能带来有实际价值的搜索流量,通常值得保留收录。
- 页面辅助素材:正文配图、图标、样式用小图。它们对用户有用,但作为独立搜索结果的意义有限。
- 历史遗留物:旧版模板、测试文件、内部培训资料、重复导出的多个版本。这类文件往往既没人维护,也没人会搜。
分类之后再决定动作,比一刀切地“全部屏蔽”更稳妥。
图片和 PDF 的处理逻辑不太一样
图片被收录通常不算坏事,尤其是产品图、示意图,用户可能在图片搜索里找到你。要留意的只有两点:一是同一张图被反复上传成多个 URL,形成重复;二是图片体积过大,拉高抓取与加载成本。
PDF 则需要更谨慎,它可能同时带来三类问题:
- 文件内容与线上页面高度重复,搜索结果里两个版本同时出现;
- 早期版本的 PDF 仍在索引中,内容已经过时,容易误导用户;
- 文件体积大,抓取一次的成本远高于普通页面。
如果确实不想让它们出现在搜索结果里
- 单文件处理:对 PDF 可以返回 X-Robots-Tag: noindex 响应头,这是最直接的办法;HTML 里写 meta robots 对 PDF 无效。
- 成批处理:把附件统一放在固定目录下,例如 /files/、/download/,用 robots.txt 按目录屏蔽抓取。代价是屏蔽之后搜索引擎不会再读取文件内容,图片搜索带来的流量会一起消失。
- 从链接层面收敛:如果文件已经没人使用,更彻底的做法是删除文件、去掉相关链接,让它返回 404,而不是一边留着一边屏蔽。
- 规范版本:同一份资料有多个版本时,页面上只保留最新版链接,旧文件归档到一个说明页,避免用户和搜索引擎同时找到过期内容。
robots.txt 屏蔽的是抓取,不是已经收录的结果。已经进入索引的 URL,屏蔽之后仍可能出现在搜索结果里,只是摘要信息会逐渐失效。
几个容易踩的坑
- 用 robots.txt 屏蔽了整个 /uploads/ 目录,结果正文配图也被挡住,页面看起来“没有图片”。
- 给图片加了 noindex,同时删掉 alt 文本和周边说明文字,图片搜索里再也找不到它。
- 把 PDF 的 URL 写进 sitemap,却又用 robots.txt 屏蔽同一路径,两处信号互相矛盾。
- 附件下载需要登录,未登录访问返回 200 的错误页,形成软 404,反而更浪费抓取。
一个可执行的检查顺序
- 拉取一段时间的抓取日志或索引报告,筛出非 HTML 后缀的 URL。
- 按上面的三类给它们打标签,标出哪些有真实搜索需求。
- 对遗留文件先删链接、再删文件,最后确认返回状态码符合预期。
- 调整 sitemap 与 robots.txt,让两处信号保持一致。
- 过几周再复查一次,确认索引数量变化在预期范围内。
这类文件的数量通常不多,但它们对抓取预算的占用、对搜索结果杂讯的影响,往往比想象中明显。花一次时间梳理清楚,之后只要在上传新附件时顺手归好目录,基本就不会再失控。