搜索引擎索引的内容不只有 HTML 页面
做收录自查时,很多人的注意力只放在网页上:页面有没有被抓、有没有进索引。但搜索结果里出现的并不都是 HTML 页面,PDF、DOC、PPT、图片甚至视频文件都可能单独以一条结果的形式出现。它们各自有独立的 URL,也各自有独立的索引状态,所以只看主站页面的收录数量,会漏掉一部分实际情况。
哪些非 HTML 文件可能进入索引
- PDF:产品手册、说明书、白皮书、报告最常见。
- DOC、DOCX、PPT、XLS:公开的文档目录下经常被收录。
- 图片:图片搜索是相对独立的体系,页面被收录不等于图片被收录,反过来也一样。
- 视频:单靠文件本身通常不够,还需要可被读取的标题、描述等上下文。
这些资源只要有公开可访问的 URL 并被链接引用,就有机会被抓取。至于能不能进入索引,还要看内容能否被解析、有没有独立价值。
PDF 被收录的前提:文字能被提取
扫描件生成的图片型 PDF,本质是一张张图,文字层是空的,抓取端读不到正文,即便被抓到也很难进入正常索引。反过来,由排版软件导出的、带完整文字层的 PDF,通常可以被正常解析。判断方法很简单:在 PDF 里用 Ctrl+F 搜索一句正文,如果能选中并搜到,说明有文字层。
文件类型声明也常被忽略
服务器返回的 Content-Type 如果是 application/octet-stream 这类通用类型,抓取端可能无法确认文件究竟是什么,处理方式会更保守。用正确的 MIME 类型返回 PDF 和图片,是基础但容易漏掉的一步。
图片索引和页面索引是两回事
页面进了索引,图片未必进;图片能搜到,页面也未必被收录。图片是否被索引,通常和这些因素有关:图片 URL 是否稳定可访问、所在页面是否被抓取、周边文字和 alt 是否提供了足够上下文、图片有没有被其他页面引用。
把图片当作独立的 URL 来管理,比只盯着页面更容易理清问题:它有自己的地址,也可能有自己的索引状态和失效状态。
不想被收录的非 HTML 文件怎么处理
- 优先使用响应头 X-Robots-Tag: noindex,它对 PDF、图片这类非 HTML 文件同样有效。
- robots.txt 里的 Disallow 只阻止抓取,不保证已经收录的 URL 退出索引,两种手段不要混用。
- 把不打算公开的文档、原始图片放进需要登录才能访问的目录,从访问权限上隔离。
- 定期用站内搜索或图片搜索,检查有没有旧版本文档、内部资料被公开索引。
希望被收录的非 HTML 资源该做什么
- 确保文件本身可解析:PDF 有文字层,图片格式常见且没有过度压缩。
- 给文件一个可读的 URL 和标题,文件名不要是乱码或纯编号。
- 在相关 HTML 页面里用文字链接指向它,让它在站内结构里有一个明确位置。
- 决定是否放进 sitemap:如果把它当作正式内容对外提供,纳入统一管理会更清晰;如果只是下载附件,不必强求。
自查顺序
- 先确认这类资源有哪些公开 URL,整理成一份清单。
- 逐个测试能否直接访问、返回什么内容类型、PDF 能否选中文字。
- 用站内搜索和图片搜索确认哪些已经出现在结果里。
- 区分「想公开」和「不想公开」,前者补充上下文和内链,后者用响应头或权限处理。
- 把结论记录下来,下次改版时一并核对,避免旧文件长期留在索引里。