提到收录,多数人默认说的是 HTML 页面。但搜索引擎的索引里还装着大量其他格式:产品手册 PDF、图片、视频,甚至表格文档。它们可能作为独立结果出现,也可能作为页面内容的一部分被引用。运营中经常遇到的情况是:真正想被收录的页面没动静,反而是一些 PDF 先被收了进去。
哪些非 HTML 资源可能进索引
- PDF、Word、PPT 等文档:能被解析出文字的,有机会单独成为结果条目。
- 图片:主要进入图片搜索,也可能出现在网页结果中。
- 视频:需要有可抓取的承载页面,并配合结构化数据或站点地图。
它们是怎么被发现的
发现路径和页面基本一致,只是少了内链这个最稳的入口。
- 被 HTML 页面链接,比如产品页里的说明书下载入口。
- 被写进站点地图,单独列出非 HTML 资源的 URL。
- robots.txt 没有屏蔽,服务器允许抓取工具读取。
- 被其他站点转载或引用,形成外部入口。
如果一份 PDF 只是躺在服务器目录里,没有任何页面链接、也不在任何站点地图里,被抓到的概率就很低。它和零内链页面面临的是同一个问题。
会被索引的前提条件
格式本身不是障碍,可读性才是。抓取到的文档需要有可提取的正文,纯扫描件的图片型 PDF 往往只能按图片处理。文件也不能过大,否则抓取工具可能中途放弃。此外,同一份文档如果有多个 URL 版本,比如带参数、带版本号、重复上传,索引同样会被拆散。
判断一份文档值不值得进索引,有个简单标准:把它单独放进搜索结果里,用户点进去能否直接得到答案。如果它只是表单附件或内部流程文件,通常不需要占用索引位置。
用响应头控制收录
HTML 页面可以用 meta robots 声明,非 HTML 资源没有 head 区域,只能依赖 HTTP 响应头。给 PDF 返回 X-Robots-Tag: noindex,可以让它继续留在被链接的页面里供人下载,但不进入索引。内部资料、试用版白皮书常用这个做法。
robots.txt 管的是能不能抓,X-Robots-Tag 和 noindex 管的是能不能进索引。两者不是一回事,混用容易出现「屏蔽了但结果里还看得到」的困惑。
自查清单
- 文档 URL 是否稳定,有没有重复上传造成的多个版本。
- 重要的 PDF 是否有 HTML 落地页承接访问,避免用户直接落到文件上。
- 不该公开的文档,是否同时做了抓取屏蔽与 noindex。
- 图片是否有描述性的 alt 文本和可读的文件名,而不是 img001。
- 视频是否有可抓取的播放页,而不是只靠脚本动态加载播放器。
一个常见误区
有人发现不该被收录的 PDF 就直接删掉,结果原链接变成 404,外部引用也失去着落。更稳妥的顺序是先加 noindex,等它从索引中淡出,再决定是否下线。索引更新需要时间,这一点和普通页面没有区别。
最后提醒一句:资源被索引只是第一步,能不能带来访问,取决于它有没有解决一个具体问题。文档本身不解决问题,收录得再多也没有意义。