做收录排查时,很多人默认“页面”就是 HTML。实际情况是,PDF、图片、视频,甚至部分 Office 文档,都可能单独出现在搜索结果里。它们有独立的 URL,遵循自己的抓取和索引规则,出问题时的表现也和普通网页不太一样。
非 HTML 资源为什么会被收录
只要资源有一个可访问的 URL,并且返回正常状态码,爬虫就可能抓取它。搜索引擎会判断这个文件能不能提取出文本、有没有作为独立结果的搜索价值,再决定是否放进索引。所以“被收录”的前提不是文件类型,而是内容是否可读、是否值得作为答案来源。
三类资源的处理重点不一样
PDF 与文档文件
- 能被索引的是可提取文字的 PDF;扫描件本质是图片,需要 OCR 才能被理解,效果并不稳定。
- PDF 的标题来自文件属性里的 Title 和正文首个标题,不少导出工具会直接填成文件名,值得手动检查一遍。
- PDF 更新比较麻烦:同一个 URL 替换文件内容后,索引可能需要重新抓取才会更新,重大改版建议换新地址。
- 如果 PDF 只是某个 HTML 页面的下载附件,最好让 HTML 页面承担收录任务,PDF 作为补充。
图片
- 图片可以在图片搜索里独立出现,抓取的是图片文件本身,展示时依赖页面上下文。
- 有意义的文件名、alt 文本、图片周围的说明文字,都会影响它被理解的程度。
- CDN 域名、防盗链、按需裁剪生成的动态图片地址,都可能影响抓取,建议确认这些地址是否允许访问。
- 图片被抓到,不等于已经在图片搜索里有位置,中间还有筛选环节。
视频
- 视频通常需要“视频页面 + 结构化数据”配合,爬虫才能知道时长、缩略图、上传时间等信息。
- 视频文件本身一般不适合作为唯一入口,页面才是承载流量和说明的地方。
- 嵌入第三方平台时,能被索引的往往是平台侧的播放页,自己的页面要把内容说明写清楚。
想收录:让资源有上下文,而不是孤立文件
常见的失误是:文件上传后直接得到一条裸链接,站内没有任何页面引用它。这类 URL 往往只能靠外链或 sitemap 被发现,抓取频率低,更新后也难以及时反映。更稳妥的做法是:
- 用 HTML 页面承载说明、目录和下载入口,文件作为页面的一部分被链接。
- 链接文字写清楚文件是什么,不要用“点击下载”这类没有信息的文字。
- 把重要的 PDF、视频页面放进 sitemap,URL 尽量简洁,不带一长串跟踪参数。
- 同一份文件只保留一个正式地址,避免多个副本各自积累信号。
不想收录:控制方式要选对
- HTTP 响应头是控制非 HTML 文件的主要手段,PDF、图片、视频都可以通过头信息传递“不要索引”的指令。
- HTML 里的 meta 标签对 PDF 基本不起作用,不要指望在文件里加一行代码就生效。
- robots.txt 只影响抓取,不负责把已经收录的资源移出索引,两者目的不同。
- 需要彻底移除时,先确认返回状态码是否正常,再考虑用移除工具或调整访问权限。
判断标准可以简单一些:这个文件是否值得用户单独点开,并且能独立回答某个问题。值得,就给它一个规范的 URL 和必要的页面上下文;不值得,就让它作为页面的附属内容存在。
容易误判的几种情况
- 搜索结果里出现 PDF,不代表它一定在索引里,也可能是从某个页面提取的摘要。
- 图片显示在结果中,可能来自图片搜索,也可能来自网页的缩略图,排查方向并不相同。
- 日志里看到文件被抓取,只是抓取记录,不能当作收录证据。
非 HTML 资源的收录逻辑,本质和 HTML 页面一致:有可访问的 URL、有可理解的内容、有站内入口。区别在于可读性的判断更依赖文件本身的结构,而“不想收录”时的处理手段,更多依赖响应头而不是页面标签。按这个思路把站内的 PDF、图片和视频整理一遍,通常能减少一批“莫名出现在索引里”或“怎么都不收录”的问题。