网站收录

图片、PDF 与视频文件被收录:非 HTML 资源的索引该怎么管

图片、PDF、视频这些非 HTML 资源同样可能进入索引,但 meta robots 对它们无效。本文按类型梳理哪些资源值得保留、哪些需要收口,并说明 X-Robots-Tag、robots.txt 与站点地图各自能做什么。

网站收录

图片、PDF 与视频文件被收录:非 HTML 资源的索引该怎么管

资源类 URL 为什么也会进索引

提到“收录”,多数人想到的是 HTML 页面。但搜索结果里早就不只有网页:图片会出现在图片搜索中,PDF 报告、产品说明书、白皮书可以像普通文档一样被检索,视频文件也可能以独立入口出现。这些资源的索引逻辑和页面并不完全一样,直接套用管理页面的那套方法,常常会失效。

先分类型,再决定留还是收

不是所有资源都值得出现在索引里。可以按“有没有人搜、内容是否还准确”两条来判断:

  • 值得留:原创图片、有长期参考价值的 PDF、公开的产品手册、教学类视频。
  • 需要收:纯装饰性图片、缩略图、切片图、临时导出的表格、已过期的版本文件、内部使用的演示稿。
  • 先别急着动:被其他页面引用的图片,收掉可能连带影响页面呈现,先看清引用关系再决定。

控制手段和 HTML 页面不一样

这是最容易踩坑的地方:

  • meta robots 只能写在 HTML 的 head 里,对 PDF、图片、视频文件本身无效。想给一个 PDF 加 meta noindex,技术上做不到。
  • X-Robots-Tag 写在 HTTP 响应头里,对非 HTML 资源同样生效,是控制单类资源更合适的方式。
  • robots.txt 按路径和资源类型起作用,屏蔽一个目录会把目录下所有图片一起挡掉,动手前先确认影响范围。
  • canonical 在非 HTML 资源上的支持有限,别指望用它合并多个 PDF 版本。更稳妥的做法是把旧文件重定向到新文件,或直接返回 410。

排查顺序:从日志到收口

  1. 在抓取日志里按扩展名统计,看看蜘蛛对图片、PDF 的抓取占比,判断是否存在大量无意义抓取。
  2. 在索引报告里区分“文件本体”和“承载页面”。图片出现在图片搜索里,和它所在的文章页被收录,是两件事。
  3. 确定要保留的资源,检查是否可被抓取、响应是否稳定,必要时用站点地图的图片、视频扩展补充信息。
  4. 确定要收口的资源,优先用响应头或 robots 规则处理,不要粗暴地整站屏蔽资源目录。
  5. 收口之后观察一段时间,索引退出通常不是立刻完成的,别在同一周内反复改策略。

几个常见误区

  • 用 robots.txt 全站屏蔽图片目录,结果文章页在图片搜索里的入口也一起没了。
  • 把过期 PDF 直接删掉返回 404,其实改成 410 或重定向到新版更清晰。
  • 站点地图只提交 HTML 页面,图片和视频信息全靠蜘蛛自己猜。
  • 看到 PDF 被收录就紧张,忽略了它本身可能对应真实的搜索需求。
资源被索引本身不是问题。真正需要判断的是:这个文件有没有搜索需求,内容是否还准确,以及它和站内页面之间的关系是否清楚。

一句话总结

非 HTML 资源的收录管理,核心是把“类型”和“控制手段”对上:能对文件生效的只有响应头和 robots 规则,页面级的标签管不到它们。先把资源分堆,再选择保留还是收口,比统一屏蔽要稳妥得多。