资源类 URL 为什么也会进索引
提到“收录”,多数人想到的是 HTML 页面。但搜索结果里早就不只有网页:图片会出现在图片搜索中,PDF 报告、产品说明书、白皮书可以像普通文档一样被检索,视频文件也可能以独立入口出现。这些资源的索引逻辑和页面并不完全一样,直接套用管理页面的那套方法,常常会失效。
先分类型,再决定留还是收
不是所有资源都值得出现在索引里。可以按“有没有人搜、内容是否还准确”两条来判断:
- 值得留:原创图片、有长期参考价值的 PDF、公开的产品手册、教学类视频。
- 需要收:纯装饰性图片、缩略图、切片图、临时导出的表格、已过期的版本文件、内部使用的演示稿。
- 先别急着动:被其他页面引用的图片,收掉可能连带影响页面呈现,先看清引用关系再决定。
控制手段和 HTML 页面不一样
这是最容易踩坑的地方:
- meta robots 只能写在 HTML 的 head 里,对 PDF、图片、视频文件本身无效。想给一个 PDF 加 meta noindex,技术上做不到。
- X-Robots-Tag 写在 HTTP 响应头里,对非 HTML 资源同样生效,是控制单类资源更合适的方式。
- robots.txt 按路径和资源类型起作用,屏蔽一个目录会把目录下所有图片一起挡掉,动手前先确认影响范围。
- canonical 在非 HTML 资源上的支持有限,别指望用它合并多个 PDF 版本。更稳妥的做法是把旧文件重定向到新文件,或直接返回 410。
排查顺序:从日志到收口
- 在抓取日志里按扩展名统计,看看蜘蛛对图片、PDF 的抓取占比,判断是否存在大量无意义抓取。
- 在索引报告里区分“文件本体”和“承载页面”。图片出现在图片搜索里,和它所在的文章页被收录,是两件事。
- 确定要保留的资源,检查是否可被抓取、响应是否稳定,必要时用站点地图的图片、视频扩展补充信息。
- 确定要收口的资源,优先用响应头或 robots 规则处理,不要粗暴地整站屏蔽资源目录。
- 收口之后观察一段时间,索引退出通常不是立刻完成的,别在同一周内反复改策略。
几个常见误区
- 用 robots.txt 全站屏蔽图片目录,结果文章页在图片搜索里的入口也一起没了。
- 把过期 PDF 直接删掉返回 404,其实改成 410 或重定向到新版更清晰。
- 站点地图只提交 HTML 页面,图片和视频信息全靠蜘蛛自己猜。
- 看到 PDF 被收录就紧张,忽略了它本身可能对应真实的搜索需求。
资源被索引本身不是问题。真正需要判断的是:这个文件有没有搜索需求,内容是否还准确,以及它和站内页面之间的关系是否清楚。
一句话总结
非 HTML 资源的收录管理,核心是把“类型”和“控制手段”对上:能对文件生效的只有响应头和 robots 规则,页面级的标签管不到它们。先把资源分堆,再选择保留还是收口,比统一屏蔽要稳妥得多。