核对收录时,很多人只盯着 HTML 页面,但图片、PDF、表格附件、压缩包这类文件同样是独立 URL,同样可能被抓取、被索引,甚至出现在搜索结果里。等到发现索引里多出一批这类地址再来处理,返工成本会高不少。
这些文件为什么会进索引
搜索引擎看待 URL 并不区分后缀。只要一个地址可以被公开访问,又通过内链、目录列表、Sitemap、外链或页面资源引用等路径被发现,它就有机会进入抓取队列并最终被索引。常见的来源有几类:
- 页面上直接链接的 PDF 手册、报价表、报名表;
- 上传后没有做访问控制的图片目录和附件目录;
- 站点地图或采集工具自动带上的媒体文件地址;
- 被外部站点转载、引用时留下的资源直链。
先判断:该不该留在索引里
不是所有非 HTML 文件都要清理。判断标准不是“能不能被收录”,而是用户通过搜索找到它时,拿到的是不是一个完整、可用的结果。
通常值得保留的:
- 产品规格书、公开白皮书等本身就有独立检索需求的资料;
- 能带来图片搜索流量的主图、示意图;
- 已经做过整理、只保留一个规范版本的附件。
通常建议收拢或清理的:
- 仅作页面装饰的内部用图、图标切图;
- 同一份资料存在 v1、v2、最终版、最终版2 等多个可访问版本;
- 后台导出、临时上传、测试用的表格与压缩包;
- 还有对应 HTML 页面在正常服务、内容高度重复的附件。
附件类资源最常见的问题不是“被抓到”,而是同一份内容有多个版本同时可访问。先合并入口、留下唯一版本,再谈要不要屏蔽。
核对顺序
- 抽样确认索引状态。从服务器日志或上传目录里挑一批文件地址,逐个查是否已在索引中,而不是凭感觉判断。
- 确认发现路径。如果这些地址只出现在上传目录里,说明是目录被遍历或直链传播;如果出现在正文、Sitemap 里,就要先改源头。
- 看有没有对应的 HTML 页面。如果同一份内容已有正常页面,附件属于“另一个版本”,优先让页面成为主入口。
- 决定动作。要保留的,补上规范的链接入口和文件名、说明文字;要移除的,先取消公开可访问,再考虑索引层面的信号。
- 复核。处理完成后隔一段时间再抽查同一批地址,确认索引状态确实变化,而不是只看一次。
屏蔽方式别选错
用 robots.txt 的 Disallow 禁止抓取,会让搜索引擎读不到页面上的 noindex 指令,地址可能长期留在索引里,只是摘要无法更新。想从索引中移除,优先使用 noindex 类信号:PDF 可以在 HTTP 响应头里加 X-Robots-Tag,图片同理;同时把文件从公开目录移走,或改为需要登录才能访问。
如果两者已经同时用上,先撤掉 Disallow、恢复抓取,等 noindex 生效后再考虑是否重新屏蔽。
核对节奏
这类资源不需要天天查,按季度抽样一次即可,重点关注新上传目录和活动专题页带出的附件。核对时把“被发现”和“已收录”分开记录,才能判断问题出在链接入口还是索引环节。