不少站长盯着 HTML 页面的收录情况,却忘了图片、PDF、Office 文档、压缩包这类非 HTML 地址。它们同样可以被搜索蜘蛛抓取,也可能出现在索引里。当这些地址被大量收录时,常见的影响是:抓取预算被占用、重复内容增多、搜索结果里出现不该单独展示的附件版本。
先确认哪些非 HTML 地址被收录
不要凭感觉判断。先用 site 查询和站长后台的索引报告,按文件类型过一遍:
- 图片目录:/images/、/uploads/、/assets/ 下的原图、缩略图、水印图。
- 文档目录:/pdf/、/docs/、/files/ 下的 PDF、Word、Excel、PPT。
- 附件与下载:/download/、/attachment/ 下的压缩包、安装包、素材包。
- 动态生成的资源:带参数裁剪的图片、在线预览地址、临时导出的文件。
把被收录的地址和站内实际使用的地址对一遍,区分“正常资源”和“本不该有独立搜索入口的附件”。这一步决定后面是保留、归并还是屏蔽。
再判断这个资源该不该有独立索引
不是所有非 HTML 文件都要屏蔽。如果 PDF 是核心内容,例如白皮书、标准文档,它本身可以是一个落地页,保留收录没问题。需要收口的是那些只是页面附属品、却有独立 URL 的版本,例如文章配图、商品缩略图、简历附件、软件下载包。
判断标准很简单:这个地址单独出现在搜索结果里,对用户有没有价值?如果没有,就更适合归并到主页面,而不是让它单独留在索引里。
收口时的核对顺序
- robots.txt 是否放行。先看有没有误放行资源目录。如果整个目录不该被索引,可以用 Disallow 阻断抓取,但注意:被屏蔽的地址仍可能因为外链出现在索引里,只是没有摘要。
- HTTP 头里的 X-Robots-Tag。对图片、PDF 这类非 HTML 文件,页面里的 meta robots 往往不生效,更适合在响应头加 X-Robots-Tag: noindex。确认服务器返回的头部是否真的带上了这个标记。
- canonical 与主页面归属。如果附件必须保留可访问,可以在 HTTP 头里指向对应的 HTML 主页面,帮助搜索引擎理解归属。不要指向另一个附件,否则等于没指。
- 站内链接入口。检查正文、下载按钮、图片点击后的跳转链接,是否直接把附件 URL 暴露出去了。能通过主页面承载的,尽量不用裸附件地址做入口。
- sitemap 与提交工具。检查 sitemap 里是否混入了图片、PDF、附件地址。如果这些地址不需要收录,就不要主动提交,减少被抓取的概率。
- 确认生效范围。改动后按目录抽几个 URL 用抓取工具查看响应头,确认 noindex、canonical 或 robots 规则没有写错层级或写反。
常见误区
- 以为 robots.txt 屏蔽等于删除收录。屏蔽抓取后,旧索引可能还在,需要配合 noindex 或返回 404/410 才能推动移除。
- 在 HTML 页面写 meta noindex,却指望它作用于同目录的 PDF。meta 标签只对所在 HTML 页面生效。
- 把附件 URL 写进 sitemap,又希望它不被收录,信号互相矛盾。
- 图片被收录后直接删文件,导致大量 404。先确认哪些图片仍被引用,再决定是保留、替换还是返回 410。
收口之后看什么
改动后不要每天查收录量。先观察抓取日志里这些非 HTML 地址的访问频率是否下降,再隔一段时间看索引报告里对应类型的数量变化。如果发现新的附件目录或动态资源地址仍在被大量发现,回到第一步重新确认入口来源。非 HTML 资源的收录问题,通常不是单个文件的事,而是入口、响应头和提交信号没有统一。