网站收录

图片、PDF 和附件也被单独收录:非 HTML 资源的索引入口核对顺序

索引量比实际内容页多出一截,很多时候多出来的是图片、PDF、附件这类非 HTML 资源。本文梳理一套核对顺序:先按类型盘点,再判断资源有没有独立价值,然后选对屏蔽方式,最后从站点地图和上传模板收口,避免清理完又批量生成。

网站收录

图片、PDF 和附件也被单独收录:非 HTML 资源的索引入口核对顺序

做收录盘点时,经常会遇到一种情况:内容页数量没怎么变,索引量却比预期高出一截。把索引里的 URL 按扩展名或路径特征筛一遍,往往发现多出来的部分是图片、PDF、附件下载、音视频文件这类非 HTML 资源。它们能被抓取,也能被单独建立索引条目,只是站点通常没打算让它们以这个身份出现在搜索结果里。

为什么非 HTML 资源会独立进索引

只要一个 URL 能被爬虫正常请求、返回正常状态码、又没有指令明确拒绝,它就有机会被单独处理。图片、PDF、Office 文档、音视频文件都符合这个条件。站点平时把注意力放在内容页上,而这些文件往往是编辑器、附件模块、导出功能自动产生的,既没有导航入口,也没有任何索引信号,于是就成了没人管但确实存在的一批 URL。

要不要处理,关键看这个资源本身有没有独立价值。产品说明书 PDF 可能真的有人直接搜;页面缩略图、临时导出的表格、后台上传的中间文件通常没有。有价值的不必强行清理,没有价值的才需要收口。

核对顺序:从盘点走到处置

  1. 先按类型统计,不要凭感觉:把索引报告或抓取日志里的 URL 按扩展名(.pdf、.jpg、.docx)和路径特征(/uploads/、/tmp/、/export/)分桶,看清多出来的量级和来源,再决定要不要动手。
  2. 区分内容本体和内容附件:同一篇文章的配图,和一份独立对外的文档,处理方式完全不同。前者一般不需要独立索引,后者可能值得保留,甚至应该把文档属性里的标题一类信息写清楚。
  3. 确认有没有真正的内链入口:如果一个附件只是被站点地图或某个列表模板批量带出,没有任何人工维护的链接指向它,价值通常很低。反过来,被正文反复引用的附件,清理前要谨慎。
  4. 选对屏蔽方式:只想阻止后续抓取,用 robots.txt 就够;如果资源已经被收录,robots.txt 无法让它从索引里消失,反而会让爬虫看不到页面上的 noindex。这种场景更适合用 X-Robots-Tag 响应头,对 PDF 等非 HTML 文件同样有效;确认不再需要的,也可以直接返回 404 或 410。
  5. 顺手检查站点地图和批量模板:很多附件被收录,根源是 sitemap 生成逻辑把上传目录一并包含,或者列表页把所有附件都渲染成链接。不从源头收口,今天清理完,明天又会生成一批。
  6. 留出观察窗口,分批验证:先在一类资源上做改动,过一段时间再看索引报告里这类 URL 的数量变化,确认有效再推广到其他类型,避免一次性大面积改动后无法判断到底是哪一步起了作用。

容易踩的几个坑

  • 用 robots.txt 屏蔽已经收录的资源,以为能顺带清掉索引,结果索引条目还在,后续排查也看不到真实状态。
  • 把有价值的文档和垃圾附件一刀切,损失了本来能带来的访问。
  • 只处理了 URL 本身,没处理生成这些 URL 的模板和上传流程,问题反复出现。
  • 忽略了文件命名和替代文本,即使保持收录,也没有可用的信息支撑展示。
非 HTML 资源的处理原则和普通页面一致:先判断它有没有独立价值,再决定保留、规范化还是移除。屏蔽抓取和移除索引是两件事,不要混着做。

处理之后需要关注什么

观察的指标不必复杂:这类 URL 在索引报告中的数量趋势、抓取日志里对应目录的请求占比,以及核心内容页的抓取频次有没有变化。抓取预算是有限的,把没有价值的资源从抓取队列里挪开,通常能让真正重要的页面获得更多访问机会。但这是一个逐步显现的过程,不要期待改动后立刻出现明显波动,也不要因为短期没有变化就频繁反复调整策略。