做 site 查询时,除了正常的栏目页和文章页,有时会看到一些意料之外的地址:图片目录、上传的 PDF、接口返回的 JSON,甚至一个只有文件列表的目录页。这些非 HTML 资源同样可能进入索引,只是它们所处的索引位置和影响方式与网页不完全一样。搞清楚这一层,再决定哪些该留、哪些该处理,比一上来就屏蔽整个目录更稳妥。
先分清抓取和收录不是同一件事
搜索蜘蛛请求一个 URL,只代表它拿到了内容,不代表这个 URL 会进入索引。是否收录,还取决于资源类型、内容是否有独立价值、有没有被规则挡住。图片、PDF 这类资源被抓取的比例很高,但真正进入索引的,通常是那些能被独立搜索、并且有足够上下文说明它是什么的资源。
哪些非 HTML 资源会进入索引
- 图片:JPG、PNG、WebP 等,进入的是图片索引,出现在图片搜索结果里。
- 文档:PDF 及部分 Office 文档,进入网页索引,可以像普通页面一样被搜到。
- 音视频:单独的视频文件或播放页,处理方式介于两者之间。
- 接口与数据文件:JSON、XML、CSV 被直接访问时,也可能被当作内容处理。
- 目录列表:服务器未关闭索引时,会生成一个可被抓取的链接列表页。
图片收录:进的是图片索引,不占网页索引位
图片本身不会以网页的形式出现在搜索结果里,它进入的是图片搜索。常见的影响因素是文件名是否有意义、alt 文本是否描述准确、图片周围有没有相关文字。如果站点有大量图片流量,这部分值得保留;但由参数生成的缩略图、水印图、不同尺寸副本,容易造成同一张图出现大量重复版本,属于可以收敛的部分。
PDF 与附件:容易被忽略的索引入口
上传到 /uploads/ 或 /files/ 目录下的报价单、说明书、活动手册,只要链接被爬到,就可能被收录并出现在搜索结果中。这类内容的麻烦通常有两点:一是版本迭代后旧文件仍留在索引里,用户搜到的是过期版本;二是文件里可能包含当时无意公开的信息。定期检查这些目录,比事后补救容易得多。
需要清理时的处理顺序
- 先判断它是否真的有害:能带来图片或文档搜索流量的资源,未必要动。
- 能删除的直接删除,返回 404 或 410,让索引自然收缩。
- 不希望被抓取的整块目录,用 robots.txt 屏蔽,减少持续抓取。
- 对仍可访问但不想收录的单个文件,用 X-Robots-Tag 响应头加 noindex。
- 处理完后检查站内是否还有指向这些地址的链接,尤其是旧文章和下载页。
注意:robots.txt 屏蔽之后,搜索引擎无法再抓取该文件,也就读不到 noindex,已经收录的条目可能长期停留在索引里。如果目标是让某个文件离开索引,通常先允许抓取并返回 noindex,等它消失后再考虑屏蔽目录。
站点运营上的取舍
非 HTML 资源的收录不是单纯的技术问题,而是内容策略问题。图片和 PDF 可以带来搜索流量,也可能是重复内容的来源。一个比较稳的做法是:对外发布的文档统一放在固定目录,命名带版本和日期;缩略图、裁剪图这类派生资源统一放在一个不对外的目录,并在模板层面控制它不被内链引用。
自查清单
- 用 site 查询配合图片搜索,看看有哪些资源已经在索引里。
- 检查上传目录是否开启了目录列表。
- 确认关键 PDF 的版本是否唯一,旧版本是否已下线。
- 检查 robots.txt 与 noindex 的配合是否符合预期。
- 记录一次处理前后的索引变化,作为下次改动的参考。
这类资源平时不显眼,但数量一旦上来,会明显影响索引的整体质量和更新节奏。定期看一眼,比出了问题再回头找要省事。