很多人把收录管理等同于“页面到底进没进索引”,但搜索索引里不只有 HTML 网页。图片、PDF、视频、Office 文档都可能被单独抓取、单独索引,有些还会直接出现在搜索结果里。这些资源如果一直放在管理视野之外,常见的结果是两头都不对:该被收录的被挡在门外,不该大量进索引的反而悄悄收了一堆。
非 HTML 资源为什么会单独进索引
关键在于资源本身有独立 URL。搜索引擎的抓取端在请求一个地址时,会先看返回的内容类型,再分流到不同的索引通道:图片进图片索引,视频进视频索引,PDF 和部分文档则经常被当作普通网页处理。也就是说,一条 URL 能不能进索引,和它是网页还是文件关系不大,和它是否可访问、是否有入口、是否值得保留关系更大。
三类资源,收录逻辑并不一样
图片
图片一般进入图片索引,很少单独出现在普通网页结果里,但它是页面的一部分。图片被抓取的入口主要是页面里的 img 标签、srcset 以及图片站点地图;用 CSS 背景图的方式加载,被抓到的概率明显更低。
- alt、caption、周边文字会影响这张图被理解成什么。
- 图片 URL 频繁变动,等于每次都要重新被发现一次。
- 把图片目录整段屏蔽,图片进不了索引,页面本身也可能少了一块内容。
PDF 和其他文档
PDF 常被当成普通网页对待,可以有标题、有摘要,直接出现在搜索结果里。这意味着服务器上忘了删的旧版文档,用户一样可能搜到。同一份材料的 v1、v2、final 多个版本同时在线,还会让收录归属变得混乱,最好只保留当前版本,旧版做跳转或返回 410。
视频
视频能否被索引,更依赖承载页。视频文件本身往往不是抓取重点,页面上的标题、简介、时长、缩略图、结构化数据才是。视频文件和承载页放在同一个域名下、有稳定的播放页入口,通常比把文件丢在第三方存储上更容易被关联起来。
资源收录异常时,按这个顺序查
- 资源 URL 能否直接打开。换一个未登录的环境访问,确认不是 403、404,也没有被防盗链规则挡住。
- robots.txt 是否把资源路径一起挡了。不少站点只盯着页面,写规则时顺手把 /uploads、/files 屏蔽,资源自然进不去。
- 承载页本身是否被索引。资源通常靠页面被发现,页面都进不去,资源很难被单独抓取。
- 服务器对资源请求的响应速度。大图、大文件响应慢,抓取端会降低请求频率,发现速度跟着变慢。
- 看日志里资源请求的占比。如果日志里几乎只有 HTML 请求,说明抓取方对这些资源兴趣不大,与其反复提交,不如先把入口补上。
补入口比反复提交更实在
资源被发现的路径其实和页面差不多:站内链接、站点地图、外链引用。图片可以靠正文引用和图片站点地图,文档可以放在相关内容页里给出明确链接,视频则在专题页、列表页里给出稳定的播放入口。入口补够了,再谈收录节奏;入口没补,提交多少次都只是让 URL 被看到,不会让它被收进去。
几个容易想当然的地方
屏蔽图片抓取不等于保护图片,也不等于页面收录不受影响。搜索引擎判断页面质量时会参考可见内容,图片全丢的页面和用户看到的往往不是同一个东西。
- 资源进索引不代表一定带来流量,但它会占用索引名额,也会影响用户对站点版本的判断。
- 把资源当成附件随便命名,和把页面 URL 随手拼参数一样,后面很难归拢。
- 图片、文档的收录变化通常比页面慢,不用每天盯着数量波动。
把资源当作一条 URL 来管理,而不是当作某个页面的附属文件,收录这件事才不会被漏掉一半。