很多站点的收录讨论都围绕 HTML 页面展开,但图片、视频、PDF 这类资源在索引里是另一套逻辑。同一张图,可能出现三种状态:页面被收录、图片没进图片搜索;页面没被收录、图片却单独出现;两个都没有。在说“资源没收录”之前,先确认自己指的是哪一种,否则后面的排查会走错方向。
一、先确认资源本身能不能被抓到
这一步和普通页面一样,但更容易被忽略。
- robots.txt 是否屏蔽了图片目录或 /assets 之类的路径。有些模板把静态资源放在独立二级域名下,规则未必跟着主站走。
- 图片是否通过 CSS background 加载。背景图不在 img 标签里,抓取端通常不会当成图片资源处理。
- 是否用了懒加载,真实地址写在 data-src 里,而 src 是一个占位图。结果是占位图被当成资源,真图反而没有入口。
- 是否存在防盗链、鉴权或按 Referer 返回 403。抓取访问往往不带正常来源,容易被直接拒绝。
这几项用日志或抓取工具走一遍就能看清,先确认资源可达,再谈索引。
二、页面入口与图片站点地图
图片被发现主要有两条路:页面里的 img 标签,以及图片 sitemap。前者更实在,后者是补充。
- 图片要出现在已经被收录的页面上。页面本身没收录,图片基本没有机会。
- 图片离正文越近、和主题越相关,被发现和被理解的概率越高;纯装饰性的图标、边框图,即使被抓到,意义也有限。
- alt 把内容说清楚,比堆关键词更有用。
图片 sitemap 适合图库、商品图这类量大、需要单独暴露的资源。它不是提交了就一定有效果,但连这个入口都没有,等于少了一条发现路径。
三、别忽略“页面归属”这一层
看到图片出现在搜索结果里,并不代表站点收录状况就正常,还要回头看看它挂在哪个 URL 上。
- 同一张图在列表页、详情页、推荐位重复出现,容易出现多个页面共用同一资源的情况。这时判断“是哪个页面带来的收录”意义不大,重点是让真正需要被收录的那个页面有独立入口。
- 如果图片只出现在弹窗、轮播第二屏,或需要点击才展开的模块里,抓取端往往看不到,等于没有入口。
四、一条可执行的核对顺序
- 先确定目标是页面收录,还是资源收录。
- 检查 robots、鉴权、防盗链,确认资源能正常返回。
- 检查加载方式:img、懒加载还是 CSS 背景。
- 检查所在页面是否已被收录、是否有内链指向。
- 检查 alt、文件名与周边文字是否说明内容。
- 最后再考虑图片 sitemap 这类补充入口。
顺序乱了的典型表现是:一上来就改 sitemap 或补 alt,但资源其实因为鉴权一直拿不到,改多少遍都不会有变化。
五、视频与 PDF 的差别
视频的索引依赖播放页和视频相关标记,文件本身通常不作为独立页面被收录;PDF 则会被当成独立文档处理,还容易出现同一份文件对应多个地址的情况。这两类在核对入口之前,先想清楚希望用户最终落到哪个页面上,处理方式会更明确。
整体原则可以用一句话概括:入口可达、页面可收录、内容说得清。三条都满足之后再谈索引与展现;缺哪一条就先补哪一条,不要同时改。