资源类内容也有自己的索引
大多数讨论收录的文章都在讲 HTML 页面,但站点里还有相当一部分内容是图片、PDF、文档、视频封面这类资源文件。它们同样可以被抓取和索引,只是走的是不同的索引类型,核对方式也和普通网页不太一样。如果图片或 PDF 在搜索结果里长期不出现,先别急着归因于算法,多数情况是资源本身没有被当成一份可索引的文档来处理。
先分清你要的是哪一种索引
- 网页索引:承载资源的那个页面,判定对象是页面本身。
- 图片索引:图片自身的 URL,加上它所在页面提供的上下文。
- 文件索引:PDF、表格、演示文稿等可直接访问的文档。
这三种索引的入口不同,判定标准也不同。图片能不能进图片索引,与它所在页面能不能进网页索引是两件事:页面被排除,图片有时仍会出现在图片结果里;反过来,页面收录正常,图片也完全可能不进图片索引。排查前先明确目标,否则很容易拿页面的结论去解释图片的问题。
可抓取性:资源文件的第一道门
资源要能被单独访问,才谈得上被单独索引。先核对三件事:
- robots.txt 是否屏蔽了资源目录或对应文件后缀。
- 资源 URL 是否返回 200,且 Content-Type 与文件类型一致,例如 image/jpeg、application/pdf。
- 是否被登录、鉴权、防盗链或 CDN 规则拦住。
第三点最容易被忽略。图片通过脚本或服务器规则校验来源,正常浏览器能看到,抓取工具却拿到 403,收录自然无从谈起。CDN 的热链保护、按 Referer 放行的规则,都可能造成这种差异。
上下文:让资源被理解,而不只是被抓到
图片本身没有可读文本,搜索系统主要依靠周边信息判断它是什么:
- alt 文本是否描述了图片内容,而不是堆砌关键词。
- 图片文件名是否可读,产品页-正面.jpg 通常比 IMG_2031.jpg 更好判断。
- 图片附近是否有标题、图注或正文说明。
- 是否使用懒加载,但初始 HTML 里没有真实地址,只留占位图。
PDF 相对好办,因为它自带文字层。但要留意两种常见问题:扫描件没有文字层,机器读到的是一张图;正文里的链接指向一个中间跳转页,而跳转页本身对抓取工具不可用。这两种情况都会让文档"存在但读不出内容"。
站点地图与入口
图片和 PDF 很难靠内链被发现,尤其是文件类资源。把它们写进 XML 站点地图是成本最低的做法:图片可以用 image 扩展标注,PDF 可以像普通 URL 一样列出来。同时确认这些资源至少有一个可点击的页面入口,而不是只存在于下载脚本或接口里。没有入口、也没有站点地图的资源,等于只靠运气被发现。
核对顺序
- 直接打开资源 URL,确认返回 200 与正确的 Content-Type,且没有被登录、防盗链拦截。
- 检查 robots.txt,确认资源目录和承载页面都没有被屏蔽。
- 检查承载页面本身是否可索引,是否被 noindex,或 canonical 指向别处。
- 检查图片 alt、文件名与周边文本,PDF 确认存在可复制的文字层。
- 提交站点地图,观察抓取日志里对该目录的请求是否出现,以及返回的状态码。
几个常见误区
- 图片收录少就是被惩罚:多数是资源可抓取性不足或上下文缺失。
- PDF 上传了就会被收录:扫描件、跳转链接、目录屏蔽都会挡住。
- 页面收录了图片就一定会进图片索引:两者判定相对独立。
- 提交站点地图就能加快收录:提交只是告知存在,不改变可抓取性与内容质量。
资源类内容的收录问题,大多出在"能不能被抓到"和"抓到了能不能被读懂"这两步,剩下的小部分才涉及质量与索引取舍。先把这两步核对完,再考虑做别的优化。