做站点运营时,大家盯的多半是 HTML 页面,但搜索索引里还存着另一类东西:图片、PDF、视频、Office 文档等非 HTML 资源。它们的收录逻辑和网页不太一样,很少能靠内链直接读进去,更多依赖被页面引用、被 sitemap 声明,以及文件本身能不能被解析。
先分清:资源被“发现”和资源被“收录”是两件事
资源文件通常没有正文外链,蜘蛛一般是从引用它的页面上发现这个 URL。被发现之后,搜索引擎还要判断它值不值得单独留一条索引记录。一张装饰性图标、一份内部流转用的表格,即便被爬到,也大概率不会被单独收录,这是正常现象,不必当成问题去修。
图片收录:看的是上下文,不只是文件本身
图片自己没有文字,搜索引擎要理解它,主要靠三处信息:
- 引用页的上下文:图片周围的标题、段落、图注,决定了这张图大致在讲什么;
- alt 属性:它的作用是图片内容缺失时的替代描述,不是关键词堆砌的地方;
- 文件自身的可访问性:URL 可抓取、返回 200、robots.txt 没有屏蔽图片目录、CDN 没有额外加限制。
如果图片目录被 robots.txt 整体屏蔽,或者懒加载写得让真实地址始终不出现,图片就很难进入索引。图片 sitemap 能帮忙发现,但它解决的是“找到”,不是“收录”。
PDF 与文档:能解析出文字才有机会
- 带文本层的 PDF 通常能被解析,索引里可能以文档形式出现;
- 纯扫描件没有文字层,搜索引擎读到的内容接近空白;
- 文件体积过大、下载慢,会影响抓取效率和后续判断。
如果一份文档是对外的重要内容,用 HTML 页面承载正文、把 PDF 作为下载附件,通常更稳。HTML 版本可以被内链、被写标题、被正常参与收录判断,PDF 只作为补充版本存在。
视频:多数情况下需要一个承载页面
视频文件本身很难独立成为一条有效索引记录。更常见的做法是给视频配一个播放页,页面上有标题、简介、文字说明,必要时补充视频结构化数据,把时长、缩略图、上传时间等信息交代清楚。
几个容易被忽略的卡点
- 资源目录被 robots.txt 屏蔽,页面上引用还在,索引里却一直空着;
- CDN 或对象存储返回了 noindex、403,蜘蛛拿不到文件;
- 资源 URL 带临时签名参数,每次访问都变,等于换了一个地址;
- 资源 URL 含中文、空格或特殊字符但没做编码,抓取端可能取不到。
什么时候该给资源补一个 HTML 版本
判断标准很简单:这个东西是不是你希望用户通过搜索找到的内容。如果是,就给它一个能被正常抓取、有标题有正文的 HTML 页面;如果只是页面里的辅助元素,就让它待在引用页的上下文里,不必强求单独收录。
资源收录不是越多越好。把重要内容用 HTML 承载,把辅助资源交给页面上下文,通常比批量提交资源文件更省事。