多數人谈收錄时只盯着 HTML 頁面,但索引里同样存着大量非 HTML 资源:图片、PDF、Office 文档、视频。這些资源的收錄逻辑和網頁不完全一样,出問题时排查方向也不同。
图片收錄:卡点通常在“被發現”這一步
图片不是凭空被抓取的對象,它需要一個入口。最常见的入口是在 HTML 里出現标准的 img 标簽,或者被 a 标簽直接連結。如果图片地址是頁面加载後由 JavaScript 拼出来的,而爬虫没有执行到那一步,图片就可能長期不被發現。
常见卡点可以按顺序查:
- 图片所在頁面本身没被抓取或没進索引,图片也很难被單獨發現;
- 懒加载把真實地址放在自定义属性里,src 長期為空;
- 图片路径被 robots.txt 屏蔽,或返回 403、404;
- 地址是 data URI、base64 内嵌,或每次請求都變化的临时連結;
- 图片尺寸過小、與正文無關,即使被抓取也难進入图片索引。
alt 文本不直接决定收錄,但它能帮助理解图片内容,也给图片一個更稳定的语义描述,值得認真寫。
PDF 與文档:能讀到的文本才可能被索引
PDF 里的文字對搜尋引擎是可讀的,前提是文件里真有文本层。掃描件、图片拼成的 PDF 就接近一個空頁面,占着 URL 却没有可用内容。
另外几点容易被忽略:文件体积過大时,抓取可能只取到一部分;同一 URL 上的文档被替換後,索引更新往往比網頁慢;文件名和目錄尽量保持可讀性,不要用一串哈希值。如果文档内容重要,更稳妥的做法是让 HTML 頁面承载核心内容,PDF 只作為下载附件,而不是唯一载体。
视频收錄:靠承载頁面,而不是靠文件本身
视频文件一般不會被單獨索引成一個可点击的结果。用戶看到的视频结果,多来自承载视频的頁面,並配合结构化資料描述时長、缩略图、發布日期等信息。如果视频托管在第三方平台,收錄归属通常算在平台侧,你的站点只获得一個外鏈入口。
排查非 HTML 收錄問题的顺序
- 確認资源是否在 HTML 里以标准标簽暴露,地址是否稳定;
- 確認 robots.txt、meta 指令、登入墙没有誤挡资源路径;
- 確認资源返回 200,Content-Type 正确,没有被 CDN 改寫成错誤類型;
- 在訪問日誌里找该资源 URL 的抓取记錄,区分“没来抓”和“抓了没收”;
- 回到承载頁面,看頁面本身是否已被收錄。
一個常见誤解
把图片、文档列進站点地图,並不等于它們會被收錄。站点地图只是提供一條發現线索,最终能否進入索引,仍取决于资源能否被正常抓取和解析。
结论很简單:非 HTML 资源的收錄,先保證“能被發現、能被讀到”,再谈其他。资源本身质量再高,如果地址是動態生成的、放在屏蔽目錄下,或者只是一個没有文本层的掃描件,索引里就始终不會有它的位置。