網站收錄

图片與视频资源没進索引:入口、可抓取性與頁面归属的核對顺序

图片、视频這類资源在索引里的表現和 HTML 頁面並不一致。本文把资源收錄拆成三层:资源本身能不能被抓到(robots、鉴權、懒加载、CSS 背景图),有没有頁面入口和图片站点地图,以及资源挂在哪個已收錄頁面上。最後给出一條按顺序执行的核對清單,避免一上来就改 sitemap 或 alt 却看不到變化。

網站收錄

图片與视频资源没進索引:入口、可抓取性與頁面归属的核對顺序

很多站点的收錄讨论都围绕 HTML 頁面展開,但图片、视频、PDF 這類资源在索引里是另一套逻辑。同一張图,可能出現三種狀態:頁面被收錄、图片没進图片搜尋;頁面没被收錄、图片却單獨出現;两個都没有。在说“资源没收錄”之前,先確認自己指的是哪一種,否則後面的排查會走错方向。

一、先確認资源本身能不能被抓到

這一步和普通頁面一样,但更容易被忽略。

  • robots.txt 是否屏蔽了图片目錄或 /assets 之類的路径。有些模板把静態资源放在獨立二級域名下,規則未必跟着主站走。
  • 图片是否通過 CSS background 加载。背景图不在 img 标簽里,抓取端通常不會当成图片资源處理。
  • 是否用了懒加载,真實地址寫在 data-src 里,而 src 是一個占位图。结果是占位图被当成资源,真图反而没有入口。
  • 是否存在防盗鏈、鉴權或按 Referer 返回 403。抓取訪問往往不带正常来源,容易被直接拒绝。

這几項用日誌或抓取工具走一遍就能看清,先確認资源可達,再谈索引。

二、頁面入口與图片站点地图

图片被發現主要有两條路:頁面里的 img 标簽,以及图片 sitemap。前者更實在,後者是补充。

  • 图片要出現在已经被收錄的頁面上。頁面本身没收錄,图片基本没有机會。
  • 图片离正文越近、和主题越相關,被發現和被理解的概率越高;纯装饰性的图标、邊框图,即使被抓到,意义也有限。
  • alt 把内容说清楚,比堆關鍵詞更有用。

图片 sitemap 适合图库、商品图這類量大、需要單獨暴露的资源。它不是提交了就一定有效果,但连這個入口都没有,等于少了一條發現路径。

三、別忽略“頁面归属”這一层

看到图片出現在搜尋结果里,並不代表站点收錄状况就正常,還要回头看看它挂在哪個 URL 上。

  • 同一張图在列表頁、詳情頁、推荐位重复出現,容易出現多個頁面共用同一资源的情况。這时判断“是哪個頁面带来的收錄”意义不大,重点是让真正需要被收錄的那個頁面有獨立入口。
  • 如果图片只出現在彈窗、轮播第二屏,或需要点击才展開的模块里,抓取端往往看不到,等于没有入口。

四、一條可执行的核對顺序

  1. 先确定目标是頁面收錄,還是资源收錄。
  2. 检查 robots、鉴權、防盗鏈,確認资源能正常返回。
  3. 检查加载方式:img、懒加载還是 CSS 背景。
  4. 检查所在頁面是否已被收錄、是否有内鏈指向。
  5. 检查 alt、文件名與周邊文字是否說明内容。
  6. 最後再考虑图片 sitemap 這類补充入口。
顺序乱了的典型表現是:一上来就改 sitemap 或补 alt,但资源其實因為鉴權一直拿不到,改多少遍都不會有變化。

五、视频與 PDF 的差別

视频的索引依赖播放頁和视频相關标记,文件本身通常不作為獨立頁面被收錄;PDF 則會被当成獨立文档處理,還容易出現同一份文件對應多個地址的情况。這两類在核對入口之前,先想清楚希望用戶最终落到哪個頁面上,處理方式會更明确。

整体原則可以用一句话概括:入口可達、頁面可收錄、内容说得清。三條都满足之後再谈索引與展現;缺哪一條就先补哪一條,不要同时改。