很多站点的收錄讨论都围绕 HTML 頁面展開,但图片、视频、PDF 這類资源在索引里是另一套逻辑。同一張图,可能出現三種狀態:頁面被收錄、图片没進图片搜尋;頁面没被收錄、图片却單獨出現;两個都没有。在说“资源没收錄”之前,先確認自己指的是哪一種,否則後面的排查會走错方向。
一、先確認资源本身能不能被抓到
這一步和普通頁面一样,但更容易被忽略。
- robots.txt 是否屏蔽了图片目錄或 /assets 之類的路径。有些模板把静態资源放在獨立二級域名下,規則未必跟着主站走。
- 图片是否通過 CSS background 加载。背景图不在 img 标簽里,抓取端通常不會当成图片资源處理。
- 是否用了懒加载,真實地址寫在 data-src 里,而 src 是一個占位图。结果是占位图被当成资源,真图反而没有入口。
- 是否存在防盗鏈、鉴權或按 Referer 返回 403。抓取訪問往往不带正常来源,容易被直接拒绝。
這几項用日誌或抓取工具走一遍就能看清,先確認资源可達,再谈索引。
二、頁面入口與图片站点地图
图片被發現主要有两條路:頁面里的 img 标簽,以及图片 sitemap。前者更實在,後者是补充。
- 图片要出現在已经被收錄的頁面上。頁面本身没收錄,图片基本没有机會。
- 图片离正文越近、和主题越相關,被發現和被理解的概率越高;纯装饰性的图标、邊框图,即使被抓到,意义也有限。
- alt 把内容说清楚,比堆關鍵詞更有用。
图片 sitemap 适合图库、商品图這類量大、需要單獨暴露的资源。它不是提交了就一定有效果,但连這個入口都没有,等于少了一條發現路径。
三、別忽略“頁面归属”這一层
看到图片出現在搜尋结果里,並不代表站点收錄状况就正常,還要回头看看它挂在哪個 URL 上。
- 同一張图在列表頁、詳情頁、推荐位重复出現,容易出現多個頁面共用同一资源的情况。這时判断“是哪個頁面带来的收錄”意义不大,重点是让真正需要被收錄的那個頁面有獨立入口。
- 如果图片只出現在彈窗、轮播第二屏,或需要点击才展開的模块里,抓取端往往看不到,等于没有入口。
四、一條可执行的核對顺序
- 先确定目标是頁面收錄,還是资源收錄。
- 检查 robots、鉴權、防盗鏈,確認资源能正常返回。
- 检查加载方式:img、懒加载還是 CSS 背景。
- 检查所在頁面是否已被收錄、是否有内鏈指向。
- 检查 alt、文件名與周邊文字是否說明内容。
- 最後再考虑图片 sitemap 這類补充入口。
顺序乱了的典型表現是:一上来就改 sitemap 或补 alt,但资源其實因為鉴權一直拿不到,改多少遍都不會有變化。
五、视频與 PDF 的差別
视频的索引依赖播放頁和视频相關标记,文件本身通常不作為獨立頁面被收錄;PDF 則會被当成獨立文档處理,還容易出現同一份文件對應多個地址的情况。這两類在核對入口之前,先想清楚希望用戶最终落到哪個頁面上,處理方式會更明确。
整体原則可以用一句话概括:入口可達、頁面可收錄、内容说得清。三條都满足之後再谈索引與展現;缺哪一條就先补哪一條,不要同时改。