網站收錄

图片和 PDF 的收錄:可抓取性、上下文與索引類型

站点里的图片、PDF 等资源文件同样可以被抓取和索引,但它們走的是與網頁不同的索引類型。本文從可抓取性、頁面上下文、站点地图與入口三個层面,给出资源類内容的核對顺序,並列出防盗鏈、掃描件、懒加载等常见卡点,帮助排查资源長期不出現的原因。

網站收錄

图片和 PDF 的收錄:可抓取性、上下文與索引類型

资源類内容也有自己的索引

大多數讨论收錄的文章都在讲 HTML 頁面,但站点里還有相当一部分内容是图片、PDF、文档、视频封面這類资源文件。它們同样可以被抓取和索引,只是走的是不同的索引類型,核對方式也和普通網頁不太一样。如果图片或 PDF 在搜尋结果里長期不出現,先別急着归因于算法,多數情况是资源本身没有被当成一份可索引的文档来處理。

先分清你要的是哪一種索引

  • 網頁索引:承载资源的那個頁面,判定對象是頁面本身。
  • 图片索引:图片自身的 URL,加上它所在頁面提供的上下文。
  • 文件索引:PDF、表格、演示文稿等可直接訪問的文档。

這三種索引的入口不同,判定标准也不同。图片能不能進图片索引,與它所在頁面能不能進網頁索引是两件事:頁面被排除,图片有时仍會出現在图片结果里;反過来,頁面收錄正常,图片也完全可能不進图片索引。排查前先明确目标,否則很容易拿頁面的结论去解释图片的問题。

可抓取性:资源文件的第一道门

资源要能被單獨訪問,才谈得上被單獨索引。先核對三件事:

  • robots.txt 是否屏蔽了资源目錄或對應文件後缀。
  • 资源 URL 是否返回 200,且 Content-Type 與文件類型一致,例如 image/jpeg、application/pdf。
  • 是否被登入、鉴權、防盗鏈或 CDN 規則拦住。

第三点最容易被忽略。图片通過脚本或服務器規則校驗来源,正常浏览器能看到,抓取工具却拿到 403,收錄自然無從谈起。CDN 的热鏈保護、按 Referer 放行的規則,都可能造成這種差异。

上下文:让资源被理解,而不只是被抓到

图片本身没有可讀文本,搜尋系統主要依靠周邊信息判断它是什么:

  • alt 文本是否描述了图片内容,而不是堆砌關鍵詞。
  • 图片文件名是否可讀,产品頁-正面.jpg 通常比 IMG_2031.jpg 更好判断。
  • 图片附近是否有标题、图注或正文說明。
  • 是否使用懒加载,但初始 HTML 里没有真實地址,只留占位图。

PDF 相對好办,因為它自带文字层。但要留意两種常见問题:掃描件没有文字层,机器讀到的是一張图;正文里的連結指向一個中間跳轉頁,而跳轉頁本身對抓取工具不可用。這两種情况都會让文档"存在但讀不出内容"。

站点地图與入口

图片和 PDF 很难靠内鏈被發現,尤其是文件類资源。把它們寫進 XML 站点地图是成本最低的做法:图片可以用 image 扩展标注,PDF 可以像普通 URL 一样列出来。同时確認這些资源至少有一個可点击的頁面入口,而不是只存在于下载脚本或接口里。没有入口、也没有站点地图的资源,等于只靠运气被發現。

核對顺序

  1. 直接打開资源 URL,確認返回 200 與正确的 Content-Type,且没有被登入、防盗鏈拦截。
  2. 检查 robots.txt,確認资源目錄和承载頁面都没有被屏蔽。
  3. 检查承载頁面本身是否可索引,是否被 noindex,或 canonical 指向別處。
  4. 检查图片 alt、文件名與周邊文本,PDF 確認存在可複製的文字层。
  5. 提交站点地图,观察抓取日誌里對该目錄的請求是否出現,以及返回的狀態碼。

几個常见誤区

  • 图片收錄少就是被惩罚:多數是资源可抓取性不足或上下文缺失。
  • PDF 上传了就會被收錄:掃描件、跳轉連結、目錄屏蔽都會挡住。
  • 頁面收錄了图片就一定會進图片索引:两者判定相對獨立。
  • 提交站点地图就能加快收錄:提交只是告知存在,不改變可抓取性與内容质量。
资源類内容的收錄問题,大多出在"能不能被抓到"和"抓到了能不能被讀懂"這两步,剩下的小部分才涉及质量與索引取舍。先把這两步核對完,再考虑做別的優化。