做站点运营时,大家盯的多半是 HTML 頁面,但搜尋索引里還存着另一類東西:图片、PDF、视频、Office 文档等非 HTML 资源。它們的收錄逻辑和網頁不太一样,很少能靠内鏈直接讀進去,更多依赖被頁面引用、被 sitemap 声明,以及文件本身能不能被解析。
先分清:资源被“發現”和资源被“收錄”是两件事
资源文件通常没有正文外鏈,蜘蛛一般是從引用它的頁面上發現這個 URL。被發現之後,搜尋引擎還要判断它值不值得單獨留一條索引记錄。一張装饰性图标、一份内部流轉用的表格,即便被爬到,也大概率不會被單獨收錄,這是正常現象,不必当成問题去修。
图片收錄:看的是上下文,不只是文件本身
图片自己没有文字,搜尋引擎要理解它,主要靠三處信息:
- 引用頁的上下文:图片周围的标题、段落、图注,决定了這張图大致在讲什么;
- alt 属性:它的作用是图片内容缺失时的替代描述,不是關鍵詞堆砌的地方;
- 文件自身的可訪問性:URL 可抓取、返回 200、robots.txt 没有屏蔽图片目錄、CDN 没有額外加限制。
如果图片目錄被 robots.txt 整体屏蔽,或者懒加载寫得让真實地址始终不出現,图片就很难進入索引。图片 sitemap 能帮忙發現,但它解决的是“找到”,不是“收錄”。
PDF 與文档:能解析出文字才有机會
- 带文本层的 PDF 通常能被解析,索引里可能以文档形式出現;
- 纯掃描件没有文字层,搜尋引擎讀到的内容接近空白;
- 文件体积過大、下载慢,會影响抓取效率和後續判断。
如果一份文档是對外的重要内容,用 HTML 頁面承载正文、把 PDF 作為下载附件,通常更稳。HTML 版本可以被内鏈、被寫标题、被正常參與收錄判断,PDF 只作為补充版本存在。
视频:多數情况下需要一個承载頁面
视频文件本身很难獨立成為一條有效索引记錄。更常见的做法是给视频配一個播放頁,頁面上有标题、简介、文字說明,必要时补充视频结构化資料,把时長、缩略图、上传時間等信息交代清楚。
几個容易被忽略的卡点
- 资源目錄被 robots.txt 屏蔽,頁面上引用還在,索引里却一直空着;
- CDN 或對象存储返回了 noindex、403,蜘蛛拿不到文件;
- 资源 URL 带临时簽名參數,每次訪問都變,等于換了一個地址;
- 资源 URL 含中文、空格或特殊字符但没做编碼,抓取端可能取不到。
什么时候该给资源补一個 HTML 版本
判断标准很简單:這個東西是不是你希望用戶通過搜尋找到的内容。如果是,就给它一個能被正常抓取、有标题有正文的 HTML 頁面;如果只是頁面里的辅助元素,就让它待在引用頁的上下文里,不必强求單獨收錄。
资源收錄不是越多越好。把重要内容用 HTML 承载,把辅助资源交给頁面上下文,通常比批量提交资源文件更省事。