網站收錄

图片、PDF、视频也會進索引:非 HTML 资源的收錄该怎么管

搜尋索引里不只有 HTML 網頁,图片、PDF、视频等资源都有自己的 URL 和抓取路径。本文說明三類资源的索引方式差异,並给出资源收錄異常时的排查顺序,以及补入口、避誤区的基本做法。

網站收錄

图片、PDF、视频也會進索引:非 HTML 资源的收錄该怎么管

很多人把收錄管理等同于“頁面到底進没進索引”,但搜尋索引里不只有 HTML 網頁。图片、PDF、视频、Office 文档都可能被單獨抓取、單獨索引,有些還會直接出現在搜尋结果里。這些资源如果一直放在管理视野之外,常见的结果是两头都不對:该被收錄的被挡在门外,不该大量進索引的反而悄悄收了一堆。

非 HTML 资源為什么會單獨進索引

關键在于资源本身有獨立 URL。搜尋引擎的抓取端在請求一個地址时,會先看返回的内容類型,再分流到不同的索引通道:图片進图片索引,视频進视频索引,PDF 和部分文档則经常被当作普通網頁處理。也就是说,一條 URL 能不能進索引,和它是網頁還是文件關系不大,和它是否可訪問、是否有入口、是否值得保留關系更大。

三類资源,收錄逻辑並不一样

图片

图片一般進入图片索引,很少單獨出現在普通網頁结果里,但它是頁面的一部分。图片被抓取的入口主要是頁面里的 img 标簽、srcset 以及图片站点地图;用 CSS 背景图的方式加载,被抓到的概率明顯更低。

  • alt、caption、周邊文字會影响這張图被理解成什么。
  • 图片 URL 频繁變動,等于每次都要重新被發現一次。
  • 把图片目錄整段屏蔽,图片進不了索引,頁面本身也可能少了一块内容。

PDF 和其他文档

PDF 常被当成普通網頁對待,可以有标题、有摘要,直接出現在搜尋结果里。這意味着服務器上忘了删的舊版文档,用戶一样可能搜到。同一份材料的 v1、v2、final 多個版本同时在线,還會让收錄归属變得混乱,最好只保留目前版本,舊版做跳轉或返回 410。

视频

视频能否被索引,更依赖承载頁。视频文件本身往往不是抓取重点,頁面上的标题、简介、时長、缩略图、结构化資料才是。视频文件和承载頁放在同一個域名下、有稳定的播放頁入口,通常比把文件丢在第三方存储上更容易被關联起来。

资源收錄異常时,按這個顺序查

  1. 资源 URL 能否直接打開。換一個未登入的环境訪問,確認不是 403、404,也没有被防盗鏈規則挡住。
  2. robots.txt 是否把资源路径一起挡了。不少站点只盯着頁面,寫規則时顺手把 /uploads、/files 屏蔽,资源自然進不去。
  3. 承载頁本身是否被索引。资源通常靠頁面被發現,頁面都進不去,资源很难被單獨抓取。
  4. 服務器對资源請求的响應速度。大图、大文件响應慢,抓取端會降低請求频率,發現速度跟着變慢。
  5. 看日誌里资源請求的占比。如果日誌里几乎只有 HTML 請求,說明抓取方對這些资源兴趣不大,與其反复提交,不如先把入口补上。

补入口比反复提交更實在

资源被發現的路径其實和頁面差不多:站内連結、站点地图、外鏈引用。图片可以靠正文引用和图片站点地图,文档可以放在相關内容頁里给出明确連結,视频則在专题頁、列表頁里给出稳定的播放入口。入口补够了,再谈收錄节奏;入口没补,提交多少次都只是让 URL 被看到,不會让它被收進去。

几個容易想当然的地方

屏蔽图片抓取不等于保護图片,也不等于頁面收錄不受影响。搜尋引擎判断頁面质量时會參考可见内容,图片全丢的頁面和用戶看到的往往不是同一個東西。
  • 资源進索引不代表一定带来流量,但它會占用索引名額,也會影响用戶對站点版本的判断。
  • 把资源当成附件随便命名,和把頁面 URL 随手拼參數一样,後面很难归拢。
  • 图片、文档的收錄變化通常比頁面慢,不用每天盯着數量波動。

把资源当作一條 URL 来管理,而不是当作某個頁面的附属文件,收錄這件事才不會被漏掉一半。