網站收錄

PDF、图片與附件能不能被收錄:非 HTML 内容的處理方式

站点里的 PDF、图片、附件和網頁不是一套收錄逻辑。本文把非 HTML 内容分成三類,說明文档被收錄的前提、图片搜尋與網頁索引的区別,並给出给重要文件配 HTML 入口頁的處理顺序,以及哪些文件不必强求收錄。

網站收錄

PDF、图片與附件能不能被收錄:非 HTML 内容的處理方式

站点里除了 HTML 頁面,往往還有一批 PDF 报告、产品图片、Excel 模板、白皮书压缩包。這些文件的收錄逻辑和普通網頁不一样:能被下载,不等于能被索引;能被索引,也不代表會出現在網頁搜尋结果里。

一、先把非 HTML 内容分成三類

  • 带文本层的文档:Office 導出的 PDF、纯文本、HTML 版說明文件,正文可以被程序讀出来。
  • 图片型文档:掃描件、拍照生成的 PDF、單張图片,没有可提取的文字。
  • 压缩包與二進制文件:zip、exe、psd 等,内容對抓取程序基本不可讀。

分類的意义在于:第一類有被收錄的可能,第二類通常只能作為图片资源進入图片搜尋,第三類很难獨立获得索引,需要靠 HTML 頁面来承载信息。

二、文档類文件被收錄的前提

搜尋引擎處理 PDF 时,會尝试提取文本层、讀取文件标题元資料,再判断這份文件是否值得進入索引。几個常见的卡点:

  • 文件是掃描图,没有文本层,程序只能看到一張图;
  • 一份文件里塞了整套手册、合同、價目表,主题過于分散;
  • 文件名是 final_v3_最终版.pdf 這類無意义命名;
  • 文件体积過大,抓取时中途断開;
  • 服務器對 /files/、/download/ 這類目錄做了 robots 屏蔽,或者响應头里带了 noindex。

三、图片的收錄入口和網頁不同

图片多數情况下是作為頁面的一部分被發現的,图片搜尋是另一套入口。想让图片更容易被理解,可以從這几處入手:文件名用可讀的描述、alt 寫清楚内容、图片周围有相關文字、避免所有图片都堆在一個图库里没有任何上下文。图片本身很少單獨出現在網頁搜尋结果中,所以不必為每一張配图都追求收錄,更重要的是它所在的那個頁面能不能被收錄。

四、给重要文件配一個 HTML 入口頁

這是比較稳的一種做法:不要只把文件丢在目錄列表里,而是為它建一個正常頁面,包含文件简介、适用场景、更新時間和下载連結。這样用戶和搜尋引擎都有机會先看到頁面,再從頁面進入文件。操作顺序可以按下面来:

  1. 確認這份文件确實有人會搜、會下载;
  2. 建一個 HTML 頁,正文寫清楚這份文件解决什么問题;
  3. 頁面里放一個指向文件的普通連結,而不是 JS 触發的下载按钮;
  4. 检查文件名、目錄權限、robots 規則和响應头,確認没有被誤屏蔽;
  5. 在 sitemap 中列出這個 HTML 頁面,文件本身是否需要單列,看實际需要。

五、哪些文件不必强求收錄

價格表、内部模板、大体积安装包、带版權限制的资料,通常不指望通過自然搜尋带来流量,也不必花精力去做收錄優化,甚至可以用 noindex 或登入後下载的方式控制訪問。判断标准很简單:這份文件如果出現在搜尋结果里,對站点有没有正向價值。

抓取和收錄是两件事:文件被下载了很多次,說明有人在用;但索引里没有它,說明程序没把它当成可獨立呈現的内容。這两件事的排查路径不一样,先分清再動手。