網站收錄

PDF、图片和下载附件被收錄:先分清哪類要留、哪類要處理

站点里的 PDF、图片和下载附件同样會被抓取和收錄。這篇文章說明它們進入索引的原因,怎么按用途分三類判断,以及在什么情况下值得保留、什么情况下该用响應头或目錄級屏蔽来處理。

網站收錄

PDF、图片和下载附件被收錄:先分清哪類要留、哪類要處理

站点里除了 HTML 頁面,還有一批容易被忽略的可抓取资源:产品手册 PDF、白皮书、图片原图、Excel 模板、压缩包、音视频文件。它們有可訪問的 URL,也可能被站内連結指向,因此出現在搜尋结果里並不奇怪。

這些文件為什么會被收錄

搜尋引擎並不只處理 HTML。只要 URL 返回 200、内容可以被解析(PDF 和多數图片格式都算),並且存在入口連結,它就可能被抓取並進入索引。常见的入口包括頁面上的下载按钮、正文里的图片連結、附件列表頁、站内搜尋的直達連結,甚至是早年上传後忘记刪除的測試文件。

很多站点是在查“收錄為什么這么杂”时才發現,索引里躺着几十個 PDF 和图片。它們本身不是错誤,問题在于你是否清楚它們的存在。

先按用途把文件分成三類

  • 用戶确實需要的:报價單、說明书、报名表。這類文件能带来有實际價值的搜尋流量,通常值得保留收錄。
  • 頁面辅助素材:正文配图、图标、样式用小图。它們對用戶有用,但作為獨立搜尋结果的意义有限。
  • 歷史遗留物:舊版模板、測試文件、内部培训资料、重复導出的多個版本。這類文件往往既没人维護,也没人會搜。

分類之後再决定動作,比一刀切地“全部屏蔽”更稳妥。

图片和 PDF 的處理逻辑不太一样

图片被收錄通常不算坏事,尤其是产品图、示意图,用戶可能在图片搜尋里找到你。要留意的只有两点:一是同一張图被反复上传成多個 URL,形成重复;二是图片体积過大,拉高抓取與加载成本。

PDF 則需要更谨慎,它可能同时带来三類問题:

  • 文件内容與线上頁面高度重复,搜尋结果里两個版本同时出現;
  • 早期版本的 PDF 仍在索引中,内容已经過时,容易誤導用戶;
  • 文件体积大,抓取一次的成本遠高于普通頁面。

如果确實不想让它們出現在搜尋结果里

  1. 單文件處理:對 PDF 可以返回 X-Robots-Tag: noindex 响應头,這是最直接的办法;HTML 里寫 meta robots 對 PDF 無效。
  2. 成批處理:把附件统一放在固定目錄下,例如 /files/、/download/,用 robots.txt 按目錄屏蔽抓取。代價是屏蔽之後搜尋引擎不會再讀取文件内容,图片搜尋带来的流量會一起消失。
  3. 從連結层面收敛:如果文件已经没人使用,更彻底的做法是刪除文件、去掉相關連結,让它返回 404,而不是一邊留着一邊屏蔽。
  4. 規范版本:同一份资料有多個版本时,頁面上只保留最新版連結,舊文件归档到一個說明頁,避免用戶和搜尋引擎同时找到過期内容。
robots.txt 屏蔽的是抓取,不是已经收錄的结果。已经進入索引的 URL,屏蔽之後仍可能出現在搜尋结果里,只是摘要信息會逐渐失效。

几個容易踩的坑

  • 用 robots.txt 屏蔽了整個 /uploads/ 目錄,结果正文配图也被挡住,頁面看起来“没有图片”。
  • 给图片加了 noindex,同时删掉 alt 文本和周邊說明文字,图片搜尋里再也找不到它。
  • 把 PDF 的 URL 寫進 sitemap,却又用 robots.txt 屏蔽同一路径,两處信号互相矛盾。
  • 附件下载需要登入,未登入訪問返回 200 的错誤頁,形成软 404,反而更浪費抓取。

一個可执行的检查顺序

  1. 拉取一段時間的抓取日誌或索引报告,筛出非 HTML 後缀的 URL。
  2. 按上面的三類给它們打标簽,标出哪些有真實搜尋需求。
  3. 對遗留文件先删連結、再删文件,最後確認返回狀態碼符合预期。
  4. 調整 sitemap 與 robots.txt,让两處信号保持一致。
  5. 過几周再复查一次,確認索引數量變化在预期范围内。

這類文件的數量通常不多,但它們對抓取预算的占用、對搜尋结果杂讯的影响,往往比想象中明顯。花一次時間梳理清楚,之後只要在上传新附件时顺手归好目錄,基本就不會再失控。