網站收錄

图片、PDF 和附件被收錄:非 HTML 资源的收口核對顺序

很多站点只關注 HTML 頁面的收錄,却忽略图片、PDF、Office 文档和压缩包。這類地址被搜尋蜘蛛發現後同样可能進入索引,挤占抓取预算並造成重复内容。本文按“先確認被收錄的類型,再决定保留還是屏蔽,最後统一入口和信号”的顺序,梳理非 HTML 资源的收口核對方法。

網站收錄

图片、PDF 和附件被收錄:非 HTML 资源的收口核對顺序

不少站長盯着 HTML 頁面的收錄情况,却忘了图片、PDF、Office 文档、压缩包這類非 HTML 地址。它們同样可以被搜尋蜘蛛抓取,也可能出現在索引里。当這些地址被大量收錄时,常见的影响是:抓取预算被占用、重复内容增多、搜尋结果里出現不该單獨展示的附件版本。

先確認哪些非 HTML 地址被收錄

不要凭感觉判断。先用 site 查询和站長後台的索引报告,按文件類型過一遍:

  • 图片目錄:/images/、/uploads/、/assets/ 下的原图、缩略图、水印图。
  • 文档目錄:/pdf/、/docs/、/files/ 下的 PDF、Word、Excel、PPT。
  • 附件與下载:/download/、/attachment/ 下的压缩包、安装包、素材包。
  • 動態生成的资源:带參數裁剪的图片、在线预览地址、临时導出的文件。

把被收錄的地址和站内實际使用的地址對一遍,区分“正常资源”和“本不该有獨立搜尋入口的附件”。這一步决定後面是保留、归並還是屏蔽。

再判断這個资源该不该有獨立索引

不是所有非 HTML 文件都要屏蔽。如果 PDF 是核心内容,例如白皮书、标准文档,它本身可以是一個落地頁,保留收錄没問题。需要收口的是那些只是頁面附属品、却有獨立 URL 的版本,例如文章配图、商品缩略图、简歷附件、软件下载包。

判断标准很简單:這個地址單獨出現在搜尋结果里,對用戶有没有價值?如果没有,就更适合归並到主頁面,而不是让它單獨留在索引里。

收口时的核對顺序

  1. robots.txt 是否放行。先看有没有誤放行资源目錄。如果整個目錄不该被索引,可以用 Disallow 阻断抓取,但注意:被屏蔽的地址仍可能因為外鏈出現在索引里,只是没有摘要。
  2. HTTP 头里的 X-Robots-Tag。對图片、PDF 這類非 HTML 文件,頁面里的 meta robots 往往不生效,更适合在响應头加 X-Robots-Tag: noindex。確認服務器返回的头部是否真的带上了這個标记。
  3. canonical 與主頁面归属。如果附件必须保留可訪問,可以在 HTTP 头里指向對應的 HTML 主頁面,帮助搜尋引擎理解归属。不要指向另一個附件,否則等于没指。
  4. 站内連結入口。检查正文、下载按钮、图片点击後的跳轉連結,是否直接把附件 URL 暴露出去了。能通過主頁面承载的,尽量不用裸附件地址做入口。
  5. sitemap 與提交工具。检查 sitemap 里是否混入了图片、PDF、附件地址。如果這些地址不需要收錄,就不要主動提交,减少被抓取的概率。
  6. 確認生效范围。改動後按目錄抽几個 URL 用抓取工具查看响應头,確認 noindex、canonical 或 robots 規則没有寫错层級或寫反。

常见誤区

  • 以為 robots.txt 屏蔽等于刪除收錄。屏蔽抓取後,舊索引可能還在,需要配合 noindex 或返回 404/410 才能推動移除。
  • 在 HTML 頁面寫 meta noindex,却指望它作用于同目錄的 PDF。meta 标簽只對所在 HTML 頁面生效。
  • 把附件 URL 寫進 sitemap,又希望它不被收錄,信号互相矛盾。
  • 图片被收錄後直接删文件,導致大量 404。先確認哪些图片仍被引用,再决定是保留、替換還是返回 410。

收口之後看什么

改動後不要每天查收錄量。先观察抓取日誌里這些非 HTML 地址的訪問频率是否下降,再隔一段時間看索引报告里對應類型的數量變化。如果發現新的附件目錄或動態资源地址仍在被大量發現,回到第一步重新確認入口来源。非 HTML 资源的收錄問题,通常不是單個文件的事,而是入口、响應头和提交信号没有统一。