網站收錄

非 HTML 文件被收錄了:PDF、图片和附件该留還是该清

很多运营只盯 HTML 頁面,直到用 site: 一查才發現索引里躺着大量 PDF、图片和早期文档。這類非 HTML 文件搜尋引擎同样會抓取解析,處理方式也和普通頁面不同。本文先帮你分清哪些该留、哪些该清,再對比 robots.txt、X-Robots-Tag、權限控制和刪除几種手段的實际差別,给出一套可以照着走的排查與执行顺序。

網站收錄

非 HTML 文件被收錄了:PDF、图片和附件该留還是该清

日常盯收錄,多數人只看 HTML 頁面。等到某天用 site: 查一下,才發現索引里還躺着几十個 PDF、一堆商品图,甚至几份早期的 Word 报價單。這些都是非 HTML 文件,搜尋引擎同样會抓取和解析,值得單獨花点時間理一遍。

非 HTML 文件為什么也會進索引

搜尋引擎的抓取器不只認 HTML。PDF 會被提取正文並參與網頁搜尋,图片會進入图片搜尋,Office、TXT 以及部分压缩包里的内容也可能被讀取。判断标准和普通頁面其實一样:URL 可以公開訪問、没有被 robots 規則挡住、没有 noindex 類指令,就有机會被抓取和收錄。所以附件出現几條索引记錄,本身不是出错,而是預設行為。

先分清哪些该留、哪些该清

不建议看到非 HTML 结果就一律屏蔽,先按用途分成两類:

  • 建议保留:對外的产品手册、白皮书、規范文档、公開的图片素材。這類文件往往能带来搜尋流量,也常被当作獨立的落地内容使用。
  • 建议清理:内部培训资料、過期报價單、含客戶信息的表格、临时發给某個人的文件、測試上传的附件、由參數批量生成的缩略图。

判断依據不是文件格式,而是這個文件是否希望被陌生人搜到。

從哪些入口排查

  • site:你的域名 filetype:pdf(其他格式同理)大致看數量。
  • 翻服務器日誌,按扩展名過滤,看哪些文件被反复抓取。
  • 看搜尋控制台的頁面报告,附件有时會被归到單獨的類別里。
  • 图片资源另看图片搜尋的表現資料,別和文档混在一起判断。

几種處理方式,效果不一样

robots.txt 屏蔽抓取

挡住抓取路径,成本最低,但對已经進索引的文件作用有限:记錄可能還在,只是摘要不再更新。适合那些希望彻底不對外、並且後續會從索引里自然淡出的文件。

X-Robots-Tag 响應头

這是對 PDF 這類文件最直接的办法。在服務器或對象存储上给對應文件加上 X-Robots-Tag: noindex,效果類似頁面的 noindex。前提是你能控制响應头,纯静態托管要先確認平台是否支持。

挪位置或改權限

把文件移進需要登入才能訪問的目錄,或者換成带權限校驗的下载連結。外部訪問不到,索引迟早會失效。要注意舊的直鏈如果還能打開,等于没處理。

直接刪除並返回 404 或 410

文件确實不要了,删掉並让服務器返回 404 或 410 都可以,410 表達得更明确。如果只返回 200 的空壳頁面,反而容易被当成软 404,處理起来更麻烦。

图片別一刀切

图片搜尋是一條真實的流量来源。清理之前先看資料:有曝光、有点击的图優先保留;只是体积大、命名混乱但内容有用的图,考虑压缩和重命名;真正该清的是重复、過期、無意义的占位图。

處理指令只是把门關上,已经進索引的记錄不會马上消失,通常需要一段時間才會淡出。期間可以用 URL 检查工具確認單個地址的目前狀態。

一個可以照着走的顺序

  1. 先導出清單,按訪問量或時間排序,優先處理高風險的敏感文件。
  2. 確認每個文件到底要留還是要清,別用一條規則覆盖全部。
  3. 要清的,優先用 X-Robots-Tag 或權限控制;确定废弃的再刪除。
  4. 要留的,把命名、目錄和落地頁關系整理規范,顺带补上合适的描述信息。
  5. 隔几周再查一次,確認记錄在减少,而不是換了個地址繼續出現。

附件和图片的收錄管理,本质還是那道老题:先想清楚這個 URL 是否值得被搜到,再决定用什么手段。想清楚了,操作反而简單。