網站收錄

图片、PDF 與附件也被收錄:非 HTML 资源的取舍與自查

很多人只检查 HTML 頁面的收錄,却忽略了图片、PDF、Office 文件和压缩包同样會進索引。這類资源有的能带来訪問,有的只是占用抓取時間。本文给出判断口径:哪些值得保留、哪些适合收紧,以及用 robots.txt 和 X-Robots-Tag 處理时的差异和自查顺序。

網站收錄

图片、PDF 與附件也被收錄:非 HTML 资源的取舍與自查

聊收錄的时候,大多數人只盯着 HTML 頁面,忽略了图片、PDF、Office 文件和压缩包這類非 HTML 资源。搜尋引擎同样會把它們纳入索引,有的出現在图片搜尋里,有的直接出現在網頁结果中,也有的只是安静地占用抓取時間。要不要處理,取决于這些资源對业務有没有實际價值。

非 HTML 资源為什么會被收錄

只要服務器返回 200、内容可解析,搜尋引擎就可能把它收錄。图片有相對獨立的图片索引,PDF 和文档則可能進入普通的網頁结果。常见的触發场景包括:

  • 正文里直接連結了 PDF,連結周邊没有加任何限制;
  • 图片以獨立 URL 存在,且附近有描述性文字;
  • 文件目錄可以被訪問,或者存在自動生成的附件列表頁;
  • 同一個附件被内鏈多次引用,爬虫顺着連結反复訪問。

這些资源被收錄本身不是错誤。真正需要關心的是:它带来了什么,又占用了多少抓取预算。

先分清哪些该留、哪些该挡

比較實用的做法是按價值分三類,而不是一刀切。

  • 保留:产品手册、白皮书、規格表、报名表這類用戶會主動搜尋和下载的文件。它們适合保留,最好配一個 HTML 落地頁承接介绍和轉化,让文件本身承担下载,而不是承担全部流量。
  • 收紧:纯装饰图、缩略图、同一份文档的多個導出格式、測試用的临时附件。它們被收錄通常没有正面作用,還容易和正式版本形成内容重复。
  • 观察:拿不准的可以先不動,记錄它們在一段時間里的抓取次數和点击情况,再决定。

處理手段不一样,別用错

對非 HTML 资源来说,能用的手段比頁面少,效果也不完全等同。

robots.txt

适合按目錄或文件類型整批屏蔽,例如限制某個上传目錄。需要注意的是,被 robots.txt 屏蔽的 URL 仍可能出現在索引里,只是搜尋结果中不顯示摘要。如果目标是彻底不出現,這個方式不一定够。

X-Robots-Tag

PDF 和文档無法在正文里放 meta 标簽,但可以在 HTTP 响應头里下發 X-Robots-Tag: noindex。它比 robots.txt 更接近“不收錄”的目标,前提是服務器配置正确,並且爬虫每次都能讀到响應头。配置後建议用抓取工具確認一次返回结果,避免只改了一半。

图片的處理

图片一般没有合适的位置放 noindex,通常靠 robots.txt 控制目錄,或者干脆不让装饰图以獨立 URL 被連結。真正希望被搜到的产品图,反而要补上清晰的文件名、alt 和周邊說明文字,缺了這些,收錄了也很难被匹配到。

自查顺序

  1. 從服務器日誌里找出抓取次數靠前的非 HTML URL,按目錄和文件類型归類;
  2. 估算各類资源占用的抓取比例,判断是否挤占了重要頁面的抓取;
  3. 對照业務需求,把资源标成保留、收紧、观察三類;
  4. 對要收紧的,先检查内鏈、站点地图和頁面引用,一並清理或替換;
  5. 改完之後留出一段時間观察,不要频繁来回調整規則。
收錄數量不是越多越好,非 HTML 资源也一样。让有價值的文件被搜到、被下载,让低價值的文件少占用抓取,比單纯追求收錄條數更有意义。

最後提醒一点:非 HTML 资源的收錄變化通常比頁面更慢,處理之後不要急着下结论。先把口径和分類定清楚,再根據日誌和搜尋表現慢慢調整,比一次性大批量屏蔽稳妥得多。