聊收錄的时候,大多數人只盯着 HTML 頁面,忽略了图片、PDF、Office 文件和压缩包這類非 HTML 资源。搜尋引擎同样會把它們纳入索引,有的出現在图片搜尋里,有的直接出現在網頁结果中,也有的只是安静地占用抓取時間。要不要處理,取决于這些资源對业務有没有實际價值。
非 HTML 资源為什么會被收錄
只要服務器返回 200、内容可解析,搜尋引擎就可能把它收錄。图片有相對獨立的图片索引,PDF 和文档則可能進入普通的網頁结果。常见的触發场景包括:
- 正文里直接連結了 PDF,連結周邊没有加任何限制;
- 图片以獨立 URL 存在,且附近有描述性文字;
- 文件目錄可以被訪問,或者存在自動生成的附件列表頁;
- 同一個附件被内鏈多次引用,爬虫顺着連結反复訪問。
這些资源被收錄本身不是错誤。真正需要關心的是:它带来了什么,又占用了多少抓取预算。
先分清哪些该留、哪些该挡
比較實用的做法是按價值分三類,而不是一刀切。
- 保留:产品手册、白皮书、規格表、报名表這類用戶會主動搜尋和下载的文件。它們适合保留,最好配一個 HTML 落地頁承接介绍和轉化,让文件本身承担下载,而不是承担全部流量。
- 收紧:纯装饰图、缩略图、同一份文档的多個導出格式、測試用的临时附件。它們被收錄通常没有正面作用,還容易和正式版本形成内容重复。
- 观察:拿不准的可以先不動,记錄它們在一段時間里的抓取次數和点击情况,再决定。
處理手段不一样,別用错
對非 HTML 资源来说,能用的手段比頁面少,效果也不完全等同。
robots.txt
适合按目錄或文件類型整批屏蔽,例如限制某個上传目錄。需要注意的是,被 robots.txt 屏蔽的 URL 仍可能出現在索引里,只是搜尋结果中不顯示摘要。如果目标是彻底不出現,這個方式不一定够。
X-Robots-Tag
PDF 和文档無法在正文里放 meta 标簽,但可以在 HTTP 响應头里下發 X-Robots-Tag: noindex。它比 robots.txt 更接近“不收錄”的目标,前提是服務器配置正确,並且爬虫每次都能讀到响應头。配置後建议用抓取工具確認一次返回结果,避免只改了一半。
图片的處理
图片一般没有合适的位置放 noindex,通常靠 robots.txt 控制目錄,或者干脆不让装饰图以獨立 URL 被連結。真正希望被搜到的产品图,反而要补上清晰的文件名、alt 和周邊說明文字,缺了這些,收錄了也很难被匹配到。
自查顺序
- 從服務器日誌里找出抓取次數靠前的非 HTML URL,按目錄和文件類型归類;
- 估算各類资源占用的抓取比例,判断是否挤占了重要頁面的抓取;
- 對照业務需求,把资源标成保留、收紧、观察三類;
- 對要收紧的,先检查内鏈、站点地图和頁面引用,一並清理或替換;
- 改完之後留出一段時間观察,不要频繁来回調整規則。
收錄數量不是越多越好,非 HTML 资源也一样。让有價值的文件被搜到、被下载,让低價值的文件少占用抓取,比單纯追求收錄條數更有意义。
最後提醒一点:非 HTML 资源的收錄變化通常比頁面更慢,處理之後不要急着下结论。先把口径和分類定清楚,再根據日誌和搜尋表現慢慢調整,比一次性大批量屏蔽稳妥得多。