用 site: 指令抽查收錄情况时,很多人會看到 PDF、JPG、DOCX 甚至 ZIP 出現在结果里。第一反應往往是“這些東西怎么也被收錄了”。實际上,搜尋引擎能解析的遠不止 HTML 頁面,图片、PDF、办公文档都在處理范围内。它們的收錄問题,處理逻辑和網頁並不完全一样。
這些文件是怎么被發現的
非 HTML 资源進入索引,前提都是先被当成一個 URL 發現。常见的發現路径有几類:
- 頁面里的連結或按钮直接指向 xxx.pdf、xxx.jpg 這類直鏈
- sitemap 里同时提交了文件地址
- 上传目錄、附件目錄被開放列目錄,蜘蛛顺着目錄层級爬完
- 外部站点直接引用了你的图片或文档地址
發現之後,文件本身能正常返回、内容可被提取,就具备了進索引的基础條件。图片則主要依赖文件名、alt 文本、周邊正文和结构化資料来判断主题。
先分類,再决定管不管
不是所有被收錄的文件都要清理。先按用途分一下,處理成本會低很多。
- 有獨立價值的文档:产品手册、規格书、公開报告、白皮书。這類文件本身是内容资产,被收錄通常是好事,重点是保證連結可訪問、文件名和标题可讀。
- 图片直鏈與缩略图:一般不需要刻意追求收錄,但也不必紧張。數量不大时基本不影响什么。
- 用戶上传的临时附件:头像原图、訂單導出、後台临时文件。這類通常没有检索價值,值得處理。
- 可被批量遍歷的目錄:uploads、files、download 這類目錄如果可直接列出内容,是最需要優先處理的一類,因為它會持續产生新的可抓取 URL。
几種處理手段的差別
robots.txt
Disallow 只阻止抓取,不阻止索引。如果某個文件地址被外部連結指向,它仍可能以“僅有 URL、没有摘要”的形式出現在结果里。用 robots 挡目錄时,要清楚這一点。
X-Robots-Tag
PDF、图片這類文件放不進 meta 标簽,但服務端可以返回 X-Robots-Tag 响應头,值设為 noindex。這是對非 HTML 文件更直接的手段,前提是服務器能针對這些文件類型單獨配置响應头。
入口與狀態碼
把附件的入口從直鏈改成 HTML 詳情頁,是一種结构性做法:直鏈不作為主要導航出現,發現路径自然變窄。文件确實下架时,返回 404 或 410 比返回一個空白頁更清楚,返回 200 的空壳會让搜尋引擎反复抓取。
排查顺序
- 用 site:你的域名 filetype:pdf 等方式抽样,先看被收錄的到底是哪几類文件
- 索引报告里一般没有按文件類型分组,需要回到服務器日誌,統計 .pdf、.jpg 等後缀的抓取频次和狀態碼
- 判断問题出在發現路径(内鏈、目錄、sitemap)還是文件本身(有無價值、是否已刪除)
- 再决定是保留、加 noindex 头,還是調整入口連結
- 改動後隔一段時間再抽样核對,不要改完当天就下结论
處理非 HTML 资源的目标不是把索引清空,而是让有價值的文件更容易被找到,让無检索價值的直鏈不再持續占用抓取與索引资源。
几個常见的誤判
- 把图片被收錄当成重复内容問题来處理,方向跑偏。
- 用了 robots.txt 就以為文件會從索引里消失,實际可能仍然可见。
- 只改了 sitemap,忘了頁面上還有大量指向舊直鏈的内鏈。
- 素材站、图库站和普通企业站的情况不同,前者本来就需要图片被检索,不能照搬“全部挡住”的做法。
把這几類文件單獨拉出来看一遍,你會發現多數問题不是文件太多,而是入口没有设計過:什么该被導流到詳情頁,什么该保持直鏈,什么该彻底關掉,提前定好規則,後面就省事得多。