網站收錄

PDF、图片、视频也會進索引:非 HTML 资源怎么管才不乱

蜘蛛不只抓 HTML 頁面,PDF、图片、视频這些非 HTML 文件同样會被發現並進入索引。本文讲清它們通常從哪些入口被抓走,怎么判断哪些该留、哪些该清,以及 noindex、robots.txt 與直接刪除分別适用于什么场景。

網站收錄

PDF、图片、视频也會進索引:非 HTML 资源怎么管才不乱

很多人排查收錄时只盯着 HTML 頁面,其實索引里躺着相当一批非 HTML 文件:PDF、Word 或 Excel 導出件、图片、视频文件。它們不是被額外收進去的,而是蜘蛛在正常抓取過程中顺着連結發現、下载、解析後自行判断的结果。既然能被收進去,就同样需要管理——留着還是清掉,取决于它有没有资格出現在搜尋结果里。

非 HTML 文件是怎么被發現的

蜘蛛並不区分連結指向的是 .html 還是 .pdf,只要服務器返回 200 和可识別的文件類型,就有机會被抓走。常见的發現入口有這么几類:

  • 内鏈直接指向文件,比如产品頁挂了一份規格說明 PDF;
  • 上传目錄、附件目錄本身可以訪問,蜘蛛顺着目錄或列表頁一路抓;
  • 站点地图里寫了文件 URL,等于主動提交;
  • 下载站、文档分享站的外鏈,直接指向原始文件地址。

其中最容易失控的是上传目錄。运营和销售随手传上去的文件,只要没做訪問限制,就會随時間堆积,然後被逐個抓走。

能抓取,不等于應该被收錄

這里要分清两件事:文件能被下载,說明抓取没問题;文件出現在搜尋结果里,才是收錄。文件進索引後有几個麻烦:正文往往缺少上下文,标题由解析器自動生成,摘要可能是文件開头的几行文字,展示效果通常比 HTML 頁面差一截;如果同一份内容既有 PDF 又有網頁版,两者還可能互相争位置。

判断标准很简單:這份文件是否面向外部用戶、是否回答了某個具体問题、是否存在重复的網頁版本。三個問题里有两個答不上来,通常就不该留在索引里。

图片和视频的收錄逻辑略有不同

图片通常以獨立條目進入图片搜尋,頁面上下文(alt、周邊文字、文件名)會影响它被理解成什么;视频則更依赖承载它的頁面是否可抓取,如果播放器必须点击或登入才加载,蜘蛛往往只能看到一個空壳。

  • 图片:文件名和 alt 寫清楚這是什么,別用 IMG_2043 這種;同一張图尽量不要在多處重复上传出多個地址。
  • 视频:让頁面本身包含可讀的文字說明,配合结构化資料标注,而不是把信息全塞進播放器里。
  • 文件型素材:只有在存在明确搜尋需求时才主動放進索引,其余按目錄規則统一處理。

让不该留的文件登出索引

  1. 優先彻底刪除。文件不再對外提供,就直接删掉或返回 410、404,這是最干净的做法,索引會随之清理。
  2. 需要保留文件但不想被搜到,可以在服務器响應的 HTTP 头里加 X-Robots-Tag: noindex。這里的顺序要注意:不要先用 robots.txt 屏蔽,屏蔽之後蜘蛛看不到 noindex,文件反而可能繼續留在索引里,只是没有摘要。
  3. 只针對某類目錄,比如 private 上传目錄,可以用 robots.txt 禁止抓取,前提是你本来就不希望這些 URL 出現,也不要指望 noindex 還能生效。
  4. 已经被收錄的,處理完需要等一個周期,期間可以在站長平台提交移除請求作為過渡。

日常管理该做的几件小事

  • 定期用 site:你的域名 filetype:pdf 這類查询抽查,看有哪些文件已经被收了。
  • 给上传目錄定規則:對外资料一個目錄,内部资料另一個目錄,只允许前者被抓取。
  • 站点地图里只寫要收的頁面和文件,不要图省事把整個上传目錄塞進去。
  • 同一份内容的 PDF 和網頁版二選一作為主版本,另一個做規范化處理或直接下线。

非 HTML 资源不會主動给你發通知,它們只會安静地出現在索引里。定期盘点一次,比等到搜尋结果里冒出内部报價單再补救要省事得多。