網站收錄

图片、PDF 與视频文件被收錄:非 HTML 资源的索引该怎么管

图片、PDF、视频這些非 HTML 资源同样可能進入索引,但 meta robots 對它們無效。本文按類型梳理哪些资源值得保留、哪些需要收口,並說明 X-Robots-Tag、robots.txt 與站点地图各自能做什么。

網站收錄

图片、PDF 與视频文件被收錄:非 HTML 资源的索引该怎么管

资源類 URL 為什么也會進索引

提到“收錄”,多數人想到的是 HTML 頁面。但搜尋结果里早就不只有網頁:图片會出現在图片搜尋中,PDF 报告、产品說明书、白皮书可以像普通文档一样被检索,视频文件也可能以獨立入口出現。這些资源的索引逻辑和頁面並不完全一样,直接套用管理頁面的那套方法,常常會失效。

先分類型,再决定留還是收

不是所有资源都值得出現在索引里。可以按“有没有人搜、内容是否還准确”两條来判断:

  • 值得留:原创图片、有長期參考價值的 PDF、公開的产品手册、教学類视频。
  • 需要收:纯装饰性图片、缩略图、切片图、临时導出的表格、已過期的版本文件、内部使用的演示稿。
  • 先別急着動:被其他頁面引用的图片,收掉可能连带影响頁面呈現,先看清引用關系再决定。

控制手段和 HTML 頁面不一样

這是最容易踩坑的地方:

  • meta robots 只能寫在 HTML 的 head 里,對 PDF、图片、视频文件本身無效。想给一個 PDF 加 meta noindex,技術上做不到。
  • X-Robots-Tag 寫在 HTTP 响應头里,對非 HTML 资源同样生效,是控制單類资源更合适的方式。
  • robots.txt 按路径和资源類型起作用,屏蔽一個目錄會把目錄下所有图片一起挡掉,動手前先確認影响范围。
  • canonical 在非 HTML 资源上的支持有限,別指望用它合並多個 PDF 版本。更稳妥的做法是把舊文件重定向到新文件,或直接返回 410。

排查顺序:從日誌到收口

  1. 在抓取日誌里按扩展名統計,看看蜘蛛對图片、PDF 的抓取占比,判断是否存在大量無意义抓取。
  2. 在索引报告里区分“文件本体”和“承载頁面”。图片出現在图片搜尋里,和它所在的文章頁被收錄,是两件事。
  3. 确定要保留的资源,检查是否可被抓取、响應是否稳定,必要时用站点地图的图片、视频扩展补充信息。
  4. 确定要收口的资源,優先用响應头或 robots 規則處理,不要粗暴地整站屏蔽资源目錄。
  5. 收口之後观察一段時間,索引登出通常不是立刻完成的,別在同一周内反复改策略。

几個常见誤区

  • 用 robots.txt 全站屏蔽图片目錄,结果文章頁在图片搜尋里的入口也一起没了。
  • 把過期 PDF 直接删掉返回 404,其實改成 410 或重定向到新版更清晰。
  • 站点地图只提交 HTML 頁面,图片和视频信息全靠蜘蛛自己猜。
  • 看到 PDF 被收錄就紧張,忽略了它本身可能對應真實的搜尋需求。
资源被索引本身不是問题。真正需要判断的是:這個文件有没有搜尋需求,内容是否還准确,以及它和站内頁面之間的關系是否清楚。

一句话總结

非 HTML 资源的收錄管理,核心是把“類型”和“控制手段”對上:能對文件生效的只有响應头和 robots 規則,頁面級的标簽管不到它們。先把资源分堆,再選擇保留還是收口,比统一屏蔽要稳妥得多。