網站收錄

非 HTML 资源的收錄:PDF、图片和视频该不该進索引

站点的 PDF 說明书、产品图、演示视频同样是被爬虫抓取的獨立 URL,只是進入的是網頁、图片、视频等不同索引。本文說明這類资源的收錄前提、重复版本與歷史遗留文件的處理方式,並给出按用途判断放行、以及排查非 HTML 资源收錄狀態的先後顺序。

網站收錄

非 HTML 资源的收錄:PDF、图片和视频该不该進索引

讨论收錄时,注意力常集中在 HTML 頁面上,但站点的 PDF 說明书、产品图、演示视频同样是可被抓取的 URL。它們進入的是不同的索引(網頁、图片、视频),展示位置、判断标准和治理方式都不太一样。

非 HTML 资源為什么會被抓取

爬虫判断的是 URL 是否可達、robots.txt 是否放行、响應是否正常,而不是扩展名。只要某份 PDF 或图片能被連結触達,它就是一個獨立的候選资源。区別在于入索引之後:

  • 網頁索引:文本层完整的 PDF、HTML 附件可能被全文检索。
  • 图片索引:取决于图片本身的清晰度、周邊文字和所在頁面主题。
  • 视频索引:需要可訪問的播放地址、明确的标题和缩略图,视频站点地图有助于發現。

PDF 是最容易被忽略的一類

  • 它是獨立 URL,母頁面上的 canonical、内鏈信号都不會自動轉移過去。
  • 同一份文档上传到多個栏目,就會产生多個近似版本,形成重复内容。
  • 掃描件没有文本层,即使被收錄也难以命中關鍵詞,收錄價值低。
  • 舊版本文档長期在线,可能和現行頁面在搜尋结果里同时出現。

一個可操作的判断:用戶是否會主動搜尋這份文档?會,就让它可抓取,並在标题、文件名上寫清版本和用途;不會,只是頁面附件,就用 410、robots.txt 或 noindex 收口,別让它在索引里長期占位。

图片和视频的收錄前提

  1. 图片使用可解析的 img 标簽,而不是纯 CSS 背景图,src 是稳定的 URL。
  2. alt 與周邊正文用来描述图片内容,別堆關鍵詞。
  3. 视频提供可直接訪問的播放頁或文件地址,配好标题、时長、缩略图。
  4. 用图片、视频站点地图补充抓取入口,尤其是藏在深层的资源。

需要注意:图片或视频被索引,不等于所在頁面會被收錄;反過来,頁面没被收錄,图片也常常跟着進不了索引。两者相關,但不重合。

该不该放行:按用途分三類

  • 有獨立搜尋需求:产品手册、研究报告、教程视频。保留抓取,做好标题與描述。
  • 只是頁面附件:合同模板、表單下载、图集原图。随頁面存在即可,不必专门優化。
  • 歷史遗留與重复版本:舊版文档、重复上传的图片。清理或屏蔽,避免稀释站点整体质量。

排查顺序建议

  1. 先用站点地图或服務器日誌整理出被抓取的非 HTML URL 清單。
  2. 按扩展名和目錄分组,看哪些目錄數量異常。
  3. 逐個確認是否被 robots.txt 拦截、是否返回 200、是否有可用文本层。
  4. 對比是否與現行頁面内容重复,决定保留、合並還是下线。
  5. 要保留的资源补内鏈和站点地图條目;不要的直接用 410 或屏蔽,给附件加 canonical 通常没有意义。
非 HTML 资源不需要“全部收錄”,也不该“一律屏蔽”。按用戶是否會主動搜尋来判断,比按文件類型一刀切更靠谱。

最後提醒一句:這類资源的收錄狀態在常規的頁面索引报告里往往看不全,需要在图片、视频索引或资源級查询中單獨核對。資料對不上时,先確認清楚你看的是哪一個索引。