網站收錄

PDF、图片、视频也會進索引:非 HTML 资源的收錄怎么處理

很多运营只盯着 HTML 頁面的收錄,忽略了挂在站上的 PDF、图片、视频也會被蜘蛛抓取並進入索引。本文說明這些文件進入索引的路径,区分“阻止抓取”和“阻止索引”的区別,並给出该收的怎么優化、不该收的怎么處理的具体做法與检查顺序。

網站收錄

PDF、图片、视频也會進索引:非 HTML 资源的收錄怎么處理

聊到收錄,多數人預設说的是 HTML 頁面。但搜尋引擎索引里還有另一大類内容:PDF、Word 轉出的文档、图片、视频文件。只要這些文件挂在可公開訪問的 URL 上,被内鏈、站点地图或者別處的連結指到,蜘蛛就可能把它抓下来,抽取其中的信息並建入索引。這部分内容平时没人管,出問题时往往已经挂了好几年。

非 HTML 文件是怎么進入索引的

蜘蛛拿到一個指向文件的 URL,不會因為後缀不是 .html 就走開。它會下载文件,然後按類型處理:PDF 和 Office 文档會抽取可選的文字层,图片會结合文件名、alt 属性、周邊正文和頁面标题来理解,视频則更多依赖承载它的那個頁面。也就是说,一個文件是否被收錄,判断依據和普通頁面没有本质区別——能不能被抓到、内容能不能被理解、值不值得放進索引。

這也是為什么很多站点在統計收錄量时,會發現索引里混着一批自己没打算公開的 URL。

容易“意外”被收錄的几類文件

  • 舊版报價單、产品手册、白皮书的歷史版本,和現行頁面内容互相矛盾。
  • 内部培训资料、會议纪要導出的 PDF,本来只在内部流轉,被顺手放進了公開目錄。
  • 批量導出的商品图,同一張图带上尺寸後缀變成几十個地址,形成大量重复。
  • 设計稿、掃描件、測試用的示例文件,上传後忘了清理。

這些問题里,重复内容只是小事,真正麻烦的是不该公開的信息被索引。文件一旦進了索引,就算後来從服務器删掉,索引條目也可能保留一段時間,中間這段時間是敞開的。

先分清:阻止抓取和阻止索引不是一回事

處理非 HTML 文件时,最容易踩的坑是把 robots.txt 当成萬能開關。它只是告诉蜘蛛不要来抓,並不能让已经被索引的條目消失。

  • robots.txt:阻止抓取。對尚未被發現的文件有效;對已经收錄的文件,蜘蛛因為不再抓取,反而看不到你後来加的移除指令,索引條目可能長期挂在那里。
  • X-Robots-Tag 响應头:這是非 HTML 文件最實用的手段。它通過 HTTP 响應头生效,可以對 PDF、图片、视频直接下 noindex 指令,不依赖頁面里的 meta 标簽——因為文件本身不是 HTML,頁面級 noindex 根本管不到它。
  • 登入墙與訪問權限:從源头解决。内部资料不放在公開可訪問的路径下,比事後补救省事得多。
一句话记住:robots.txt 让蜘蛛不来,X-Robots-Tag 让文件不被索引。想移除已经收錄的文件,两個要配合用,而且要等蜘蛛重新抓取时才生效。

希望被收錄的图片和 PDF,该做什么

反過来,图片搜尋往往能带来一批被忽略的流量,PDF 里的長文档也有被检索的價值。想让它被正常收錄,重点在于让蜘蛛讀懂它。

  • 文件名用有意义的词,別用 IMG_2031 這類無信息命名。
  • 图片寫清 alt,並且让周围正文和它相關,不要堆關鍵詞。
  • PDF 尽量保留可選中的文字层,掃描图轉出的纯图片 PDF,蜘蛛很难提取内容。
  • 重要文档配一個 HTML 頁面承载,把摘要、要点、下载入口放在頁面上,文件作為附件。這样内容更新、结构标记和内鏈都更灵活。
  • 图片和文档各自有站点地图或站点地图扩展,可以补上抓取入口。

视频和音频:文件本身通常不是入口

视频文件的收錄路径和图片不完全一样。蜘蛛很少把视频文件本身当獨立頁面處理,更多是通過承载它的頁面来判断。所以要保證:有一個稳定的頁面放播放器,頁面上有标题、简介、文字說明;相關的结构化資料填寫完整,站点地图里给出视频信息。文件地址換来換去、播放器嵌在彈窗里,都會让收錄變得不稳定。

一個可以照做的检查顺序

  1. 把站内所有非 HTML 资源列出来,至少覆盖 upload、download、media、files 這類常见目錄。
  2. 逐個分類:该公開的、该移除的、该用 HTML 頁面替換的。
  3. 该移除的,加上 X-Robots-Tag,必要时配合 robots.txt,並考虑單獨提交移除請求。
  4. 该保留的,补齐文件名、alt、文字說明和站点地图入口。
  5. 過一段時間再看索引狀態,確認處理是否生效——這類改動通常不會立刻反映出来。

非 HTML 资源的收錄問题,平时不出声,出事就是信息层面的問题。把它纳入日常的收錄检查范围,比等到搜尋结果里翻出自己的内部文件再去补救要省力得多。