提到收錄,多數人預設说的是 HTML 頁面。但搜尋引擎的索引里還装着大量其他格式:产品手册 PDF、图片、视频,甚至表格文档。它們可能作為獨立结果出現,也可能作為頁面内容的一部分被引用。运营中经常遇到的情况是:真正想被收錄的頁面没動静,反而是一些 PDF 先被收了進去。
哪些非 HTML 资源可能進索引
- PDF、Word、PPT 等文档:能被解析出文字的,有机會單獨成為结果條目。
- 图片:主要進入图片搜尋,也可能出現在網頁结果中。
- 视频:需要有可抓取的承载頁面,並配合结构化資料或站点地图。
它們是怎么被發現的
發現路径和頁面基本一致,只是少了内鏈這個最稳的入口。
- 被 HTML 頁面連結,比如产品頁里的說明书下载入口。
- 被寫進站点地图,單獨列出非 HTML 资源的 URL。
- robots.txt 没有屏蔽,服務器允许抓取工具讀取。
- 被其他站点轉载或引用,形成外部入口。
如果一份 PDF 只是躺在服務器目錄里,没有任何頁面連結、也不在任何站点地图里,被抓到的概率就很低。它和零内鏈頁面面临的是同一個問题。
會被索引的前提條件
格式本身不是障碍,可讀性才是。抓取到的文档需要有可提取的正文,纯掃描件的图片型 PDF 往往只能按图片處理。文件也不能過大,否則抓取工具可能中途放弃。此外,同一份文档如果有多個 URL 版本,比如带參數、带版本号、重复上传,索引同样會被拆散。
判断一份文档值不值得進索引,有個简單标准:把它單獨放進搜尋结果里,用戶点進去能否直接得到答案。如果它只是表單附件或内部流程文件,通常不需要占用索引位置。
用响應头控制收錄
HTML 頁面可以用 meta robots 声明,非 HTML 资源没有 head 区域,只能依赖 HTTP 响應头。给 PDF 返回 X-Robots-Tag: noindex,可以让它繼續留在被連結的頁面里供人下载,但不進入索引。内部资料、试用版白皮书常用這個做法。
robots.txt 管的是能不能抓,X-Robots-Tag 和 noindex 管的是能不能進索引。两者不是一回事,混用容易出現「屏蔽了但结果里還看得到」的困惑。
自查清單
- 文档 URL 是否稳定,有没有重复上传造成的多個版本。
- 重要的 PDF 是否有 HTML 落地頁承接訪問,避免用戶直接落到文件上。
- 不该公開的文档,是否同时做了抓取屏蔽與 noindex。
- 图片是否有描述性的 alt 文本和可讀的文件名,而不是 img001。
- 视频是否有可抓取的播放頁,而不是只靠脚本動態加载播放器。
一個常见誤区
有人發現不该被收錄的 PDF 就直接删掉,结果原連結變成 404,外部引用也失去着落。更稳妥的顺序是先加 noindex,等它從索引中淡出,再决定是否下线。索引更新需要時間,這一点和普通頁面没有区別。
最後提醒一句:资源被索引只是第一步,能不能带来訪問,取决于它有没有解决一個具体問题。文档本身不解决問题,收錄得再多也没有意义。