搜尋引擎索引的内容不只有 HTML 頁面
做收錄自查时,很多人的注意力只放在網頁上:頁面有没有被抓、有没有進索引。但搜尋结果里出現的並不都是 HTML 頁面,PDF、DOC、PPT、图片甚至视频文件都可能單獨以一條结果的形式出現。它們各自有獨立的 URL,也各自有獨立的索引狀態,所以只看主站頁面的收錄數量,會漏掉一部分實际情况。
哪些非 HTML 文件可能進入索引
- PDF:产品手册、說明书、白皮书、报告最常见。
- DOC、DOCX、PPT、XLS:公開的文档目錄下经常被收錄。
- 图片:图片搜尋是相對獨立的体系,頁面被收錄不等于图片被收錄,反過来也一样。
- 视频:單靠文件本身通常不够,還需要可被讀取的标题、描述等上下文。
這些资源只要有公開可訪問的 URL 並被連結引用,就有机會被抓取。至于能不能進入索引,還要看内容能否被解析、有没有獨立價值。
PDF 被收錄的前提:文字能被提取
掃描件生成的图片型 PDF,本质是一張張图,文字层是空的,抓取端讀不到正文,即便被抓到也很难進入正常索引。反過来,由排版软件導出的、带完整文字层的 PDF,通常可以被正常解析。判断方法很简單:在 PDF 里用 Ctrl+F 搜尋一句正文,如果能選中並搜到,說明有文字层。
文件類型声明也常被忽略
服務器返回的 Content-Type 如果是 application/octet-stream 這類通用類型,抓取端可能無法確認文件究竟是什么,處理方式會更保守。用正确的 MIME 類型返回 PDF 和图片,是基础但容易漏掉的一步。
图片索引和頁面索引是两回事
頁面進了索引,图片未必進;图片能搜到,頁面也未必被收錄。图片是否被索引,通常和這些因素有關:图片 URL 是否稳定可訪問、所在頁面是否被抓取、周邊文字和 alt 是否提供了足够上下文、图片有没有被其他頁面引用。
把图片当作獨立的 URL 来管理,比只盯着頁面更容易理清問题:它有自己的地址,也可能有自己的索引狀態和失效狀態。
不想被收錄的非 HTML 文件怎么處理
- 優先使用响應头 X-Robots-Tag: noindex,它對 PDF、图片這類非 HTML 文件同样有效。
- robots.txt 里的 Disallow 只阻止抓取,不保證已经收錄的 URL 登出索引,两種手段不要混用。
- 把不打算公開的文档、原始图片放進需要登入才能訪問的目錄,從訪問權限上隔离。
- 定期用站内搜尋或图片搜尋,检查有没有舊版本文档、内部资料被公開索引。
希望被收錄的非 HTML 资源该做什么
- 确保文件本身可解析:PDF 有文字层,图片格式常见且没有過度压缩。
- 给文件一個可讀的 URL 和标题,文件名不要是乱碼或纯编号。
- 在相關 HTML 頁面里用文字連結指向它,让它在站内结构里有一個明确位置。
- 决定是否放進 sitemap:如果把它当作正式内容對外提供,纳入统一管理會更清晰;如果只是下载附件,不必强求。
自查顺序
- 先確認這類资源有哪些公開 URL,整理成一份清單。
- 逐個測試能否直接訪問、返回什么内容類型、PDF 能否選中文字。
- 用站内搜尋和图片搜尋確認哪些已经出現在结果里。
- 区分「想公開」和「不想公開」,前者补充上下文和内鏈,後者用响應头或權限處理。
- 把结论记錄下来,下次改版时一並核對,避免舊文件長期留在索引里。