平时聊收錄,預設说的是 HTML 頁面。但搜尋引擎實际抓取和處理的文件類型遠不止這一種:PDF、Word、Excel、PPT、图片,甚至一些压缩包目錄,只要處在可抓取的位置,都可能被抓走並出現在索引结果里。這類文件往往没有明确的栏目归属,也很少有人专门去看它們的索引狀態,于是容易變成收錄里被忽略的一块。
非 HTML 文件會被處理,但呈現方式不一样
搜尋引擎抓取這些文件後,通常會做文本抽取或识別,把里面的文字變成可检索的内容。但它和網頁的差別在于:
- 没有 title 标簽、没有 meta description,索引里的标题和摘要多来自文件内部的标题、正文開头或元資料;
- 不參與站内導航,用戶往往是從搜尋结果直接進入文件,看不到你站点上的說明和上下文;
- 没有配图文字和结构化資料的辅助,检索表現一般和正常頁面不同。
所以,不要用看頁面收錄的那套标准去看這些文件。它們會在索引里,但不一定以你期望的样子出現。
图片:頁面收錄和图片收錄是两條线
图片進入图片搜尋,不代表它所在的頁面被收錄;頁面被收錄,图片也不一定被單獨索引。影响图片能否被單獨检索的因素包括:图片文件本身可抓取、有合适的 alt 和周邊文字、不是靠 CSS 背景或交互才加载出来的。
一個常见問题是:把關键信息做進图片里。比如參數表、價格表、流程图直接用截图。图片搜尋可能收錄這張图,但頁面正文里没有對應文字,頁面對相關關鍵詞几乎没有可讀内容,用戶也只能看图不能複製。
PDF 和 Office 文档:最容易被忽略的一類内容
這類文件通常由頁面直接連結,蜘蛛顺着連結就能拿到。文件里的文字會被抽取,成為可检索内容,于是它們實际上扮演了“頁面”的角色,但缺少頁面的管理手段。
常见的两個問题:
- 同一份文件有多個版本。比如命名里带着 v1、v2、final、最终版、修改版,几個 URL 同时存在,索引里可能都能查到相似内容。
- 文件被替換但地址没變。索引里保留的仍是舊内容。這属于重抓和刷新的延迟問题,不是收錄出的错,具体刷新节奏不由我們控制。
建议的做法是:一個主题保留一個 URL。舊版本如果還有外部連結,可以重定向到新版本;如果只是站内残留,直接從頁面和導航里移除,让抓取入口自然消失。
下载頁和文件直鏈,只留一套入口
很多站点既有介绍頁,又有文件的直鏈地址,两者都可能被抓到。介绍頁有說明文字、有上下文,直鏈只有文件本身,两者在索引里同时出現,内容上其實是重叠的。
取舍原則可以简單一点:如果希望用戶先看到說明,就主推介绍頁,文件直鏈只在頁面里出現一次,不在其他地方重复暴露;如果文件本身才是主体内容,那就让直鏈成為唯一入口,不再另做一個内容很薄的介绍頁。
几個容易被忽略的坑
- 内部文档、报價單、草稿 PDF 上传到了公開可訪問的目錄,又被蜘蛛顺着連結抓到;
- 图片或附件用了獨立域名或 CDN,但没有纳入 robots、sitemap 的管理范围,文件大量進入索引,和頁面對不上;
- 文件目錄允许列出目錄内容,蜘蛛可以逐层遍歷,把整個目錄里的文件都带走;
- 文件更新後索引里仍是舊版,被誤当成收錄異常去排查。
非 HTML 文件的收錄問题,多數不是“要不要被收”,而是“哪些本来就不该出現在可抓取的位置”。
自查的處理顺序
- 先用搜尋指令查一下自己域名下有哪些類型的文件被索引,PDF、Office 文档、图片各占多少,心里有個數。
- 翻服務器日誌,看被請求的 pdf、doc、xls、图片路径,区分哪些是正常對外内容,哪些是内部文件。
- 检查上传目錄是否可列目錄,是否有必要的訪問限制,避免蜘蛛整目錄遍歷。
- 整理同一主题的重复版本,保留一個 URL,其余重定向或下线。
- 對确定不该公開的文件,先下架文件本身,再處理索引层面的信号。
這些整理不會立刻带来收錄或流量上的變化,但能减少索引里出現無關文件和重复版本的概率。把非 HTML 文件纳入日常的收錄管理范围,長期看比事後清理省力得多。