做收錄排查时,很多人預設“頁面”就是 HTML。實际情况是,PDF、图片、视频,甚至部分 Office 文档,都可能單獨出現在搜尋结果里。它們有獨立的 URL,遵循自己的抓取和索引規則,出問题时的表現也和普通網頁不太一样。
非 HTML 资源為什么會被收錄
只要资源有一個可訪問的 URL,並且返回正常狀態碼,爬虫就可能抓取它。搜尋引擎會判断這個文件能不能提取出文本、有没有作為獨立结果的搜尋價值,再决定是否放進索引。所以“被收錄”的前提不是文件類型,而是内容是否可讀、是否值得作為答案来源。
三類资源的處理重点不一样
PDF 與文档文件
- 能被索引的是可提取文字的 PDF;掃描件本质是图片,需要 OCR 才能被理解,效果並不稳定。
- PDF 的标题来自文件属性里的 Title 和正文首個标题,不少導出工具會直接填成文件名,值得手動检查一遍。
- PDF 更新比較麻烦:同一個 URL 替換文件内容後,索引可能需要重新抓取才會更新,重大改版建议換新地址。
- 如果 PDF 只是某個 HTML 頁面的下载附件,最好让 HTML 頁面承担收錄任務,PDF 作為补充。
图片
- 图片可以在图片搜尋里獨立出現,抓取的是图片文件本身,展示时依赖頁面上下文。
- 有意义的文件名、alt 文本、图片周围的說明文字,都會影响它被理解的程度。
- CDN 域名、防盗鏈、按需裁剪生成的動態图片地址,都可能影响抓取,建议確認這些地址是否允许訪問。
- 图片被抓到,不等于已经在图片搜尋里有位置,中間還有篩選环节。
视频
- 视频通常需要“视频頁面 + 结构化資料”配合,爬虫才能知道时長、缩略图、上传時間等信息。
- 视频文件本身一般不适合作為唯一入口,頁面才是承载流量和說明的地方。
- 嵌入第三方平台时,能被索引的往往是平台侧的播放頁,自己的頁面要把内容說明寫清楚。
想收錄:让资源有上下文,而不是孤立文件
常见的失誤是:文件上传後直接得到一條裸連結,站内没有任何頁面引用它。這類 URL 往往只能靠外鏈或 sitemap 被發現,抓取频率低,更新後也难以及时反映。更稳妥的做法是:
- 用 HTML 頁面承载說明、目錄和下载入口,文件作為頁面的一部分被連結。
- 連結文字寫清楚文件是什么,不要用“点击下载”這類没有信息的文字。
- 把重要的 PDF、视频頁面放進 sitemap,URL 尽量简洁,不带一長串跟踪參數。
- 同一份文件只保留一個正式地址,避免多個副本各自积累信号。
不想收錄:控制方式要選對
- HTTP 响應头是控制非 HTML 文件的主要手段,PDF、图片、视频都可以通過头信息传递“不要索引”的指令。
- HTML 里的 meta 标簽對 PDF 基本不起作用,不要指望在文件里加一行代碼就生效。
- robots.txt 只影响抓取,不负责把已经收錄的资源移出索引,两者目的不同。
- 需要彻底移除时,先確認返回狀態碼是否正常,再考虑用移除工具或調整訪問權限。
判断标准可以简單一些:這個文件是否值得用戶單獨点開,並且能獨立回答某個問题。值得,就给它一個規范的 URL 和必要的頁面上下文;不值得,就让它作為頁面的附属内容存在。
容易誤判的几種情况
- 搜尋结果里出現 PDF,不代表它一定在索引里,也可能是從某個頁面提取的摘要。
- 图片顯示在结果中,可能来自图片搜尋,也可能来自網頁的缩略图,排查方向並不相同。
- 日誌里看到文件被抓取,只是抓取记錄,不能当作收錄證據。
非 HTML 资源的收錄逻辑,本质和 HTML 頁面一致:有可訪問的 URL、有可理解的内容、有站内入口。区別在于可讀性的判断更依赖文件本身的结构,而“不想收錄”时的處理手段,更多依赖响應头而不是頁面标簽。按這個思路把站内的 PDF、图片和视频整理一遍,通常能减少一批“莫名出現在索引里”或“怎么都不收錄”的問题。