讨论收錄时,注意力常集中在 HTML 頁面上,但站点的 PDF 說明书、产品图、演示视频同样是可被抓取的 URL。它們進入的是不同的索引(網頁、图片、视频),展示位置、判断标准和治理方式都不太一样。
非 HTML 资源為什么會被抓取
爬虫判断的是 URL 是否可達、robots.txt 是否放行、响應是否正常,而不是扩展名。只要某份 PDF 或图片能被連結触達,它就是一個獨立的候選资源。区別在于入索引之後:
- 網頁索引:文本层完整的 PDF、HTML 附件可能被全文检索。
- 图片索引:取决于图片本身的清晰度、周邊文字和所在頁面主题。
- 视频索引:需要可訪問的播放地址、明确的标题和缩略图,视频站点地图有助于發現。
PDF 是最容易被忽略的一類
- 它是獨立 URL,母頁面上的 canonical、内鏈信号都不會自動轉移過去。
- 同一份文档上传到多個栏目,就會产生多個近似版本,形成重复内容。
- 掃描件没有文本层,即使被收錄也难以命中關鍵詞,收錄價值低。
- 舊版本文档長期在线,可能和現行頁面在搜尋结果里同时出現。
一個可操作的判断:用戶是否會主動搜尋這份文档?會,就让它可抓取,並在标题、文件名上寫清版本和用途;不會,只是頁面附件,就用 410、robots.txt 或 noindex 收口,別让它在索引里長期占位。
图片和视频的收錄前提
- 图片使用可解析的 img 标簽,而不是纯 CSS 背景图,src 是稳定的 URL。
- alt 與周邊正文用来描述图片内容,別堆關鍵詞。
- 视频提供可直接訪問的播放頁或文件地址,配好标题、时長、缩略图。
- 用图片、视频站点地图补充抓取入口,尤其是藏在深层的资源。
需要注意:图片或视频被索引,不等于所在頁面會被收錄;反過来,頁面没被收錄,图片也常常跟着進不了索引。两者相關,但不重合。
该不该放行:按用途分三類
- 有獨立搜尋需求:产品手册、研究报告、教程视频。保留抓取,做好标题與描述。
- 只是頁面附件:合同模板、表單下载、图集原图。随頁面存在即可,不必专门優化。
- 歷史遗留與重复版本:舊版文档、重复上传的图片。清理或屏蔽,避免稀释站点整体质量。
排查顺序建议
- 先用站点地图或服務器日誌整理出被抓取的非 HTML URL 清單。
- 按扩展名和目錄分组,看哪些目錄數量異常。
- 逐個確認是否被 robots.txt 拦截、是否返回 200、是否有可用文本层。
- 對比是否與現行頁面内容重复,决定保留、合並還是下线。
- 要保留的资源补内鏈和站点地图條目;不要的直接用 410 或屏蔽,给附件加 canonical 通常没有意义。
非 HTML 资源不需要“全部收錄”,也不该“一律屏蔽”。按用戶是否會主動搜尋来判断,比按文件類型一刀切更靠谱。
最後提醒一句:這類资源的收錄狀態在常規的頁面索引报告里往往看不全,需要在图片、视频索引或资源級查询中單獨核對。資料對不上时,先確認清楚你看的是哪一個索引。