很多站点把可索引资源都当成 HTML 頁面来看待,實际上入口頁上的連結经常指向 PDF、图片、视频、压缩包或安装包。這類目标 URL 的抓取和收錄逻辑與普通頁面並不一样,下面按常见情况拆開说。
搜尋蜘蛛會抓取非 HTML 资源吗
只要連結出現在搜尋蜘蛛能抓到的入口頁 HTML 里,且没有被 robots.txt、meta 或响應头屏蔽,蜘蛛通常會向该 URL 發起一次 HTTP 請求。這一步是抓取,不代表一定會被索引。對于非 HTML 资源,搜尋引擎往往只把它当作附件或媒体,是否進入索引、以什么形式展現,取决于资源類型、可解析程度以及它被引用的程度。
不同资源類型的實际差异
PDF 和常见文档格式
PDF、DOC、PPT 這類文档,主流搜尋引擎大多能提取正文並建立索引,有时會作為獨立结果出現。但它們的排名表現通常弱于同主题的 HTML 頁面,且更新、改版後重新抓取的频率也更低。如果文档是核心内容,建议同时提供一個 HTML 版本頁面,把文档作為补充。
图片和视频
图片一般進入图片索引,视频進入视频索引,和網頁索引是两套体系。能被抓到的前提是图片地址本身可訪問、没有被热鏈保護或 CDN 規則拦住。图片文件名、周邊文字、alt 属性會影响理解,但图片文件本身不能承载連結,所以它無法成為跳轉的中間跳板。
压缩包、安装包和大文件
這類资源多數不會被索引。蜘蛛可能只請求了响應头就放弃,也可能因為体积過大中途断開。它們還會明顯消耗抓取配額和带宽,把多個大文件連結堆在同一個入口頁上,容易挤占其他目标 URL 的抓取机會。如果並不希望它們被收錄,用 robots.txt 或 X-Robots-Tag 明确屏蔽,比放任被抓更省事。
容易被忽略的响應头细节
- Content-Type:返回正确的類型,返回 application/octet-stream 常被当成未知下载文件處理。
- Content-Disposition: attachment:强制下载的响應,部分抓取程序會当作下载行為,不再解析内容。
- X-Robots-Tag: noindex:只影响索引,不影响抓取,想连抓取一起挡住要配合 robots.txt。
- 狀態碼:返回 200 才正常。跳轉到登入頁、跳到首頁或直接 403,都會让抓取停在原地。
入口頁這一侧要注意什么
- 連結锚文本寫清楚资源内容,不要全是“点击下载”“查看附件”。
- 單個入口頁不要同时堆大量大文件連結,按主题拆分。
- 重要文档可以同时放進 sitemap,减少對入口頁抓取频次的依赖。
- 控制文件体积,能压缩就压缩,避免超时導致抓取中断。
用日誌做一次简單排查
- 確認入口頁本身是否被訪問,以及返回的是什么狀態碼。
- 確認该次抓取是否跟着請求了目标资源 URL。
- 查看目标 URL 的返回碼、Content-Type 和响應大小是否異常。
- 检查 robots.txt、响應头和站点的訪問控制有没有拦住它。
抓取和收錄是两件事,非 HTML 资源尤其如此。入口頁數量、連結投放在這里能起的作用有限,最终還是要看资源本身是否可訪問、可解析。
總结下来:非 HTML 资源會被請求,但不一定被索引;想让它有机會進入索引,前提是 URL 可正常訪問、類型声明正确、没有被規則屏蔽,並且内容本身有被引用的價值。把這些基础條件捋顺,比單纯增加入口頁數量更實际。