站点里除了 HTML 页面,往往还有一批 PDF 报告、产品图片、Excel 模板、白皮书压缩包。这些文件的收录逻辑和普通网页不一样:能被下载,不等于能被索引;能被索引,也不代表会出现在网页搜索结果里。
一、先把非 HTML 内容分成三类
- 带文本层的文档:Office 导出的 PDF、纯文本、HTML 版说明文件,正文可以被程序读出来。
- 图片型文档:扫描件、拍照生成的 PDF、单张图片,没有可提取的文字。
- 压缩包与二进制文件:zip、exe、psd 等,内容对抓取程序基本不可读。
分类的意义在于:第一类有被收录的可能,第二类通常只能作为图片资源进入图片搜索,第三类很难独立获得索引,需要靠 HTML 页面来承载信息。
二、文档类文件被收录的前提
搜索引擎处理 PDF 时,会尝试提取文本层、读取文件标题元数据,再判断这份文件是否值得进入索引。几个常见的卡点:
- 文件是扫描图,没有文本层,程序只能看到一张图;
- 一份文件里塞了整套手册、合同、价目表,主题过于分散;
- 文件名是 final_v3_最终版.pdf 这类无意义命名;
- 文件体积过大,抓取时中途断开;
- 服务器对 /files/、/download/ 这类目录做了 robots 屏蔽,或者响应头里带了 noindex。
三、图片的收录入口和网页不同
图片多数情况下是作为页面的一部分被发现的,图片搜索是另一套入口。想让图片更容易被理解,可以从这几处入手:文件名用可读的描述、alt 写清楚内容、图片周围有相关文字、避免所有图片都堆在一个图库里没有任何上下文。图片本身很少单独出现在网页搜索结果中,所以不必为每一张配图都追求收录,更重要的是它所在的那个页面能不能被收录。
四、给重要文件配一个 HTML 入口页
这是比较稳的一种做法:不要只把文件丢在目录列表里,而是为它建一个正常页面,包含文件简介、适用场景、更新时间和下载链接。这样用户和搜索引擎都有机会先看到页面,再从页面进入文件。操作顺序可以按下面来:
- 确认这份文件确实有人会搜、会下载;
- 建一个 HTML 页,正文写清楚这份文件解决什么问题;
- 页面里放一个指向文件的普通链接,而不是 JS 触发的下载按钮;
- 检查文件名、目录权限、robots 规则和响应头,确认没有被误屏蔽;
- 在 sitemap 中列出这个 HTML 页面,文件本身是否需要单列,看实际需要。
五、哪些文件不必强求收录
价格表、内部模板、大体积安装包、带版权限制的资料,通常不指望通过自然搜索带来流量,也不必花精力去做收录优化,甚至可以用 noindex 或登录后下载的方式控制访问。判断标准很简单:这份文件如果出现在搜索结果里,对站点有没有正向价值。
抓取和收录是两件事:文件被下载了很多次,说明有人在用;但索引里没有它,说明程序没把它当成可独立呈现的内容。这两件事的排查路径不一样,先分清再动手。