平时聊收录,默认说的是 HTML 页面。但搜索引擎实际抓取和处理的文件类型远不止这一种:PDF、Word、Excel、PPT、图片,甚至一些压缩包目录,只要处在可抓取的位置,都可能被抓走并出现在索引结果里。这类文件往往没有明确的栏目归属,也很少有人专门去看它们的索引状态,于是容易变成收录里被忽略的一块。
非 HTML 文件会被处理,但呈现方式不一样
搜索引擎抓取这些文件后,通常会做文本抽取或识别,把里面的文字变成可检索的内容。但它和网页的差别在于:
- 没有 title 标签、没有 meta description,索引里的标题和摘要多来自文件内部的标题、正文开头或元数据;
- 不参与站内导航,用户往往是从搜索结果直接进入文件,看不到你站点上的说明和上下文;
- 没有配图文字和结构化数据的辅助,检索表现一般和正常页面不同。
所以,不要用看页面收录的那套标准去看这些文件。它们会在索引里,但不一定以你期望的样子出现。
图片:页面收录和图片收录是两条线
图片进入图片搜索,不代表它所在的页面被收录;页面被收录,图片也不一定被单独索引。影响图片能否被单独检索的因素包括:图片文件本身可抓取、有合适的 alt 和周边文字、不是靠 CSS 背景或交互才加载出来的。
一个常见问题是:把关键信息做进图片里。比如参数表、价格表、流程图直接用截图。图片搜索可能收录这张图,但页面正文里没有对应文字,页面对相关关键词几乎没有可读内容,用户也只能看图不能复制。
PDF 和 Office 文档:最容易被忽略的一类内容
这类文件通常由页面直接链接,蜘蛛顺着链接就能拿到。文件里的文字会被抽取,成为可检索内容,于是它们实际上扮演了“页面”的角色,但缺少页面的管理手段。
常见的两个问题:
- 同一份文件有多个版本。比如命名里带着 v1、v2、final、最终版、修改版,几个 URL 同时存在,索引里可能都能查到相似内容。
- 文件被替换但地址没变。索引里保留的仍是旧内容。这属于重抓和刷新的延迟问题,不是收录出的错,具体刷新节奏不由我们控制。
建议的做法是:一个主题保留一个 URL。旧版本如果还有外部链接,可以重定向到新版本;如果只是站内残留,直接从页面和导航里移除,让抓取入口自然消失。
下载页和文件直链,只留一套入口
很多站点既有介绍页,又有文件的直链地址,两者都可能被抓到。介绍页有说明文字、有上下文,直链只有文件本身,两者在索引里同时出现,内容上其实是重叠的。
取舍原则可以简单一点:如果希望用户先看到说明,就主推介绍页,文件直链只在页面里出现一次,不在其他地方重复暴露;如果文件本身才是主体内容,那就让直链成为唯一入口,不再另做一个内容很薄的介绍页。
几个容易被忽略的坑
- 内部文档、报价单、草稿 PDF 上传到了公开可访问的目录,又被蜘蛛顺着链接抓到;
- 图片或附件用了独立域名或 CDN,但没有纳入 robots、sitemap 的管理范围,文件大量进入索引,和页面对不上;
- 文件目录允许列出目录内容,蜘蛛可以逐层遍历,把整个目录里的文件都带走;
- 文件更新后索引里仍是旧版,被误当成收录异常去排查。
非 HTML 文件的收录问题,多数不是“要不要被收”,而是“哪些本来就不该出现在可抓取的位置”。
自查的处理顺序
- 先用搜索指令查一下自己域名下有哪些类型的文件被索引,PDF、Office 文档、图片各占多少,心里有个数。
- 翻服务器日志,看被请求的 pdf、doc、xls、图片路径,区分哪些是正常对外内容,哪些是内部文件。
- 检查上传目录是否可列目录,是否有必要的访问限制,避免蜘蛛整目录遍历。
- 整理同一主题的重复版本,保留一个 URL,其余重定向或下线。
- 对确定不该公开的文件,先下架文件本身,再处理索引层面的信号。
这些整理不会立刻带来收录或流量上的变化,但能减少索引里出现无关文件和重复版本的概率。把非 HTML 文件纳入日常的收录管理范围,长期看比事后清理省力得多。