站点的 URL 并不只有页面。PDF 说明书、白皮书、产品图纸、图片、音视频、压缩包,这些文件同样带着完整的 URL,蜘蛛一旦顺着链接走到就会抓取。其中一部分会进入索引,甚至能直接在搜索结果里被搜到。做收录管理时把这些资源一起考虑,比只盯 HTML 页面更接近真实情况。
被抓到和进索引是两件事
蜘蛛对一个文件的处理流程,大致是:发现 URL、抓取、判断是否值得保留为可检索结果。多数技术文件(CSS、JS、字体、接口返回的 JSON)会被抓取,但不会作为独立结果进入索引;而 PDF、图片这类有内容可读的文件,则有更大概率被编入索引。判断的关键通常落在这几点上:
- 可访问性:返回 200,且没有被 robots.txt 挡住;
- 可解析性:搜索引擎能从中提取文字或视觉内容,而不是一堆二进制;
- 独立 URL:文件有稳定地址,不是每次访问都变的临时链接;
- 可理解的上下文:文件名、标题、所在页面的文字,能说明这个文件是什么。
PDF 与文档附件的三类常见问题
1. 同一份文档存在多个 URL
文档多次改版、多个栏目各上传一份、带跟踪参数的下载链接被外链引用,都容易让同一份 PDF 出现好几个地址。这些地址若都能访问、内容又一致,就属于重复内容,容易让索引里出现多个版本。处理方式通常是保留一个规范地址,其余做 301,或者至少用 canonical 指明首选版本;历史留存的旧文件,确认不再需要后可以直接下线。
2. 附件内容与页面内容高度重叠
常见的情况是:页面本身已经写清了全部要点,又额外放了一份内容几乎相同的 PDF 下载。此时 PDF 很难成为独立的检索结果,反而可能被当作重复内容。如果这份文档只是给用户留档用,可以考虑不让它进索引(例如对附件目录设置 X-Robots-Tag: noindex),把索引位置留给页面本身。
3. 缺少入口和上下文
有些文档只存在于服务器目录里,靠 sitemap 或历史外链被蜘蛛发现,页面上没有任何链接指向它。这类文件即使被抓到,也缺少标题、摘要所需的信息,收录后效果通常不理想。更稳的做法是在相关页面里加上自然入口,用一两句话说明文档内容,而不是单纯甩一个下载链接。
图片与媒体文件的处理
图片走的是图片搜索的索引通道,规则和网页不完全一样,但有几件事是共通的:
- 文件名使用可读的英文或拼音,避免 IMG_2031 这类无意义命名;
- alt 属性描述图片内容,而不是堆关键词;
- 图片所在页面的正文与图片主题相关,图片才会被放进合适的上下文;
- 大尺寸图、懒加载图要保证蜘蛛能拿到真实地址,避免一张图只有占位符;
- 图片数量多的站点,可以用图片 sitemap 辅助发现。
该不该让附件进索引:一份检查清单
并不是所有文件都值得进索引。判断时可以按顺序问自己几个问题:
- 这个文件有没有独立检索价值?用户会不会专门搜索它的内容?
- 它和站内已有的页面、文档是否重复?
- 它有没有稳定的 URL 和可读的标题?
- 它有没有来自页面的自然入口,而不是孤立的地址?
- 更新频繁的文件,旧版本是否应该下线或重定向?
如果以上大多是否定答案,让它保持在“可被抓取但不必进索引”的状态,往往更干净。实现方式主要是 robots.txt 限制抓取、X-Robots-Tag: noindex,或对附件目录做统一策略,而不是逐个文件处理。
把非 HTML 资源当成 URL 生态的一部分来管理:该保留的保留,该合并的合并,该挡在索引外的明确挡住。资源目录理顺之后,蜘蛛抓取的重点也会更集中到真正需要被搜到的页面上。