站点运营里讨论收录,大多默认说的是 HTML 页面。但只要搜索蜘蛛能抓到的 URL,就不只有网页这一种。PDF 说明书、产品图、演示视频、压缩包,这些资源同样有自己的地址,也各自有被索引的可能。把它们当成“不算页面”放任不管,往往会在收录数据里留下说不清的缺口。
先分清:能被抓取、能被索引、能被展现
一件资源进入搜索结果,至少要过三关。第一,搜索蜘蛛要能通过站内入口或外链发现这个 URL;第二,服务器返回正常状态码和可识别的类型;第三,搜索引擎愿意把它当作独立结果呈现。很多非 HTML 资源卡在第三步,不是因为抓不到,而是因为搜索引擎认为它不值得单独占一个结果位。
抓取记录里有它,不代表索引里有它。判断资源收录情况时,先看抓取记录,再对照站内资源清单和搜索表现,不要只凭一次抓取就下结论。
几类资源的实际处理方式
HTML 页面
最常见也最完整,正文、标题、内链都能被解析,是收录的主体。
PDF 与 Office 文档
搜索引擎能读取其中的文字,所以一份结构清晰、有标题的 PDF 是有机会被单独收录的。但如果 PDF 只是页面内容的扫描图,或者正文散乱、没有文字层,收录价值就很低。更稳妥的做法是:页面上先放一段 HTML 摘要,PDF 作为附件链接,让用户和搜索引擎都有选择。
图片
图片一般通过图片搜索收录。影响它的是文件名、alt 文本、周边正文和自身尺寸、格式。图片通常不会替页面本身占一个普通搜索结果的位子,所以不要指望用图片去补页面的内容缺口。
视频
视频页面的收录取决于周边文字描述是否充分。只有播放器、没有文字说明的页面,搜索引擎很难判断主题。封面图、时长、简介都有帮助。
资源类 URL 的规范同样重要
- 同一份文件被复制到多个目录,会产生多个可访问 URL,建议保留一个主地址,其余用 301 或 canonical 归拢。
- 下载链接不要带一堆跟踪参数,否则同一文件会以多种写法被反复发现。
- 资源 URL 尽量可读,文件名用英文或拼音,避免纯数字哈希,便于人工排查。
- 被替换掉的旧文件应返回 404 或 410,而不是继续返回 200 的旧内容。
一个可以照着走的自查顺序
- 列清单:把站内所有非 HTML 的资源类型和相关 URL 明确出来。
- 看状态码:确认返回 200、301 还是 404,别让失效文件长期返回 200。
- 看可读性:PDF 有没有文字层,图片有没有 alt,视频页有没有文字描述。
- 看入口:资源有没有站内链接可达,还是只能靠外链或直接输入地址访问。
- 看重复:同一文件是否存在多个 URL 版本,是否需要收敛。
- 看规则与响应头:是否被 robots 规则挡住,或返回了 X-Robots-Tag 之类的指令。
几个容易踩的坑
- 把整个上传目录放开访问:大量临时文件、缩略图、备份文件被搜索蜘蛛发现,稀释了真正需要收录的 URL。
- 认为图片和 PDF 不用管:它们出问题时,占用的仍是同一份抓取资源。
- 把资源收录当成页面收录来考核:两者的口径、展现位置都不同,混在一起统计会得到误导性的结论。
回到站点运营的角度,非 HTML 资源的收录更像是一次清理:哪些文件值得被找到,哪些只是过程产物。把不值得收录的挡住,把值得收录的配上文字说明和稳定地址,收录数据的口径才会干净起来。