网站收录

PDF、图片、视频也会进索引:非 HTML 资源怎么管才不乱

蜘蛛不只抓 HTML 页面,PDF、图片、视频这些非 HTML 文件同样会被发现并进入索引。本文讲清它们通常从哪些入口被抓走,怎么判断哪些该留、哪些该清,以及 noindex、robots.txt 与直接删除分别适用于什么场景。

网站收录

PDF、图片、视频也会进索引:非 HTML 资源怎么管才不乱

很多人排查收录时只盯着 HTML 页面,其实索引里躺着相当一批非 HTML 文件:PDF、Word 或 Excel 导出件、图片、视频文件。它们不是被额外收进去的,而是蜘蛛在正常抓取过程中顺着链接发现、下载、解析后自行判断的结果。既然能被收进去,就同样需要管理——留着还是清掉,取决于它有没有资格出现在搜索结果里。

非 HTML 文件是怎么被发现的

蜘蛛并不区分链接指向的是 .html 还是 .pdf,只要服务器返回 200 和可识别的文件类型,就有机会被抓走。常见的发现入口有这么几类:

  • 内链直接指向文件,比如产品页挂了一份规格说明 PDF;
  • 上传目录、附件目录本身可以访问,蜘蛛顺着目录或列表页一路抓;
  • 站点地图里写了文件 URL,等于主动提交;
  • 下载站、文档分享站的外链,直接指向原始文件地址。

其中最容易失控的是上传目录。运营和销售随手传上去的文件,只要没做访问限制,就会随时间堆积,然后被逐个抓走。

能抓取,不等于应该被收录

这里要分清两件事:文件能被下载,说明抓取没问题;文件出现在搜索结果里,才是收录。文件进索引后有几个麻烦:正文往往缺少上下文,标题由解析器自动生成,摘要可能是文件开头的几行文字,展示效果通常比 HTML 页面差一截;如果同一份内容既有 PDF 又有网页版,两者还可能互相争位置。

判断标准很简单:这份文件是否面向外部用户、是否回答了某个具体问题、是否存在重复的网页版本。三个问题里有两个答不上来,通常就不该留在索引里。

图片和视频的收录逻辑略有不同

图片通常以独立条目进入图片搜索,页面上下文(alt、周边文字、文件名)会影响它被理解成什么;视频则更依赖承载它的页面是否可抓取,如果播放器必须点击或登录才加载,蜘蛛往往只能看到一个空壳。

  • 图片:文件名和 alt 写清楚这是什么,别用 IMG_2043 这种;同一张图尽量不要在多处重复上传出多个地址。
  • 视频:让页面本身包含可读的文字说明,配合结构化数据标注,而不是把信息全塞进播放器里。
  • 文件型素材:只有在存在明确搜索需求时才主动放进索引,其余按目录规则统一处理。

让不该留的文件退出索引

  1. 优先彻底删除。文件不再对外提供,就直接删掉或返回 410、404,这是最干净的做法,索引会随之清理。
  2. 需要保留文件但不想被搜到,可以在服务器响应的 HTTP 头里加 X-Robots-Tag: noindex。这里的顺序要注意:不要先用 robots.txt 屏蔽,屏蔽之后蜘蛛看不到 noindex,文件反而可能继续留在索引里,只是没有摘要。
  3. 只针对某类目录,比如 private 上传目录,可以用 robots.txt 禁止抓取,前提是你本来就不希望这些 URL 出现,也不要指望 noindex 还能生效。
  4. 已经被收录的,处理完需要等一个周期,期间可以在站长平台提交移除请求作为过渡。

日常管理该做的几件小事

  • 定期用 site:你的域名 filetype:pdf 这类查询抽查,看有哪些文件已经被收了。
  • 给上传目录定规则:对外资料一个目录,内部资料另一个目录,只允许前者被抓取。
  • 站点地图里只写要收的页面和文件,不要图省事把整个上传目录塞进去。
  • 同一份内容的 PDF 和网页版二选一作为主版本,另一个做规范化处理或直接下线。

非 HTML 资源不会主动给你发通知,它们只会安静地出现在索引里。定期盘点一次,比等到搜索结果里冒出内部报价单再补救要省事得多。