什么是多模态

> 把不同形式的信息结合起来,一起理解和处理

**什么是模态**

模态就是信息的表现形式

  • 生活中常见的图片、视频,这些是视觉信息
  • 听到的音乐,声音,这些是听觉信息
  • 看到的文字,是文本信息
  • 摸到的冷热软硬,是触觉信息

这些不同类型的信息,都可以称为一种`模态`

**什么是多模态**

多模态就是同时利用`多种不同类型的信息`来认识和判断事物,举个简单的例子:判断一只小猫咪,如果只看外形,你可能觉得它长着尖耳朵、圆脑袋,毛茸茸,很像猫,但它也有可能是一个玩具。真正判断的时候,我们通常会同时参考很多信息:

  • 看它长什么样(视觉)
  • 听它会不会喵喵叫(听觉)
  • 观察它会不会跑、跳、蹭人、撒娇(行为)

当这些信息放在一起时,你就能很容易确定它到底是不是猫。其实在日常生活中我们每天都在这样做,只是平时没有注意到而已

**为什么要把多种模态结合在一起**

1. **判断更准确**:只看一种信息,有时容易出错。如果只听声音,可能以为是猫,结果一看图片,发现其实是一只狗。多种信息相互验证后,判断会更可靠
2. **理解更全面:** 现实世界本来就是由各种信息共同组成的,比如我们看电影,需要看画面,需要听对白,还要读字幕,还要去理解剧情走向,如果只保留一种信息,理解往往是不完整的
3. **操作更方便:** 以前编辑图片,往往需要手动调整很多参数,现在可以直接描述需求,把猫的毛变成橙色、或者把给这张照片换成下雪的背景、系统根据文字内容去理解图片中的对象,然后完成修改,对于普通人来说,这种方式更自然乜更容易上手

**总结**

模态就是信息的不同表现形式,例如文字、图片、声音等

多模态就是把这些不同形式的信息结合起来,一起理解和处理

人类天生就在使用多模态能力:看东西、听声音、读文字、感受环境

而现在的计算机也在逐渐学会把这些信息结合起来理解世界。这样不仅判断更准确,乜能完成越来越复杂的任务

在博客中打开这篇文章