一句话定义
多模态(Multimodal)指的是模型能接收或生成多种形态的信息——文本、图像、音频、视频——并在同一个语义空间里处理它们。
关键不在于「能上传图片」,而在于图片和文字是否被映射到同一套表示里。如果做到了,模型就能回答「这张图里的产品说明和文档里写的参数是否一致」这类跨模态问题。
为什么重要
人类获取信息本来就不是纯文本的。把图片、语音、屏幕操作纳入模型输入,等于把大量此前无法被程序处理的信息变成了可计算的对象。
这也是 Agent 能操作软件的底层原因:模型需要「看懂」屏幕上有什么,才能像人一样点击。反过来,理解多模态的边界,也能帮你判断哪些产品演示是真实能力,哪些只是拼接了多个专用模型。
三种实现路径
- 拼接式:用独立的识别模型把图像转成文字,再交给语言模型。实现简单,但会丢失视觉细节。
- 统一编码:用视觉编码器把图像变成与文本 token 同一空间的向量,直接送进语言模型。这是当前主流做法。
- 原生多模态:从预训练阶段就混合多种模态训练,能力最自然,成本也最高。
实际能力与限制
| 能力 | 现状 |
|---|---|
| 图像理解与描述 | 成熟,可稳定用于生产 |
| 图表与文档解析 | 基本可用,复杂表格仍会出错 |
| 图像生成 | 成熟,但可控性依赖工具链 |
| 视频理解 | 可用,长视频与精细时间定位仍是弱项 |
| 语音实时交互 | 延迟已接近可用,成本是主要约束 |
常见误解
- 「能看图的模型就能做视觉推理」:识别和推理是两件事。模型可能看清了图却算错数。
- 「多模态等于更强的模型」:加入模态通常会在某些纯文本任务上带来轻微损失,这是能力分配的取舍。
- 「视频就是多帧图片」:时间维度上的因果与动作理解,不是逐帧描述能覆盖的。
延伸阅读
- Embeddings:跨模态统一表示的技术基础
- Agent:多模态最重要的应用场景之一