AINotes 101
菜单
Learn / 01 理解 AI / Multimodal

Multimodal

多模态

模型同时处理文本、图像、音频、视频等多种形态的信息,而不只是文字。

UNDERSTAND #concept#capability

一句话定义

多模态(Multimodal)指的是模型能接收或生成多种形态的信息——文本、图像、音频、视频——并在同一个语义空间里处理它们。

关键不在于「能上传图片」,而在于图片和文字是否被映射到同一套表示里。如果做到了,模型就能回答「这张图里的产品说明和文档里写的参数是否一致」这类跨模态问题。

为什么重要

人类获取信息本来就不是纯文本的。把图片、语音、屏幕操作纳入模型输入,等于把大量此前无法被程序处理的信息变成了可计算的对象。

这也是 Agent 能操作软件的底层原因:模型需要「看懂」屏幕上有什么,才能像人一样点击。反过来,理解多模态的边界,也能帮你判断哪些产品演示是真实能力,哪些只是拼接了多个专用模型。

三种实现路径

  • 拼接式:用独立的识别模型把图像转成文字,再交给语言模型。实现简单,但会丢失视觉细节。
  • 统一编码:用视觉编码器把图像变成与文本 token 同一空间的向量,直接送进语言模型。这是当前主流做法。
  • 原生多模态:从预训练阶段就混合多种模态训练,能力最自然,成本也最高。

实际能力与限制

能力 现状
图像理解与描述 成熟,可稳定用于生产
图表与文档解析 基本可用,复杂表格仍会出错
图像生成 成熟,但可控性依赖工具链
视频理解 可用,长视频与精细时间定位仍是弱项
语音实时交互 延迟已接近可用,成本是主要约束

常见误解

  • 「能看图的模型就能做视觉推理」:识别和推理是两件事。模型可能看清了图却算错数。
  • 「多模态等于更强的模型」:加入模态通常会在某些纯文本任务上带来轻微损失,这是能力分配的取舍。
  • 「视频就是多帧图片」:时间维度上的因果与动作理解,不是逐帧描述能覆盖的。

延伸阅读

  • Embeddings:跨模态统一表示的技术基础
  • Agent:多模态最重要的应用场景之一

继续阅读

与 Multimodal 同属一个层级,或在本条目中被显式引用。