什么是多模态 AI?模型如何同时处理文本、图像、音频和视频
- Aisha Washington

- 6月5日
- 讀畢需時 4 分鐘
多模态 AI 模型将文本、图像、音频和视频结合在一个网络中,因此系统可以同时跨不同输入类型进行推理。这些模型不同于早期仅处理一种数据的系统。它们现在出现在文档阅读器、语音助手和视频编辑器中。
多模态 AI 模型之所以重要,是因为许多日常任务需要不止一种数据类型。一次会议可能产生幻灯片、语音和笔记。医疗记录可能包括扫描件、报告和音频口述。接受多种输入的模型减少了在不同工具之间切换的需求。
关键要点
多模态 AI 模型在一次前向传播中接受文本、图像、音频和视频。
融合可以发生在早期、晚期或整个网络层中。
当前模型仍难以处理长视频和细微的音频线索。
实际用途已包括文档搜索、会议摘要和视频字幕。
什么是多模态 AI 模型
多模态 AI 模型是经过训练的系统,能够在同一网络中接受并关联多种数据类型。因此,主要关键词多模态 AI 模型指的是无需单独管道即可处理文本、图像、音频和视频的架构。
这些模型由三个属性定义。首先,它们共享一个联合嵌入空间,因此每种模态都映射到同一向量空间。其次,它们使用注意力机制,将一种模态的 token 与另一种模态的 token 进行比较。第三,它们生成可以混合模态的输出,例如引用图像区域或视频帧的文本答案。
这些特性让单一模型能够回答关于照片的问题、描述视频片段,或在转录语音的同时阅读随附的幻灯片。
多模态 AI 模型如何工作
目前存在三种主要的融合策略。每种策略都会改变不同模态信息相遇的时间和方式。
早期融合让原始输入保持紧密
早期融合在主网络层开始前就连接数据。图像被标记化为补丁,音频波形变成频谱图补丁,文本保持为 token。所有补丁从第一层开始进入同一个 transformer 堆栈。当模态共享强烈的空间或时间对齐时,这种方法有效。
晚期融合先处理单独的编码器
晚期融合先让每种模态通过自己的编码器运行。文本使用语言编码器,图像使用视觉编码器,音频使用专用音频编码器。只有最终嵌入在交叉注意力块中相遇。这种方法对长输入的扩展性更好,因为每个编码器都可以单独优化。
混合融合结合两种方法
混合设计对短对齐片段应用早期融合,对较长或松散相关的片段应用晚期融合。GPT-4o 和 Gemini 1.5 都使用这种模式的变体。模型会根据任务内部决定强调哪条路径。
当前限制包括长视频的二次注意力成本,以及在细粒度音频差异(如说话者情绪)上的较弱表现,正如 Google Research 博客中关于高效 transformer 的说明。研究仍在继续探索稀疏注意力和模态特定压缩以降低这些成本。
GPT-4o 在 VQAv2 上达到 88.7%,在 ActivityNet-QA 视频问答上达到 63.3;Gemini 1.5 在 EgoSchema 上报告 70.8%。更深入的技术评论请参阅 this overview of multimodal models(来自 The Verge)和官方 Gemini 1.5 technical report。
真实世界应用
文档理解工具现在使用多模态模型来回答关于图表、表格和扫描页面的问题。用户上传 PDF 并获得直接答案,无需手动数据输入。例如,用户打开 NotebookLM,上传一份 40 页的研究 PDF,输入“提取第 12-18 页表格中的所有数值结果,并标记与摘要相差 >10% 的结果”,然后在一次响应中收到带引用的表格和来源引用。
语音界面将语音输入与屏幕上下文结合。用户可以将手机摄像头对准设备,并用自然语音询问故障排除步骤。
视频分析平台生成摘要和可搜索的转录。编辑人员可以通过描述场景或引用口语来搜索数小时的素材。
这些示例展示了单一模型如何取代多个专用工具。
多模态 AI 模型的实践
Claude 3.5 通过首先将页面渲染为图像,然后应用其视觉编码器提取布局、表格和方程式,再将结果与任何附加文本提示结合来处理 PDF。ElevenLabs 通过将音频波形与对话历史嵌入一起编码来处理语音加上下文,从而使韵律与正在进行的对话匹配。在个人知识工具中,remio 对多模态输入采取轻量方法,将捕获的文件和录音存储为单独的索引对象,而不是训练自己的联合嵌入模型。用户获得跨来源的统一搜索,而繁重的多模态训练仍由更大的基础系统完成。
关于多模态 AI 模型的常见问题
Q: 多模态训练与单模态训练有何不同?
A: 训练数据必须包含跨模态的对齐示例,以便模型学习对应关系而非孤立模式。
Q: 多模态模型可以在消费级硬件上运行吗?
A: 较小的蒸馏版本适合近期笔记本电脑,但全尺寸模型仍需要云 GPU。
Q: 当一种模态缺失时会发生什么?
A: 大多数当前模型会回退到可用模态,但当关键上下文缺失时,准确率会下降。
Q: 使用实现多模态 AI 模型的工具时,我的数据安全吗?
A: 安全性取决于部署方式。本地处理将文件保留在设备上,而云 API 会将数据发送到远程服务器。
Q: 哪些工具已经使用了多模态 AI 模型?
A: 商业示例包括 GPT-4o、Gemini 1.5 以及多个文档和视频平台。


