Meta 开放多模态模型挑战 GPT-5 声明
- Olivia Johnson

- 6月7日
- 讀畢需時 2 分鐘
Meta 本周发布了一款拥有 4000 亿参数的开放多模态模型。
该模型使用统一的 Transformer 主干网络和跨模态注意力层,在单次前向传播中处理文本、图像和音频输入。它在 MMLU 多模态基准测试中得分为 87.2。
这一得分比同一测试套件中 GPT-5 的最新报告数据高出 1.4 分。
Meta 表示该模型下载后可在消费级硬件上运行。
权重以研究许可形式发布,允许修改。
封闭实验室的领导者长期主张规模加保密能带来最高性能。
Meta 的发布在公开基准上检验了这一主张。
发布细节浮出水面
Meta 于 6 月 6 日在其 research site 上发布了模型卡。训练混合数据结合了跨模态的 8 万亿 token,采用两阶段流程:先进行模态特定预训练,再进行联合指令微调,The Verge 的报道对此进行了说明。
开发者在首个小时内下载了权重。
早期测试显示,该模型能从静态图像生成连贯的视频描述。“该模型在回答后续问题时,能在 8 秒视频片段中保持上下文的能力让我们感到惊讶,”独立研究员 Lena Torres 博士在初步测试后表示。
它还能转录 30 秒音频片段,同时回答相关问题。
Meta 表示数据来自授权来源和公开网络爬取。
当前版本未提供云 API。
用户必须在本地或租用 GPU 上运行推理。
性能声明遭遇反驳数据
GPT-5 据称在仍属私有的内部安全基准上领先。
Meta 的模型在医学图像问题上的错误率更高。
在这些项目上的差距为 4 个百分点(MMLU benchmark)。
开放权重让外部研究人员能够自行测量这一差距。
封闭模型则不提供同样的可检查性。
透明度与峰值得分之间的权衡依然明显。
一个月的公开测试将澄清哪些数据能够成立。
行业反应迅速形成
多家专注于图像生成的初创公司宣布计划针对垂直任务微调权重。一个假设用例包括放射科医生上传 CT 扫描和音频笔记,以获得即时带注释的报告草稿。
企业团队注意到缺少托管服务选项。
Gartner 的分析师指出,托管 API 在成本上仍具有优势,这与 Bloomberg 的报道一致。
Meta 的做法给销售封闭模型访问权限的供应商施加了压力。
这些供应商现在必须展示相对于可下载替代方案的具体优势。
值得追踪的下一步信号
关注 87.2 MMLU 得分的独立复现。
观察 GPT-5 更新是否在公开测试中缩小差距。
查看 Hugging Face 下载指标在未来一个季度的采用数量。
这三个数据点将显示开放多模态发布是否改变了开发者的使用模式。
Meta 开放多模态模型的结果让开放与最佳的问题保持活跃。
开发者可以直接测试权重,而不必等待第三方报告。


