top of page

Meta 开放多模态模型挑战 GPT-5 声明

Meta 上周发布了新开放多模态模型的权重和训练细节。该发布直接检验了“只有像 GPT-5 这样的封闭系统才能达到顶尖性能”的说法。

该模型在一个堆栈中处理文本、图像和视频。早期基准测试数据显示,它在标准多模态测试中与 GPT-5 仅相差几分。已进行独立验证的实验室报告了相似结果。

Meta 表示该模型使用公开可用数据混合物加上授权语料库进行训练。 该公司发布了产生最终检查点的确切配方和缩放曲线。

发布细节和时间表

权重于 2026 年 6 月 7 日发布。Meta 同日发布了模型卡、评估日志和 120 页技术报告。任何获得批准访问权限的人都可以下载 1.2 万亿参数的检查点。

训练在 24,000 个 H100 GPU 集群上运行了 92 天。该计划于 3 月公开宣布并每月更新,这对于前沿规模的运行来说并不常见。研究人员现在可以检查产生最终权重的确切数据计划、学习率衰减点和检查点间隔。Meta 还发布了分词器配置和确切的数据过滤管道脚本,允许外部团队在自己的语料库上复制预处理步骤。这种透明度与以往封闭模型发布形成鲜明对比,在那些发布中,此类超参数仍属专有。

下载过程需要签署可接受使用协议,该协议禁止某些高风险应用,但允许学术和商业微调。发布后 72 小时内,已有超过 4,800 家获批组织开始下载检查点。主要镜像的带宽限制促使 Meta 在欧洲和亚太地区添加了三个额外的区域端点。每个镜像都带有加密签名,用户可以在将模型加载到 Hugging Face Transformers 或 NVIDIA NeMo 等训练框架之前验证完整性。

除了原始分发物流外,发布包还包含容器化评估脚本,可重现模型卡中报告的每个基准数字。这些脚本在单个 8-GPU 节点上运行,可在四小时内完成整个 MMMU 套件,降低了验证门槛。Meta 还开源了数据混合调度器,该调度器在 14 个不同来源的 18.4 万亿 token 语料库中进行平衡,并附带每个来源的 token 计数和每个训练阶段使用的采样温度。因此,外部团队不仅可以重现最终权重,还可以重现生成这些权重的数据构建管道。

迄今发布的基准数字

Meta 在 MMMU 上报告了 87.4%,在 MathVista 上报告了 84.1%,在 Video-MME 上报告了 79.8%。独立重现该设置的实验室发布的得分与这些数字相差在 1.2 分以内。

GPT-5 在这三个相同集合上设定的先前公开最高纪录分别为 88.9、85.3 和 81.2。因此差距小于营销叙述所暗示的。根据 The Verge 的报道,该开放发布已经改变了行业对前沿性能的预期。按子任务细分,该开放模型在 MMMU 的图表理解和图表推理拆分上匹配或超过 GPT-5,这些领域历来有利于具有更重专有图表预训练的封闭模型。在 MathVista 上,最大的剩余差距出现在需要多步空间操作的几何问题上,但绝对差异仅为 1.4 分。

Video-MME 得分显示出类似模式:两个模型在短片动作识别上几乎相同,而长形式叙事理解显示出 2.1 分的差距。这些细粒度结果很重要,因为它们表明性能差距集中在狭窄的能力子集中,而不是全面存在。几所大学团体已经发布了详细的错误分析,表明开放模型的错误通常可以通过适度的检索增强生成管道修复,从而进一步缩小生产环境中的有效差距。

模型卡中发布的其他基准包括 Ego4D 长视频问答的 76.3%、OCR-VQA 的 82.9% 和 DocVQA 的 91.4%。使用相同的 4-shot 提示时,开放模型在 Ego4D 上落后 GPT-5 3.1 分,但在 DocVQA 上超过 GPT-5 0.7 分。这些拆分强调,剩余差距集中在小时级视频的时间推理上,而不是静态文档理解上。

技术架构和训练创新

Meta 使用了更大比例的高质量合成字幕和交错视频文本数据。该公司还应用了新的混合专家路由层,每个 token 仅激活 30% 的参数。这两种选择都减少了每个训练 token 的计算量,同时保持了准确性。

该架构由 1.1 万亿参数的视觉语言主干加上 1000 亿参数的时间视频编码器组成。混合专家层使用 top-2 路由和辅助负载平衡损失,使所有 token 的专家利用率保持在 4% 以内。这一设计选择使 Meta 能够在消耗相当于相同参数数量的密集模型仅 62% FLOPs 的情况下训练 18.4 万亿 token。合成字幕管道结合了 Llama-3 生成的描述和人工评级质量过滤器,产生了大约 3.4 亿个高保真图像文本对和 7200 万个视频文本片段。

训练分三个不同阶段进行。第一阶段使用 4:1 的文本到多模态比率来稳定语言能力。第二阶段引入了从 8 秒到 120 秒片段的渐进式视频延长。第三阶段应用了最终 10% 的高质量合成数据混合,同时退火学习率。Meta 发布了所有三个阶段计划以及每个阶段的验证曲线,使其他实验室能够采用或改进课程。

视觉编码器本身采用 20 亿参数的 SigLIP 风格 ViT,具有 14 × 14 补丁大小和 1024 像素原生分辨率,后接一个 4 层 Q-Former,将 576 个视觉 token 压缩为 64 个潜在槽,然后馈入语言主干。这种压缩比对于将长视频序列拟合到 128k 上下文窗口而不会产生过高的内存增长至关重要。

与先前开放模型相比差距缩小的原因

封闭实验室一直将这些设计选择保密。开放发布使它们可见且可重现。早期的开放多模态系统(如 Llama-3.2-Vision 和 Qwen-VL-2)在 MMMU 上落后于 GPT-4 级模型 6–9 分,因为它们缺乏现在披露的合成字幕量和稀疏激活路由。通过发布确切的数据混合比率和路由器实现,Meta 实际上发布了一个配方,其他组织可以将其扩展到 2 万亿或 3 万亿参数,并获得可预测的回报。

独立重现尝试已经证实了 Meta 报告的缩放定律系数。一个由五所大学组成的联盟使用已发布的配方训练了一个 4000 亿参数的消融模型,并观察到 MMMU 得分在预测曲线的 0.8 分以内,这为性能改进源于方法而非未披露数据优势的说法提供了可信度。

与先前 Meta 多模态发布的比较

Meta 自己的 Llama-3.2-Vision 90B 模型在 2024 年底发布时在 MMMU 上得分为 72.4%。因此,新的 1.2 万亿参数系统代表了在约 18 个月内实现的 15 分绝对增益。主要驱动因素包括合成字幕覆盖率从 45% 跃升至 78%、混合专家层的引入以及视频训练 token 增加八倍。与模型卡一起发布的并排消融研究表明,这三个因素中的每一个都对最终 MMMU 提升贡献大致相等,使其他实验室能够优先考虑最具成本效益的改进。

行业反应和早期采用模式

几家初创公司已经开始针对领域任务微调权重。一家文档处理公司报告称,在两天持续预训练后,其内部检索基准提升了 14 分。

大型云提供商正准备在 API 后面托管该模型。一家提供商确认了公开发布后第一个月的容量预订。模型的微调运行正在 8×H100 节点上使用 4 位量化进行,将内存占用从 2.4 TB 减少到 620 GB,同时保留原始 MMMU 准确性的 98.7%。这种可访问性加速了无法承受大规模专有前沿 API 调用的中型公司的实验。彭博社报道称,企业兴趣在发布后几天内超过了内部预测。

学术团体正在将该模型用作新对齐技术的基线。斯坦福大学的一个团队发布了一个包含 120,000 条多模态指令的偏好调优数据集,并显示仅通过 18 小时额外训练,MMMU 就进一步提升了 1.9 分。开放权重和开放偏好数据的结合有望将多模态对齐研究的迭代周期从数月压缩到数周。对于构建内部知识系统的组织,remio 的 AI 原生第二大脑指南概述了将开放多模态检查点集成到可搜索团队存储库中的互补工作流。

对开发者和组织的实际影响

需要可重现多模态工作的开发者和团队现在有了一个具体参考点。该模型的 Apache-2.0 兼容许可允许研究和商业衍生作品,但仅受可接受使用限制。因此,组织可以将检查点集成到内部 RAG 管道中,微调领域特定适配器,并在消费级 GPU 上为边缘用例提供量化版本。

第一周出现的实际工作流包括在专有图像语料库上继续预训练用于医学成像、针对实时体育直播视频字幕的低秩自适应,以及将模型的视觉编码器与外部代码解释器结合的代理式工具使用微调。早期采用者报告称,混合专家结构允许仅对激活的专家进行选择性微调,与密集模型相比,适应成本降低了约 65%。

经济影响和成本建模

在公共云基础设施上托管全精度模型,按照当前 H100 容量的现货价格,成本约为每百万输入 token 18.40 美元。经过 4 位量化和专家剪枝后,推理成本降至每百万 token 4.10 美元,比 GPT-5 公布的 API 定价低约 30%。因此,每月运行 5000 万次多模态查询的企业可以实现超过 800 万美元的年节省,同时保留对数据驻留和定制的控制。这些数字假设持续利用率高于 60%;较低的利用率则倾向于使用无服务器封闭 API,直到需求扩大。9to5Google noted 指出,此次发布已促使多家云提供商修订其 GPU 定价层级。

仍存在的局限与风险

该模型在超过 30 分钟的长上下文视频推理方面仍有不足。安全过滤器比 GPT-5 更宽松,这促使一些企业团队在部署前添加自己的防护机制。

Meta 在模型卡中承认了这些差距,并将其列为开放研究项目。Meta 自身进行的红队测试发现,在拥挤场景中幻觉物体属性的比率较高,以及当视频提示描绘模糊社会情境时偶尔出现不安全建议。因此,处理受监管内容的企业正在叠加基于开放模型自身 logits 训练的额外安全分类器,在 batch size 1 时每推理增加 3–4 ms 的延迟。

当视频片段超过 45 分钟时,长上下文退化最为明显;叙事连贯性问题的准确率比 10 分钟片段下降 11 分。研究人员已在探索基于检索的记忆库来缓解这一局限,但需要一小时视频理解的生产系统在可预见的未来仍可能需要补充技术。

安全与伦理考量

Meta 的模型卡包含详细的风险分析,涵盖偏见放大、能力误用向量以及环境影响评估。92 天的训练运行消耗了约 4.1 GWh 电力,Meta 公布了这一数据,并附带第三方对其可再生能源匹配声明的审计。NYTimes coverage 强调环境透明度是行业的积极一步。开放发布虽然能让安全属性接受更广泛审查,但也降低了恶意微调的门槛。因此,Meta 发布了一组精选的拒绝示例和一个轻量级安全适配器,可在推理时应用且准确率损失可忽略。

民间社会组织欢迎这种透明度,但呼吁在高风险领域广泛部署前制定标准化的第三方审计协议。定于 7 月下旬进行的外部安全审计将提供首个关于越狱抵抗力和人口公平性的独立红队数据。

接下来值得关注的事项

首次外部安全审计报告定于 7 月下旬发布。红队分数若出现大幅下降,可能会减缓企业采用速度。

Meta 已承诺在 9 月前发布一个在额外 40% 视频数据上训练的后续检查点。如果该版本能弥补剩余的视频差距,开放与封闭性能的辩论将再次发生变化。观察者还应关注其他前沿实验室是否会发布类似技术报告,或继续坚持封闭开发。未来三个月的微调结果和审计发现将显示,开放权重在不依赖封闭 API 的情况下能将生产工作负载推进多远。

常见问题

该模型在报告基准之外的任务上与 GPT-5 相比如何?

早期用户报告显示,在大多数网页图像和短视频任务上达到持平,剩余差距主要集中在长形式叙事和专业科学图表推理方面。

该模型能否在单个节点上运行?

量化后的 4 位推理可在单个 8×H100 节点上以 batch size 4 和 1024-token 上下文运行;更长上下文或更高精度需要张量或流水线并行。

训练数据是否完全公开?

授权部分仍为私有,但 Meta 发布了每个数据源的确切 token 数量和过滤代码,允许拥有类似许可协议的组织进行近似重建。

官方支持哪些微调框架?

Meta 提供了针对 Hugging Face Transformers、NVIDIA NeMo 和 Megatron-LM 的参考脚本。社区对 Axolotl 和 Unsloth 的移植在发布后 48 小时内出现,并已展示出稳定的持续预训练运行。

混合专家设计如何影响延迟?

在 batch size 1 时,专家路由器与密集等效模型相比增加约 1.8 ms 的开销,但活跃参数的减少使模型加载到 GPU 内存后每 token 延迟净降低 42%。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page