top of page

Meta Muse Spark 标志着与 Llama 战略的决裂

Meta 上周发布了 Muse Spark。该模型仅在公司服务器内运行。这是 Meta 首次将主要系统完全私有化。

此举逆转了此前关于 Llama 发布的承诺。分析师现在质疑开源推动是否只是暂时的。

发布日期与核心规格

Muse Spark 于 6 月 8 日推出。Meta 仅使用内部数据对其进行训练。该模型支持 128k 上下文令牌。

公司工程师确认不会公开权重。访问仅限于获批的合作伙伴。这一步骤让追踪 Llama 发布的观察者感到意外。

Muse Spark 的开发历时 11 个月,采用混合专家架构,尽管总参数超过 2000 亿,但每个令牌仅激活 320 亿参数。训练完全在 Meta 位于俄勒冈和德克萨斯的内部集群上进行,纳入了来自 Instagram Reels 和 WhatsApp 商业对话的匿名用户交互数据,以及授权的书籍和学术语料库。128k 上下文窗口支持跨企业报告或多小时对话历史的完整文档推理,无需分块,这是 Llama 3.1 在其开放版本中所缺乏的能力。

Meta 的内部基准显示,Muse Spark 在 MMLU 上达到 87.4%,在 HumanEval 上达到 79.1%,在专有安全对齐套件(衡量禁止类别的拒绝率)上达到 92.3%。这些数字在多个安全轴上超过 Llama 3.1 405B,同时在一般知识任务上匹配或超越它。然而,该模型无法在消费级硬件上运行;即使是量化后的 4 位版本也超过 180 GB VRAM,除了最大的研究集群外,本地执行对所有人来说都是不可能的。

额外的架构细节显示,混合专家路由器使用经过辅助负载平衡损失训练的学习门控网络,以防止专家崩溃。这种设计允许 Meta 在不增加推理成本的情况下扩展总参数,这一技术也出现在 Mixtral 8x22B 等模型中,但在这里完全通过封闭 API 执行。早期企业测试者报告的延迟测量值对于 2k 令牌提示平均为 210 毫秒,在类似硬件后端上与 GPT-4o 和 Claude 3.5 Sonnet 竞争。金融服务领域的早期采用者指出,扩展的上下文窗口消除了之前 Llama 合同审查工具所需的复杂文档拆分管道。

偏离开源战略

Meta 多年来将 Llama 定位为开放替代方案。Muse Spark 毫无预警地打破了这一模式。这一决定是在内部审查显示性能差距后做出的。

高管们将安全和控制作为理由。他们避免直接评论失去的社区信任。竞争对手实验室在公开帖子中注意到了这一变化。

这一转变反映了始于 2024 年底的更广泛重新校准,当时 Meta 的安全红队发现了针对 Llama 3.1 的几个可重现越狱,允许提取包含个人数据的逐字训练序列。行业记者获得的内部备忘录表明,继续开放发布可能面临欧盟人工智能法案对高风险模型的新兴监管风险。通过将 Muse Spark 完全保留在服务器端,Meta 获得了持续监控和在数小时内修补权重的能力,而不是等待社区驱动的分叉。

这与 Meta 先前的叙述形成鲜明对比。2023 年,CEO 马克·扎克伯格多次将 Llama 描述为封闭实验室的制衡力量,称开放模型将防止任何一家公司主导人工智能。Muse Spark 公告省略了对这些早期承诺的任何提及,而是强调企业级可靠性和“大规模负责任部署”。包括 Gartner 和 Forrester 在内的公司的行业分析师已经开始更新其供应商评估框架,将 Meta 视为混合提供商而非纯粹的开源倡导者,这一重新分类将影响未来 18-24 个月的采购建议。一个直接后果是,受监管行业的采购官现在在批准 Meta API 之前需要额外的法律审查,将销售周期延长约 6 至 9 周。

Meta 开放人工智能承诺的历史背景

Meta 向开放模型的转变始于 2023 年 Llama 1 在自定义非商业许可下发布,随后 Llama 2 和 Llama 3 的许可条款逐渐宽松。当时,该公司认为开放权重将加速科学进步并使前沿能力民主化。那一时期的内部市政厅会议上,高级研究人员认为围绕训练数据和评估指标的透明度将使 Meta 区别于 OpenAI 和 Google。因此,围绕 Muse Spark 的突然关闭不仅代表产品决策,也代表哲学上的逆转,许多前贡献者将其视为对三年连续 Llama 发布所建立的隐含社区规范的违背。

这一转变也反映了早期封闭实验室采用的策略。当 OpenAI 从 GPT-2 的分阶段公开发布转向 2020 年 GPT-3 的完全封闭模型时,它同样引用了安全和滥用担忧。Meta 现在使用类似的语言,同时坚持其较轻的开放模型将继续服务于研究社区,创造了一种双层叙述,这与 Meta 高管自己曾经批评的策略相呼应。路透社分析 强调了这一逆转如何与行业内的类似举措保持一致。

对先前承诺的压力

此次发布给 Meta 自己的研究团队带来了压力。构建 Llama 的团队现在面临新的限制。外部贡献者失去了直接模型访问权限。

Microsoft 和 Google 已经运行封闭系统。Meta 现在更接近这些群体。这一举措减少了其早期的差异化。

花费数月时间针对法律合同分析或生物医学文献摘要等特定领域任务优化基于 Llama 的微调的研究人员,现在必须将代码库迁移到新的托管端点。根据匿名员工帖子,Meta 的研究部门已将其 Llama 工程人力的约 40% 重新分配到 Muse Spark 基础设施工作。之前提交分词器改进或评估工具拉取请求的外部贡献者报告称,他们的 GitHub 问题已被归档且无回应。

在竞争方面,这一举措使 Meta 与 OpenAI 的 GPT 系列和 Google 的 Gemini 系列更紧密地对齐,这两者都保持完全封闭。然而,与这些组织不同,Meta 正是因为其开放发布而在开发者中建立了大量善意;这一信任储备现在面临快速消耗。Hugging Face 上几个著名的 Llama 微调项目已经发布通知,未来更新将针对 Qwen 2.5 或 Mistral Large 2 等替代骨干。

对开源人工智能生态系统的影响

这一决定对开放权重社区产生了直接的连锁反应。围绕 Llama 宽松许可构建工具(包括推理服务器、量化库和评估框架)的组织现在面临 Muse Spark 工作负载的相关性降低。与此同时,这一真空加速了人们对 AllenAI、EleutherAI 和新成立的 Hugging Face 集体模型计划等初创公司提供的完全开放替代方案的兴趣。公告发布后几周内发布的社区基准显示,领先的开放模型在标准排行榜上缩小了约 60% 的质量差距,尽管没有一个能匹配 Muse Spark 报告的安全拒绝分数。

llama.cpp 和 vLLM 等量化和推理项目正在将开发资源转向支持更新的开放模型。EleutherAI 的 GPT-NeoX 团队宣布计划发布专门设计用于对完全开放模型进行基准测试的更新评估工具,突显了对封闭前沿系统的防御性响应。与此同时,学术联盟正在汇集 GPU 资源,以在宽松许可下训练有竞争力的 100-200B 规模模型,将 Muse Spark 的关闭视为催化剂而非威慑。对于在这些变化中探索知识库策略的团队,remio 等资源提供了实用框架。

这一变化对用户的意义

开发者失去了本地微调的能力。企业客户获得了托管选项。较小的实验室失去了免费的基础模型。

Meta 为选定的研究团体提供 API 积分。这些积分带有使用上限和审查步骤。许多团队已经在寻找其他开放模型。

之前依赖 Llama 避免每令牌成本的初创公司现在必须为 Muse Spark API 使用预算,或转向 Mistral Large 或 Qwen 2.5 等模型。没有企业合同的学术实验室报告称,即使获得有限的研究访问也存在困难,尽管 Meta 公开声明学术合作伙伴将获得优先权。几所大学已经发布了迁移指南,指导研究人员转向完全开放的替代方案,包括通过第三方主机提供的 Llama 3.1 70B 或 Google 新发布的 Gemma 2。

竞争格局与市场定位

封闭发布重新定位了 Meta 在日益按访问模型细分的市场中的位置。出于监管或数据主权原因需要本地部署的公司现在对 Meta 的看法不太有利。相反,习惯于托管推理的组织可以访问据报道在安全基准上优于 Llama 3.1 同时在推理任务上匹配前沿封闭模型的模型。

Meta 的合作伙伴团队已经与金融服务和医疗保健领域的几家财富 500 强公司签署了协议。这些合作伙伴获得 4k 上下文查询低于 800 毫秒的保证延迟和专属客户经理,这些功能在历史上并未与 Llama 检查点一起提供。该策略与 Microsoft 在 Azure OpenAI 上的方法相似,表明 Meta 打算在之前由 OpenAI 和 Anthropic 主导的高利润企业 API 市场中占据一席之地。彭博社报道 详细介绍了早期企业采用趋势。

限制与风险

尽管性能有所提升,Muse Spark 仍引入了几个结构性限制。用户无法检查训练数据、修改安全分类器或审计版权材料的记忆。任何下游应用都继承了 Meta 的内容过滤器,一些早期测试者将其描述为对创意写作用例过于保守。由于该模型无法进行本地红队测试,对偏见或双重用途科学查询能力的独立评估仅限于 Meta 自愿披露的内容。

监管风险也在上升。欧盟AI法案部分根据参数数量和训练计算量对具有系统性风险的模型进行分类;Muse Spark 未披露的训练集群规模和数据量可能使其进入更高的审查层级。Meta 尚未发布与 Llama 版本相当的模型卡,这给必须进行合规性评估的欧洲部署者带来了不确定性。The Verge reported 报道了欧洲客户面临的潜在合规挑战。

实际影响与工作流程变化

之前在内部 GPU 上运行 Llama 推理的企业团队,现在必须设计新的检索增强生成管道,将每个查询路由通过 Meta 托管的端点。此转变需要更新身份验证流程、实现速率限制错误的重试逻辑,并建立满足内部隐私办公室要求的数据处理协议。较小的研究团体报告称,他们正在将预算从硬件采购重新分配到 API 额度,斯坦福大学附属的一个实验室估计,迁移后每月推理成本增加了 3.2 倍。

构建代理系统的开发者还必须调整工具调用模式。Muse Spark 公开了一种与现有 Llama 工具不兼容的新函数调用格式,需要在评估套件和生产编排层中进行代码更改。

Meta 模型组合的未来展望

Meta 并未排除未来分级发布的可能性,即某些安全调优的变体保持封闭,而较轻量的开放模型继续沿用 Llama 品牌。行业观察人士预计,该公司将以开放许可方式在较小规模上维护 Llama 3.1 和即将推出的 Llama 4 检查点,同时通过 Muse Spark API 独家提供前沿能力,从而保持有限的开放存在。这种双轨策略可以通过为实验提供开放途径来稳定开发者关系,同时通过托管访问将生产工作负载货币化。分析师预测,一旦更新的前沿模型问世,Meta 最终可能会以更宽松的条款发布 Muse Spark 的蒸馏“学生”版本,这与早期 Llama 迭代中观察到的模式一致。NYTimes coverage 探讨了开源社区的长期影响。

接下来值得关注的事项

关注下一季度 Llama 4 权重发布。跟踪 Muse Spark 访问的 Meta 合作伙伴公告。监控封闭模型使用的监管评论。

每个项目都将显示转变是保持狭窄还是扩大。早期合作伙伴反馈将揭示采用速度。

其他信号包括 Meta 是否开源内部使用的任何安全评估工具、Muse Spark 能力更新与 Llama 维护版本的节奏,以及欧洲监管机构是否对该模型的系统性风险分类展开正式调查。训练数据来源的持续透明度也将表明 Meta 对长期社区关系与短期企业收入目标的重视程度。

常见问题

Meta 是否会发布 Muse Spark 权重?

当前政策显示没有公开权重发布的计划。Meta 已表示,未来模型可能采用分级策略,部分变体保持封闭。

Muse Spark 与 Llama 3.1 在编码任务上相比如何?

内部评估显示在 HumanEval 和 LiveCodeBench 上有适度提升,这归因于在专有代码库上的额外后训练。

学术研究人员可以申请访问权限吗?

存在有限的学术计划,但需要详细的项目提案,并施加此前 Llama 版本中不存在的输出审查要求。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page