top of page

Microsoft Source 揭晓 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,但生产环境成果更重要

7月24日
讀畢需時 14 分鐘

Microsoft Source 于 7 月 23 日推出了两款 MAI 模型变体,距离 Microsoft 预览其扩展后的自研模型家族还不到两个月。MAI-Image-2.5-Pro 面向精细的视觉创作,而 MAI-Voice-2-Flash 则面向高并发、对延迟敏感的语音应用。

在 Microsoft 说明其技术已经应用于哪些场景之前,这则公告看起来只是一次常规模型更新。Bing Image Creator 现在已完全依赖 MAI 图像模型。PowerPoint、OneDrive、Dynamics 365 Contact Center 和 Azure Voice Live 也已在生产环境中使用 MAI 模型。

这改变了竞争的核心问题。Microsoft 无须在每一项公开基准测试中击败 OpenAI 或 Google 的所有模型。它需要的是能够在 Microsoft 已经向数百万用户分发的产品中表现出色的模型。

因此,主要较量在于 Microsoft 的自研模型战略与继续依赖外部模型提供商之间的竞争。这些新版本提供了迄今最明确的证据,表明 Microsoft 希望进一步掌控模型质量、延迟、基础设施使用和产品集成。

Microsoft Source 在性能曲线的两端新增两款模型

这两款公开预览版将生产级 AI 划分为两类不同任务:追求最高图像保真度与追求最高语音效率。

模型发布详情将 MAI-Image-2.5-Pro 描述为 Microsoft 迄今保真度最高的图像模型。它专注于主视觉图像、精细编辑,以及在生成视觉内容中呈现更准确的文字。

这一定位十分重要,因为图像生成早已不再局限于创作精美的独立图片。营销团队越来越需要可控的修改、清晰可读的标签、稳定的布局,以及能够经受多轮编辑的素材。

一个模型或许能生成吸引人的首张图像,却可能在修改某个对象或替换标题时失败。这些失败会增加额外的审核周期,并削弱模型在生产工作流中的价值。

MAI-Image-2.5-Pro 的设计目标正好相反。Microsoft 表示,该模型能够理解自然语言编辑请求,并在修改过程中保留重要的视觉细节。

WPP Global 首席创意官 Rob Reilly 在 Microsoft 的公告中特别提到了文字渲染和自然语言编辑。他的评论将模型的技术主张与代理机构工作中常见的反复迭代联系了起来。

Microsoft 尚未发布足够的独立测试,无法确定 Pro 在处理这些任务时的一致性。不过,所选择的使用场景已经揭示了 Microsoft 想要进入的市场。

该公司并未将 Pro 定位为所有生成图像的默认选择,而是将其用于视觉错误可能造成重大创意或商业损失的场景。

MAI-Voice-2-Flash 采用了不同的设计目标。Microsoft 为需要频繁生成语音且必须在无明显停顿的情况下响应的应用构建了这款模型。

该公司表示,Flash 的运行速度是 MAI-Voice-2 的两倍,同时将运营成本降低了 32%。这些数据来自 Microsoft,尚未得到广泛的独立验证。

Flash 还力求保留更大模型的自然韵律。韵律指的是让生成语音听起来不那么机械的节奏、重音和语调。

仅凭速度无法打造实用的客服语音。一个速度快但语调平淡、读错姓名或打断来电者的模型,只会带来另一种运营问题。

这构成了此次发布背后的核心机制。Microsoft 正在构建模型家族,而不是强迫一个模型满足所有质量、速度和成本要求。

创意团队可以为显眼的营销活动素材选择高保真图像模型。联络中心则可以为数千路并发对话选择速度更快的语音模型。

这种产品战略与成熟的云计算实践相似。购买者会根据工作负载需求选择不同的基础设施配置,而不是期待一种配置在所有任务中都占据主导地位。

Microsoft Source 将这些新变体描述为质量、速度和成本曲线上的不同节点。这条曲线比任何一个产品名称都更重要,因为它解释了 Microsoft 计划如何服务不同的工作负载。

真正的重点是 Microsoft 的生产环境版图

Microsoft 正在将内部产品分发能力转化为模型开发优势,而独立 AI 实验室很难复制这种优势。

公告称,Bing Image Creator 现在已完全由 MAI-Image-2.5 提供支持。这使该服务成为 Microsoft 用内部开发的模型替代外部依赖的一个突出案例。

Microsoft 还表示,MAI-Image-2.5 负责 PowerPoint 中的图生图功能。图生图生成以现有视觉内容的构图或内容为输入,对其进行修改。

PowerPoint 是一个尤其有用的试验场。演示文稿用户通常需要适合商务用途的视觉内容,其中的文字应清晰可读、比例应可预测,并且要为幻灯片周围的其他内容留出空间。

一个成功的模型必须反复满足这些约束。一张令人惊艳的演示图像,无法提供与模型在广泛分发的生产力产品中持续使用同等有力的证据。

OneDrive 提供了第二个生产环境测试。Microsoft 表示,MAI-Image-2.5 已成为该存储服务中关键图像编辑场景的默认模型。

上线后,Microsoft 表示保存率提高了 26%。保存率衡量用户保留编辑结果的频率,是反映感知实用性的一个实际指标。

该公司还报告称,P95 延迟降低了约 25%。P95 延迟记录的是 95% 请求所经历的响应时间,其中包括许多较慢的情况。

Microsoft 表示,在中等利用率的工作负载下,OneDrive 部署实现了 2.5 倍的效率提升。这些结果仍由公司自行报告,但它们衡量的是用户行为和运营表现,而不只是审美偏好。

PowerPoint 给出了一项更为亮眼的基础设施数据。Microsoft 表示,在相关图生图工作中,与 GPT-Image-2 相比,MAI-Image-2.5 将 GPU 成本最多降低了 84%。

Microsoft 尚未公布该比较背后的完整工作负载配置。输出设置、流量模式、硬件或质量门槛方面的差异,都可能对基础设施结果产生实质性影响。

即便存在这一限制,该指标仍然表明 Microsoft 正在优化什么。该公司希望在自有服务中以更低的计算资源需求获得可接受或更优的产品质量。

语音领域也遵循相同的模式。MAI-Voice-2-Flash 已经为 Dynamics 365 Contact Center 提供支持,在那里,生成语音以相当大的规模服务于客户互动。

Microsoft 报告称,该环境中的 GPU 成本最多降低了 89%。同样,这一说法需要接受独立审查,并补充更多方法论细节。

但生产环境中的实际部署仍具有战略分量。联络中心语音在严苛的真实场景中同时考验延迟、清晰度、可靠性和运营成本。

Azure Voice Live 现在为语音到语音智能体提供 MAI-Voice-2-Flash。此类系统会听取语音输入、处理请求,并在持续进行的对话中返回生成语音。

每个组件都会增加延迟。因此,降低语音生成延迟可以改善整个交互过程,尤其是在一个智能体需要在一次通话中多次响应时。

这些部署为 Microsoft 带来了比一系列基准测试胜利更有价值的东西。它们能够产生产品遥测数据、失败案例,以及来自不同工作负载的直接反馈。

Microsoft 可以研究用户保存哪些图像、重复进行哪些编辑,以及语音交互会在何时出现问题。这些信息可以指导后续的模型训练和产品路由。

独立模型供应商可以通过 API 收集反馈,但它们通常无法像 Microsoft 那样直接观察生产力、存储、搜索和客服产品中的表现。

正因如此,最新的 Microsoft Source 公告比典型的公开预览更具分量。这些模型推出的同时,也伴随着一套不断扩大的内部评估和改进体系。

Microsoft 的自研模型给外部提供商带来压力

每当 Microsoft 能用内部优化的能力取代外部租用的能力时,压力就会落到外部模型提供商身上。

Microsoft 仍与 OpenAI 保持着紧密联系,外部模型也继续在其 AI 产品组合中发挥重要作用。这份新公告并不意味着双方已经完全分离。

相反,它表明 Microsoft 正在采取更加有选择性的模型战略。该公司可以在外部前沿模型具有明显优势的场景中使用它,而在其他地方使用 MAI。

这种灵活性改变了 Microsoft 的议价地位。一个可信的内部替代方案,可以降低单一提供商掌控某项重要产品功能的经济成本或路线图所带来的风险。

PowerPoint 中的图像对比具体展现了这种压力。Microsoft 表示,在该工作负载中,与 OpenAI 图像模型相比,MAI 模型大幅降低了 GPU 成本。

关键表述是“在该工作负载中”。一个模型在 PowerPoint 中胜出,并不意味着它自动成为所有开发者或创意应用的最佳图像模型。

然而,Microsoft 并不需要在所有方面都胜出。它只需要在足够多的特定工作负载中取得优势,就能证明将更多请求路由至自有技术是合理的。

该公司在 Build 主题演讲中介绍了横跨推理、编程、图像、转录和语音的七款模型,并阐述了这一发展方向。产品组合策略为 Microsoft 提供了多种替代外部推理服务的机会。

Google 构成了另一种竞争威胁。其图像模型在公开偏好排行榜上占据领先位置,并受益于 Google 产品及开发者平台的分发能力。

Microsoft 此前表示,MAI-Image-2.5 在一项图像编辑排行榜比较中超过了 Nano Banana 2。所引用的 Arena 分数显示,在测评时点的特定类别中,Microsoft 的模型排名更高。

随着新模型出现或评估方法演进,排行榜位置可能发生变化。它们也无法复现 PowerPoint 或 OneDrive 中的具体约束。

因此,更持久的竞争围绕反馈闭环展开。Google 可以从其消费者和生产力产品中学习,而 Microsoft 则可以从 Bing、Microsoft 365、Dynamics 和 Azure 中学习。

OpenAI 拥有强大的直接消费者使用规模和广泛的开发者基础,但它并未掌控一个能与 Microsoft 在文档、存储、演示文稿和联络中心领域的覆盖范围相匹配的企业软件产品组合。

Microsoft 的优势并不在于它必然能够训练出更好的模型,而在于它能够将模型置于用户熟悉的产品中,并以有意义的规模衡量结果。

这种分发能力也可能成为弱点。用户可能会在不了解新底层模型与先前模型行为有何差异的情况下,直接开始使用新模型。

企业团队需要可预测的质量、稳定的政策和明确的变更管理。如果切换模型会产生不一致的品牌素材或可靠性更低的对话,那么降低运营成本也毫无意义。

外部提供商仍然可以通过提供 Microsoft 内部无法匹敌的能力胜出。它们也能吸引那些偏好独立于单一云平台和生产力生态系统的模型的开发者。

因此,这场竞争并不是 Microsoft 与某一家知名实验室之间的较量,而是 Microsoft 的模型与产品一体化闭环,与对通用外部模型的持续依赖之间的较量。

MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 分别从两个相反方向强化了这一闭环。前者追求更高质量的可视化创意输出,后者则追求重复语音交互中的高效规模化。

质量、速度与成本之间的权衡就是产品本身

Microsoft 最重要的技术决策并非选择某一种架构,而是将工作负载拆分给具有不同预设运行特性的模型。

现有的图像模型卡将 MAI-Image-2.5 描述为一种基于扩散的生成模型。扩散模型通过逐步将噪声转化为连贯结果来创建图像。

该模型同时支持文本生成图像和受控图像编辑。Microsoft 将对象移除、替换、图像修补、文本更新和伪影清理列为其预期功能。

图像修补会重建图像中选定的部分,同时保留其周围内容。当用户只想进行一处针对性修改,而不是完全重新生成图像时,这项能力尤为重要。

模型卡显示,MAI-Image-2.5 拥有 200 亿个非嵌入参数,上下文长度为 32,000 个 token。它还说明,输出图像的像素总数最高可达 1,048,576。

这些规格适用于发布时可获得文档的基础 2.5 模型。Microsoft 尚未在新 Pro 版本的发布文章中提供同等程度的公开架构细节。

这一信息缺口限制了直接的技术比较。“最高保真度”这一标签描述了 Pro 的预期定位,但没有解释哪些架构或训练变化带来了所报告的改进。

Microsoft 表示,其图像模型使用干净、可追溯且达到企业级标准的数据,并且未通过第三方模型进行蒸馏。蒸馏是指利用生成的训练信号,将较大模型的行为迁移到较小模型中。

这一说法涉及模型独立性和数据治理,但并未披露完整的训练语料库,也没有解决与生成式图像相关的所有许可问题。

此次语音版本发布也存在另一个信息缺口。Microsoft 提供了速度和成本方面的比较数据,但公告并未发布针对 Flash 的广泛独立质量评估。

这一遗漏十分重要,因为语音质量取决于具体情境。简短的演示可能会掩盖听觉疲劳、发音错误、情感不一致,或长篇回复中的质量下降。

联络中心应用还会面临精心制作的样例很少涵盖的情况。来电者可能会打断对话、切换话题、使用地区口音、提供账号,并通过嘈杂的连接环境说话。

Flash 必须在这些条件下保持清晰易懂,同时快速响应。它的价值将取决于完整的智能体系统,而不仅仅是语音生成器。

这正是 Microsoft 采用模型家族策略在实践中合理的原因。速度较慢但表现力丰富的模型可以服务于旁白或高端体验,而 Flash 则负责频繁的事务性交互。

同样的原则也适用于图像。Pro 可以支持重要的核心素材,而其他 MAI 变体则可以处理草稿或大批量生成任务。

模型路由成为一种隐藏的核心能力。产品必须判断哪些请求值得投入更多计算资源,哪些请求则更需要快速响应。

开发者最终或许可以通过 Azure 手动做出这一决定。Microsoft 也可以根据任务类型、延迟目标或预期输出价值,在其产品内部自动执行路由。

这会带来运营复杂性。团队必须监控多个模型、比较输出质量、管理版本变化,并定义可接受的回退方案。

但它也能让模型行为与业务需求更加匹配。一个超大模型不再需要以相同的服务水平执行所有任务。

因此,Microsoft 战略背后的机制,是专业化与分发相结合。专业化提高工作负载的适配度,而分发则提供进一步优化这种适配度所需的数据。

Microsoft 的数据仍然无法证明什么

公司报告的效率提升支持 Microsoft 的战略,但并不能为质量、方法、安全性或客户选择等问题盖棺定论。

Microsoft Source 文章中最显著的说法来自 Microsoft 自有的产品环境。这提供了宝贵的实际运营背景,但也使独立复现变得困难。

所报告的 GPU 使用量降低 84%,取决于基准、硬件、流量、图像设置和质量阈值。Microsoft 尚未披露复现 PowerPoint 对比结果所需的全部因素。

Dynamics 365 的数据也存在同样的局限。降低 89% 听起来极具说服力,但读者无法确定其中有多少来自模型设计、部署变更或工作负载路由。

OneDrive 的结果更加均衡,因为其中包含用户行为和延迟数据。但更高的保存率仍然无法说明用户究竟更看重质量、速度、新颖性,还是界面变化。

Microsoft 还控制这些模型出现的位置以及请求到达模型的方式。即使底层模型的优势仍然有限,产品集成也能改善结果。

独立评估有助于区分模型质量和系统设计的影响。创意团队需要进行涉及品牌一致性、排版、多步骤编辑和复杂空间指令的测试。

语音客户需要涵盖打断处理、口音、姓名、数字、长时会话和嘈杂音频的评估。他们还需要了解有关语音克隆和冒充行为防护措施的信息披露。

此前对 MAI-Voice-2 的介绍强调了围绕语音样本适配的防护措施。Flash 公告则更侧重速度、规模和生产环境部署。

这并不意味着相关防护措施已经消失,而是新文章仅向读者提供了关于这些措施如何在大规模智能体场景中运作的有限细节。

语音智能体会带来特殊风险,因为用户可能会将自然的语音误认为真人客服。组织需要提供明确告知、人工升级路径、录音政策,以及防止未经授权模仿的保护措施。

生成图像则引发另一类问题。更准确的文本呈现和编辑能力可以支持正当的设计工作,但也可能让合成材料更具迷惑性。

Microsoft 的模型卡指出,MAI-Image-2.5 不应创建欺骗性内容或冒充真人。实际安全性取决于这些规则能否在每个产品和 API 界面中得到执行。

客户选择是另一个尚未解决的问题。Microsoft 表示,开发者可以通过其模型组合,在质量、速度和成本曲线上选择合适的平衡点。

Bing、OneDrive 或 PowerPoint 中的终端用户可能缺乏同等程度的透明度。他们可能不知道 Microsoft 何时更换了模型或改变了任务路由方式。

这可能会让可重复的工作流程变得复杂。即使底层服务发生变化,营销团队也可能需要在整个营销活动中保持一致的视觉表现。

公开预览状态也意味着需要保持谨慎。预览产品在正式发布前可能发生变化,包括性能、限制、支持地区和集成行为。

Microsoft 已经证明其模型可以在主要服务中运行,但尚未证明每位外部开发者都能复现 Microsoft 内部实现的收益。

这一区别至关重要。Microsoft 控制着自己的应用、基础设施、遥测数据和部署设置,而 Azure 客户只能控制其中一部分。

该公司的结果值得关注,因为它们来自生产环境。但在外部团队以公开条件发布可比评估之前,这些结果仍应被视为公司报告的说法。

三个信号将表明 MAI 战略是否奏效

下一阶段将通过外部采用情况、可复现的生产结果,以及对外部模型的进一步替代来衡量。

第一个信号是从公开预览转向正式发布。这一转变将表明 Microsoft 对可靠性、支持能力、区域覆盖范围和稳定的开发者访问更有信心。

它还将揭示 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 能否服务于经过精细管理的 Microsoft 环境以外的客户。延迟发布或严格限制可用范围都会削弱这一论点。

开发者应关注正式发布时同步推出的文档。详细的限制、安全控制、延迟指南和版本管理政策,将比精心制作的示例输出更加重要。

第二个信号是独立评估。图像研究人员和创意团队应在多步骤编辑、排版、布局保留和品牌一致性等方面测试 Pro。

语音开发者应在长时间对话、打断、语码转换、嘈杂输入和罕见姓名等场景下测试 Flash。稳定一致的结果将进一步支持 Microsoft 关于生产就绪度的说法。

公开排行榜可以提供参考,但针对具体工作负载的测试将更具分量。面向联络中心的模型应当像联络中心组件一样接受评估。

第三个信号是 Microsoft 产品中的持续扩展。更多 MAI 部署将表明,该公司的内部模型能够持续满足其质量和运营要求。

最具启示性的案例将涉及对外部模型的直接替代。Microsoft 应尽可能披露相关工作负载、基准、质量阈值和测得的运营变化。

如果 MAI 在 Microsoft 365、Dynamics、Bing 和 Azure 中不断扩展,其内部模型战略的可信度就会增强。如果部署停滞,当前案例的适用范围可能比公告所暗示的更加有限。

客户还应关注 Microsoft 是否会在 Foundry 中保留有意义的模型选择权。当开发者能够在相似条件下比较 MAI 和竞争模型时,一体化模型组合会更有价值。

7 月 23 日的发布并不只是一次图像公告与一次语音公告的简单组合,而是 Microsoft 展示其计划如何通过专业化和分发参与竞争。

MAI-Image-2.5-Pro 面向那些可见质量足以证明额外计算投入合理的任务。MAI-Voice-2-Flash 则面向那些由速度和运营效率决定服务能否规模化的任务。

Microsoft Source 将两者都作为客户选项呈现,但它们的战略价值远不止于此。每个模型都为 Microsoft 增加了一种无需完全依赖外部提供商即可优化的工作负载。

对于开发者和企业买家而言,合理的应对方式是进行测量。使用真实素材、真实对话和现有服务等级要求来测试这些模型。

跟踪修正率、保存的输出数量、尾部延迟、升级频率和基础设施使用量。这些指标将揭示质量、速度与成本曲线能否真正改善实际工作。

Microsoft 目前已经提供了模型、产品部署位置和若干引人注目的内部结果。接下来的问题将由客户回答:同样的收益能否在 Microsoft 自身体系之外继续成立?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page