top of page

MAI Image 和 MAI-Code 表明微软想要自己的 AI 栈

已更新:6月18日

Microsoft 本月发布了其 MAI 品牌下的两款模型。MAI Image 用于生成视觉效果。MAI-Code 协助处理软件任务。这两项举措都指向了公司内部的战略转变。

Microsoft 与 OpenAI 已经合作多年。新发布的模型暗示了一条不同的路径。内部团队现在的目标是控制更多的技术栈。

时机至关重要。云端对 AI 工具的需求持续增长。Microsoft 希望拥有不依赖于单一供应商的选择。

Microsoft MAI 模型 在企业买家的关键时刻到来。许多团队寻求稳定的成本和可预测的性能。内部选项可以满足这些需求。

Microsoft AI 雄心的演变

Microsoft 迈向更大 AI 自主权的历程可以追溯到十多年前。早期对机器学习基础设施的投资,结合对 Xamarin 和 LinkedIn 等公司的收购,为更深层次的垂直整合奠定了基础。2019 年与 OpenAI 达成的数十亿美元合作伙伴关系代表了一个关键时刻,使 Microsoft 能够独家访问先进的语言模型,同时为 OpenAI 提供大规模的 Azure 计算资源。然而,这种关系始终带有隐含的紧张感:Microsoft 从快速的能力提升中获益,但在模型路线图、定价和数据政策方面放弃了一些控制权。

2023 年 Phi 系列小语言模型的发布标志着第一个明确信号,即 Microsoft 打算在内部开发具有竞争力的替代方案。Phi-2 以及后来的 Phi-3 证明,在精选合成数据上训练的小型模型在特定任务上可以与大型系统相媲美。MAI Image 和 MAI-Code 将同样的理念扩展到了新的模态。Microsoft 选择构建并发布自己的模型,而不是等待 OpenAI 发布图像生成或代码专用变体。这一举动反映了 Google 和 Amazon 等公司更广泛的行业模式,即内部基础模型与外部合作伙伴关系并存,以降低单一供应商风险。

在研究 Microsoft 早期对定制芯片和推理硬件的实验时,出现了进一步的背景。该公司对 FPGA 技术的收购以及 Project Brainwave 的开发,为优化的 Azure 基础设施奠定了基础,现在支持 MAI 推理的边际成本低于外部 API 调用。到 2024 年,内部基准测试显示,在 Azure 内部运行时,Phi 衍生模型在分类和摘要工作负载上的性价比比 OpenAI 的中型产品高出 3-4 倍。因此,高管们将这种方法扩展到图像合成和代码智能视为逻辑上的演进,而非激进的背离。

Microsoft 的内部研究节奏也在加快。在 2021 年至 2024 年间,该公司提交了 1,200 多项与 AI 相关的专利,重点关注模型压缩、合成数据生成和企业特定的微调技术。这些申请围绕三个主题:最大限度地减少数据移动以满足合规性、降低现有 Azure GPU 集群的推理延迟,以及嵌入源自 Microsoft 自身产品代码库的特定领域护栏。由此产生的技术诀窍直接为 MAI Image 的样式令牌提取流水线和 MAI-Code 的仓库感知评审引擎提供了支持。

发布无需外部协助

Microsoft 首先通过内部渠道发布了 MAI Image 和 MAI-Code。这些工具在公司基础设施上运行,无需调用第三方模型。

MAI Image 处理商业图形的标准提示词。MAI-Code 支持基础代码补全和审查。两款产品均已开启有限的公开预览。

此次发布与以往模式不同。过去模型更新通常涉及与 OpenAI 的联合声明,而这些更新仅由 Microsoft 发布。

Microsoft MAI 模型现在与早期的 Phi 系列并列。该公司此前已测试过用于边缘计算的小语言模型。MAI 将同样的概念推向了图像和代码领域。基础设施团队在现有 Azure 区域内配置了专用 GPU 集群,实现了低延迟推理,无需通过 OpenAI 端点路由提示词。文档泄露表明,MAI Image 采用基于扩散的架构,在数百万个获得许可的企业图表和演示资产上进行训练,而非广泛的互联网抓取。MAI-Code 基于 Phi 系列构建,但对 Microsoft 内部存储库进行了额外的微调,包括来自 Windows 和 Office 代码库的多年脱敏 C#、TypeScript 和 Python 代码。

早期访问合作伙伴报告称,这两个系统都配备了企业级遥测控制。管理员可以完全禁用外部数据传输,满足了此前令 Copilot 部署复杂化的严格数据驻留规则。这种自包含设计还为政府和受监管行业客户实现了物理隔离(air-gapped)测试场景,这些客户无法将提示词发送给第三方服务。

MAI Image:技术能力与企业用例

MAI Image 针对大型组织内部常见的高频率、低创意图形需求。当给定结构化提示词(如“北美渠道合作伙伴季度收入细分,简洁企业色调,无图标”)时,它可以生成图表、流程图和适用于幻灯片的视觉效果。由于训练数据强调商业背景,该模型能可靠地遵循颜色、排版和布局方面的品牌指南。用户可以上传现有的幻灯片母版;系统会提取样式标记并将其一致地应用于生成的资产。

除了基础图表,MAI Image 还支持迭代优化循环。产品经理可以请求一个图表,获取 SVG 输出,然后发布后续指令,如“将第三阶段换成决策菱形并添加合规检查点标签”。版本历史记录存储在 SharePoint 中,允许法律团队审计每一次更改。与 PowerPoint 的集成将提示词历史与最终图像一同记录,创建了制药和金融服务等行业所需的审计追踪。

该模型还输出与 Visio 和 Adobe Illustrator 兼容的可编辑矢量格式,减少了下游返工。在一家制药公司的试点项目中,医学事务团队在不到两小时内生成了 140 张监管提交图表,同时 100% 遵循了获批的调色板和图标标准。消费品公司的营销部门也同样使用该工具制作了涵盖 12 种语言的本地化活动视觉效果,无需手动调整大小或重新着色。

安全团队非常赞赏 MAI Image 拒绝加入未经批准的库存图像或受版权保护的图标,这一保障是通过训练时的过滤而非事后审核实现的。这种确定性的执行降低了偶尔出现在基于云且在公开网络数据上训练的图像生成器中的品牌风险暴露。

MAI-Code:开发者工作流集成

MAI-Code 专注于代码补全、评审和测试生成,而非开放式的创意编程。在 Visual Studio 和 VS Code 中,该扩展程序会根据 Microsoft 内部代码模式提供建议,自动遵守公司代码库中已编纂的命名规范和架构护栏。当开发者编写新的控制器方法时,MAI-Code 会建议匹配的单元测试,并遵循所属团队使用的相同断言风格。评审意见会引用内部安全手册,标记历史上曾触发审计发现的模式。

该模型还理解 Microsoft 特有的抽象概念,例如 Azure SDK 表面区域和最新的 .NET Aspire 编排基元。这种专业化减少了困扰通用模型的幻觉 API 调用。在试点计划中测试 MAI-Code 的企业报告称,常规服务层工作的拉取请求(pull-request)评审时间减少了 15–20%,尽管在处理新颖的算法挑战时收益会有所收缩。

其他工作流功能包括自动生成架构决策记录,以及针对公司批准的 NuGet 包进行内联策略检查。当开发者尝试引入未经批准的依赖项时,模型会建议经过审核的替代方案,并直接链接到内部安全评审工单。事实证明,这种上下文感知水平对于将旧版本地服务迁移到 Azure Functions 的团队特别有价值,因为在数千个存储库中,命名规范和日志标准必须保持一致。

竞争格局对比

Google 的 Gemini 和 Amazon 的 Titan 系列展示了平行的策略。每个超大规模云厂商都将前沿合作伙伴模型与针对内部工作负载调整的专有产品相结合。因此,Microsoft 发布 MAI 使多模型堆栈成为企业默认态势。Gemini 擅长多模态研究查询,Titan 在成本优化的检索增强生成方面领先,而 MAI Image 和 MAI-Code 则刻意针对企业演示资产和以 Microsoft 为中心的代码库这一较窄但高容量的领域。这种定位避免了直接的基准测试战争,同时在现有的 Microsoft 365 和 Azure 环境中提供了即时的运营杠杆。

据报道,来源:The Verge, 超大规模云服务商正日益将内部模型与外部合作伙伴相结合,以平衡性能与成本。Bloomberg 同样指出,企业买家在选择 AI 工具时,现在会优先考虑数据驻留控制和可预测的定价。

合作伙伴面临新压力

OpenAI 为 Copilot 提供了核心模型。新的 MAI 工具减少了这种依赖。Microsoft 在未来的合同谈判中获得了筹码。

其他供应商也在关注这一举动。Google 和 Amazon 运行着内部和外部模型的混合堆栈。Microsoft 现在更公开地加入了这一行列。

企业客户因此获得了更多选择。他们可以在不脱离现有合同的情况下测试 Microsoft 工具。当多个供应商竞争时,切换成本就会下降。

这一转变也影响了初创模型开发商。规模较小的实验室失去了一个购买微调输出的大客户。如果收入预测依赖于 Microsoft 的交易,融资轮次可能会放缓。

对行业的战略影响

部署 MAI 模型的决定加速了整个行业向垂直整合发展的趋势。云提供商现在将基础模型视为战略基础设施,而非可互换的商品。这改变了议价动态:OpenAI 必须证明其在尖端能力方面的持续领先地位,以保持首选地位,而 Microsoft 则可以可靠地威胁将工作负载转移到内部。小型 AI 实验室面临着更窄的盈利路径,因为超大规模云服务商正越来越多地通过自研产品满足中端用例。与此同时,监管机构获得了评估集中度的新视角;一个涵盖操作系统、办公套件、云基础设施以及现在的基础模型的集成 Microsoft 堆栈,将在竞争和数据保护框架下招致新的审查。

多家投资银行的分析师已更新了与OpenAI相关的基础设施提供商的价格目标,理由是微软可能会在MAI模型在更多任务上达到同等水平后限制Copilot的使用增长。与此同时,开源模型社区观察到微软对参与治理框架的兴趣增加,这可能是为了确保其内部技术栈与新兴标准保持互操作性。

独立性需要权衡

内部模型开发需要承担实际成本。微软必须聘请研究人员并维护数据中心。回报仅在多个季度后显现。

性能差距仍有可能存在。外部模型有时在创意任务的基准得分上领先。微软团队需要持续更新以缩小这些差距。

数据访问构成了另一项限制。OpenAI在特定条款下对广泛网络数据进行训练。微软的数据则受合规边界限制,这可能减少数据多样性。

Microsoft MAI models因此兼具优势与约束。购买者必须在控制力与偶发的性能不足之间进行权衡。该决策因工作负载类型而异。

企业的实际影响

评估MAI Image和MAI-Code的组织应从狭窄、高频的任务入手,这些任务更注重一致性而非新颖性。财务团队可将季度董事会图表标准化。工程组织可通过自动化审查执行内部风格指南。采购部门应在三种情景下建模总体拥有成本:持续大量依赖Copilot、混合使用以及全面采用内部技术栈。早期数据表明,混合部署(Copilot处理开放式研究,MAI处理重复性产物)能在性能与合规性之间实现最佳平衡。变更管理计划必须让开发者和设计师做好应对新扩展UI和提示库的准备;试点队列报告显示,在生产力恢复至基线水平前存在两周的学习曲线。

局限与挑战

模型更新需要持续投入。微软必须决定将多少预算分配给 MAI 而非其他研究线。预算削减可能放缓进展。

用户采用取决于集成质量。MAI 工具必须出现在熟悉的 Office 菜单中。工作流中的摩擦会降低试用率。

若微软在代码生成领域获得份额,监管审查可能加剧。反垄断担忧已触及多个 AI 市场。内部模型并不能消除这一风险。

其他限制包括基准透明度。微软尚未发布与 OpenAI 或 Anthropic 相当的完整评估套件,这使得独立验证更加困难。MAI 训练运行的能耗数据仍未披露,这给可持续发展报告带来复杂性。最后,人才招聘竞争激烈;要与外部前沿实验室保持同等水平,需要以高薪持续聘用专业研究人员。

早期测试结果喜忧参半

内部报告指出,标准商务图像的输出质量良好。图表和图示渲染清晰。复杂艺术风格仍落后于领先的外部工具。

代码任务表现更好。MAI-Code 通过标准单元测试的比率接近当前 Copilot 的默认水平。审查评论与微软项目中使用的风格指南相符。

更多对比数据将在预览范围扩大后发布。独立实验室通常会在发布后八周内公布这些数据。

后续关注要点

三个信号将明确方向。首先是微软实验室发布的公开基准。其次是下一次财报电话会议中对 MAI 的提及。第三是合作伙伴分享的早期客户案例研究。

每个里程碑都将显示独立性推动是否持续。强劲的数据将支持进一步投资,而疲软的结果可能放缓推广进度。

跟踪 AI 选项的知识工作者应将这些日期加入日历。结果将影响下一个产品周期的工具选择。

常见问题

什么是 Microsoft MAI 模型?

MAI Image 和 MAI-Code 是内部开发的 AI 模型,专注于企业图形和代码辅助,完全运行在 Microsoft 基础设施上。

MAI 模型与 Copilot 有何不同?

Copilot 依赖 OpenAI 模型,而 MAI 模型独立运行,提供更强的数据驻留控制,并与 Microsoft 特定代码库集成。

MAI 工具会取代外部 AI 合作伙伴关系吗?

Microsoft 将继续维持与 OpenAI 的关系,同时增加内部选项,形成混合技术栈而非完全替代。

MAI Image 和 MAI-Code 何时正式发布?

有限预览正在进行中;预计在未来几个季度的进一步企业测试后实现更广泛的可用性。

下载 remio 以在 AI 工具间保持项目上下文,无需重复设置。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page