Microsoft 将自研 AI 模型定位为比 OpenAI 更低成本的替代方案
- Olivia Johnson

- 47分钟前
- 讀畢需時 16 分鐘
Microsoft 将一则 Google News 标题转化为直接挑战:其自研 AI 模型能够以低于 OpenAI 模型的成本处理常见工作负载。
这一说法标志着 Microsoft AI 战略的重要转变。该公司不再将内部模型视为研究项目或遥远的保险措施,而是将其部署到各类产品中,与前沿系统进行衡量,并将其效率作为客户转向这些模型的理由。
OpenAI 仍是 Microsoft 的核心合作伙伴、模型供应商,并参与 Microsoft 的云业务。然而,Microsoft 在模型层面正日益与其竞争。这家软件公司如今可以在向外部供应商付费,以及在自有基础设施上运行专门的 MAI 模型之间进行选择。
这场竞争并非简单的 Microsoft 对 OpenAI,而是通用前沿模型与针对特定产品优化的小型系统之间的较量。Microsoft 认为,许多日常请求并不需要能力最强的可用模型。
时机之所以重要,是因为高频 AI 功能会将计算需求上的微小差异放大为重大的运营成本。嵌入 Excel、Outlook、PowerPoint 或 GitHub Copilot 的助手,可能会处理数量极其庞大的常规请求。
Microsoft 的押注很直接:即使专用模型在更困难的评测中落后,只要它在常见任务上能够匹配前沿模型,就能带来更好的经济效益。
尚未解决的问题是,Microsoft 是否衡量了正确的指标。公司的评测显示出积极结果,但买方仍需要有关可靠性、非常规任务、安全性和完整工作流成本的证据。
Microsoft 正将 MAI 模型引入实际产品
Microsoft 的战略转变在于部署,而不只是发布又一个模型系列。
Microsoft 表示,其 MAI 模型现已支持 Excel、GitHub Copilot、Bing、PowerPoint、OneDrive、Dynamics 365 和 Azure 中的体验。这种分发能力赋予该公司多数独立模型开发者所不具备的优势:可立即接触成熟产品及其工作负载。
7 月,Microsoft 介绍了在 Excel 内部的生产部署。该公司称,一款 MAI 模型在应用最常见任务上的表现可与 GPT-5.6 相当,同时能更高效地使用资源。
这一措辞值得关注。Microsoft 并未声称其模型在所有推理任务上都超越 GPT-5.6,而是将比较范围限定在实时产品中观察到的常见 Excel 工作负载。
这种区分支撑了 Microsoft 的战略。该公司不需要让每个 MAI 模型都成为全球最强的通用系统,而是需要模型能够以可靠方式、大规模完成明确的工作。
Excel 请求提供了清晰示例。用户可能要求 Copilot 解释公式、识别模式、更改格式,或从结构化数据中生成摘要。许多请求具有可预测的格式和工具需求。
在这种环境中训练和评测的模型,可以专注于这些模式。它可能需要更少的参数、更短的回复,或更少的尝试次数来完成工作。
参数是模型在训练期间学习到的可调整数值。更多参数可以提升容量,但通常也会提高内存和计算需求。
Microsoft 将其开发方法称为爬山系统。在这里,爬山是指依据模型将要运行的产品中提取的评测,反复改进模型。
该公司从为 GitHub Copilot 中的编程工作调优的 MAI-Code-1-Flash 开始,随后利用 Excel 评测对该检查点进行适配,为常见电子表格任务产出专用变体。
这种方法将模型开发与应用遥测数据及评测工具链联系起来。评测工具链是一种受控测试系统,用于在具有代表性的任务上为模型评分。
Microsoft 拥有其中涉及的应用、云基础设施、用户界面和评测闭环。这种垂直布局可以缩短发现故障与训练出更好模型之间的距离。
该公司还发布了涵盖语音转写、语音生成、图像创建、编程和推理的模型。这是一项组合战略,而非一次构建通用替代品的尝试。
Microsoft 在 Build 2026 上展示了一个七模型系列。该公司将 MAI-Thinking-1 描述为一款拥有 350 亿活跃参数、256,000 token 上下文窗口的推理模型。
上下文窗口是模型在一次交互中能够考虑的文本或其他 token 化信息量。更大的窗口有助于处理长文档、代码库和延展式对话。
Microsoft 表示,MAI-Thinking-1 的训练未采用来自其他公司模型的蒸馏。蒸馏是指较小模型从较大教师模型生成的输出中学习的过程。
这一说法涉及所有权和独立性,但仍属于公司声明。外部研究人员需要获得足够的技术文档和可复现测试,才能全面评估它。
更广泛的信息依然清晰:Microsoft 正将自研模型置入能够产生收入的软件中,并可在其中将其行为与 OpenAI 和 Anthropic 系统进行比较。
这一运营层面的举措形成了本文的核心张力。Microsoft 的模型不再需要先赢得公开基准测试竞赛,才能在特定任务上取代前沿供应商。
为什么 Google News 的说法本质上关乎 AI 成本
成本最低的模型并不总是标价最低的模型,因为失败的尝试和冗长回复可能会颠倒计算结果。
Google News 的表述强调更低成本的替代方案,但企业买方应谨慎看待这一说法。AI 成本取决于完整任务,而不仅仅是输入或输出 token 的定价。
一款模型看似便宜,却仍可能因生成不必要的长回答而成本更高。当它反复失败、调用过多工具,或需要更强模型来修复其工作时,也会出现同样的问题。
Microsoft 研究人员在一项价格反转研究中记录了这一问题。他们发现,在推理任务中,较低的标价并不总能带来较低的总成本。
该研究报告称,在其审查的模型对比较中,有 21.8% 出现价格反转。最极端情况下,总成本差异高达 28 倍。
这些结果并未否定 Microsoft 的效率论点。它们说明,可信的论证需要任务层面的证据,而不是费率比较。
对于电子表格助手,有用的单位不是 token,而是一个满足延迟、安全和准确性要求的、正确完成的电子表格任务。
同样的逻辑也适用于编程。一款快速生成看似合理但实际错误补丁的模型,可能比更慢、更昂贵的替代方案带来更多审查工作。
语音转写带来了另一项衡量问题。买方需要考虑词错误率、语言覆盖范围、处理速度、说话人分离能力,以及在嘈杂环境中的表现。
图像生成有其自身变量。团队可能关注提示词遵循度、可读文本、编辑控制、延迟、一致性,以及被丢弃生成结果的数量。
Microsoft 可以围绕这些产品特定的结果进行优化,因为它控制着应用。OpenAI 则必须通过通用模型,为更广泛的客户、工具和不可预测的请求提供服务。
这种差异为专业化带来了结构性成本优势。专用模型可以更小,因为它不需要在每个领域都具备同等强度。
不过,专业化也会形成上限。针对高频 Excel 请求调优的模型,在用户结合财务、冷门公式、外部数据和模糊商业指令时可能会遇到困难。
Microsoft 可以通过路由来应对这一弱点。模型路由是一种系统,它会根据每项请求的难度和上下文,将其发送至被认为最合适的模型。
常规工作可以交给高效的 MAI 模型。困难请求则可以转交给 OpenAI、Anthropic 或其他前沿模型。
这种安排类似于分层计算系统,只是决策发生在产品界面背后。用户可能只体验到一个助手,而底层由多个模型处理不同请求。
路由可以在不迫使 Microsoft 放弃前沿供应商的前提下降低平均成本。这也解释了为什么将 MAI 描述为 OpenAI 替代品的报道需要加上限定。
这种替代可能发生在请求层面,而不一定覆盖整个产品。一个模型可以处理电子表格格式设置,另一个模型则处理深度分析。
Microsoft 也将这一逻辑应用于安全领域。其 Project Perception 架构将专用网络安全模型与前沿系统结合,为不同阶段选择不同模型。
该公司表示,这种多模型设计改善了质量、可用性与成本之间的平衡。这一说法仍基于 Microsoft 的评测,但其机制在商业上是合理的。
Microsoft 还有另一个降低推理成本的动机。推理是已训练模型生成答案时使用的计算过程。
训练之所以受到关注,是因为它需要大型集群和漫长的开发周期。但一旦 AI 触达数百万用户,推理就会成为持续性支出。
偶尔使用的功能可以容忍一次昂贵的模型调用。嵌入日常办公工作的功能则面临不同的计算方式。
因此,Microsoft 能够从应用和云基础设施中的每一项效率提升中获益。它可以保留节省的成本、提高利润率、扩大使用量,或在现有产品中为客户提供更多 AI 活动。
这就是为什么“更便宜”并非微小的产品细节。它可能决定哪些 AI 功能成为默认选项,哪些仍只是受限的实验。
Microsoft 的替代方案让 OpenAI 面临另一种压力
OpenAI 并未面临被立即移出 Microsoft 产品的局面,但它正在失去作为 Microsoft 默认模型选择的地位。
Microsoft 与 OpenAI 仍保持深厚的商业联系。双方关系涵盖云基础设施、知识产权、收入安排和广泛的产品整合。
2026 年 4 月,两家公司宣布了修订后的合作关系。经修订的协议在保留合作重要要素的同时,赋予双方更大的灵活性。
这一变化降低了双方关系中的排他性,也让 Microsoft 不断扩展的模型战略更容易理解。
Microsoft 希望持续获得 OpenAI 的前沿能力。同时,它不希望每一项 Copilot 请求都依赖单一的外部供应商。
这一目标同样适用于 Anthropic。Microsoft 已将 Claude 模型加入其部分产品和云目录,同时也在开发能够替代第三方调用的系统。
一份 7 月的 应用路由报告称,Microsoft 已开始在包括 Excel 和 Outlook 在内的应用中,用 MAI 模型替代部分 OpenAI 和 Anthropic 的使用。该报告描述的是一种选择性的转变,而非彻底脱离。
对 OpenAI 而言,压力来自使用量和议价能力。如果 Microsoft 能够将常规请求重新导向,OpenAI 将保留最棘手的工作负载,但会失去部分高频活动。
这种分工可能改变模型合作关系的经济模式。前沿模型依然具有价值,但其供应商必须证明:在成本更低的替代方案已能充分胜任的任务上,为何仍应使用它们。
这也改变了企业销售对话。购买 Microsoft 应用程序套件的客户,可能不再需要为每一种工作流选择同一家模型供应商。
Microsoft 可以提供一个隐藏模型选择过程的编排层。客户选择的是受治理的产品,而由 Microsoft 来选择模型。
这使 Microsoft 同时扮演买方、竞争对手、分销商和基础设施提供商。每一种角色都增强了其与独立 AI 实验室谈判时的地位。
OpenAI 面临相关的产品挑战。如果客户通过 Copilot、Azure 或其他平台与其模型交互,他们可能会更看重应用本身,而非底层模型品牌。
前沿模型供应商可以通过保持显著的能力领先来抵抗这种商品化趋势。他们也可以构建直接面向用户的产品、专用智能体和开发者平台,以维系客户关系。
OpenAI 的优势依然显著。其最新模型能够处理广泛、困难且陌生的任务,而训练范围狭窄的系统未必能可靠完成这些任务。
Microsoft 自身的表述也承认这种层级差异。它仍然将前沿需求与较小模型能够高效满足的、已趋于饱和的能力区分开来。
所谓能力饱和,是指多种模型都已达到所需质量水平的任务。一旦性能跨过这一门槛,速度和成本就会变得更加重要。
这一概念重新定义了 AI 竞赛。获胜者未必总是最难基准测试中的领先者,也可能是那个能将每项任务分配给成本最低、但仍可接受模型的平台。
Google、Amazon 及其他云服务提供商也在推进类似策略。它们都提供模型目录、自研模型以及用于在不同模型间进行选择的系统。
Microsoft 的优势在于其办公应用的覆盖范围。其劣势则是客户可能将隐藏式路由理解为质量下降。
透明度将至关重要。企业可能希望了解:哪一个模型处理了敏感信息、该模型在哪里运行,以及 Microsoft 如何评估它。
受监管客户还可能要求稳定的模型版本和有文档记录的行为。持续变化的路由可能使审计、事件复盘和可复现性变得复杂。
OpenAI 可以利用这些顾虑来维护自身地位。对于某些高风险工作负载,一个行为已知、身份明确的前沿模型,可能比不断变化的模型组合更受欢迎。
因此,竞争不会产生一个普遍的唯一赢家。Microsoft 正试图控制选择层,而 OpenAI 必须让其模型保持足够价值,才能持续被选中。
更便宜的 Microsoft AI 模型仍需独立验证
Microsoft 展示了一套连贯的效率战略,但其最有力的比较仍具有选择性,并且主要来自自身报告。
Excel 的部署提供了有意义的证据,因为它涉及一款在线运行的产品。但它仍未披露足够细节,让外部人士能够复现这项比较。
Microsoft 尚未公开提供“最常见任务”这一描述背后的每一条提示词、评分规则、失败类别或路由条件。这些细节决定了该结果的适用范围究竟有多广。
一个模型可能在经常出现的请求上与前沿替代方案相当,却在罕见但重要的情形中失效。平均分数可能掩盖这些长尾失败。
长尾失败是指发生不常见、但后果严重的错误。在企业软件中,它们可能包括计算结果损坏、权限设置错误、编造引用或不安全的代码变更。
Microsoft 对产品数据的访问有助于其识别常见模式。但这也可能促使其围绕在特定应用中看起来有利的指标进行优化。
独立测试可以减少这种不确定性。评估者应比较任务完成情况、修正率、延迟、工具使用准确性以及人工审查需求。
他们还应将产品集成与模型质量区分开来。一个能够更好地访问电子表格工具的较弱模型,可能优于通过受限界面运行的更强模型。
即便如此,这一结果仍会让用户受益,但它无法证明底层 MAI 模型在整体上优于 OpenAI 模型。
公司对基准测试的声明也需要同样谨慎看待。公开排行榜可以提供有用信号,但性能可能会随着提示词、评估设置和模型更新而变化。
Microsoft 已披露部分单个模型的限制。其图像文档指出,生成结果可能包含偏见、不准确之处或具有误导性的视觉细节。
这类警告很常见,但随着模型进入 PowerPoint、OneDrive 等用于对外沟通的工具,其重要性也随之提高。一张看似可信的图像可能比一张明显糟糕的图像更快传播错误。
成本比较同样需要考虑基础设施背景。Microsoft 拥有 Azure 容量、加速器硬件、产品分发和调度系统。
对于 Microsoft 而言,内部部署 MAI 可能比购买第三方推理服务更便宜。外部开发者在计入集成、监控和迁移成本后,看到的结果可能不同。
切换模型可能需要新的提示词、安全测试、评估套件、缓存策略和回退逻辑。团队必须将这些工程工作纳入总成本。
迁移也会带来行为风险。两个模型可能都能返回同样正确的答案,却使用不同的格式、细节程度或工具调用顺序。
这些差异可能破坏下游自动化。即使人类认为新答案可以接受,解析模型输出的工作流仍可能失败。
因此,企业买家在接受“更便宜替代方案”的宣传前,应提出几个问题。
他们应明确 Microsoft 评估的具体工作负载,并要求查看困难和异常情形的结果,而不仅仅是中位数请求。
他们应询问模型是独立运行,还是在带有前沿模型回退机制的路由系统中运行。一个成功的混合系统并不能证明单一模型可以替代所有组件。
买家还应衡量人工干预。若员工需要花更多时间纠正输出,那么减少推理支出的价值微乎其微。
更广泛的教训并不是 Microsoft 的说法错误。现有证据支持的是一个更狭义的结论:在明确界定的任务上,专用化能够改善经济性。
Microsoft 拥有利用这一原则所需的产品、数据循环、基础设施和分发能力。尚未得到证明的是这种替代的覆盖范围。
Google News 的标题将这种不确定性压缩成一场与 OpenAI 的清晰竞赛。真实的部署故事包含更多条件、回退机制和任务边界。
专用模型正在改变企业购买 AI 的方式
Microsoft 销售的不只是低成本模型的集合,而是一套分配智能能力的系统。
企业 AI 采购最初关注的是获得领先基础模型的使用权。基础模型是一种经过广泛训练、能够支持许多下游任务的系统。
当只有少数供应商提供具备能力的系统时,这种采购模式是合理的。随着模型目录不断扩大、常见能力日益普及,它的效率会降低。
如今,企业可以按难度、延迟、数据敏感性和所需专业知识划分工作。摘要任务可以交给一种模型,代码审查交给另一种,复杂规划则交给前沿系统。
Microsoft Foundry 旨在支持这种模型多样性。它将 Microsoft 的模型与来自 OpenAI、Anthropic、Mistral 及开放模型开发者的系统一并纳入。
该目录为客户提供选择,但更大的战略资产是编排能力。Microsoft 可以将模型选择与身份管理、安全、数据控制和应用上下文连接起来。
这一定位将注意力从单项基准测试领先地位上移开。买家开始评估整个工作流在真实运行约束下的表现。
设想一名员工正在准备季度分析。该工作流可能需要收集会议记录、搜索内部文件、汇总电子表格数据、创建演示文稿并起草电子邮件。
并非每一步都一定需要最强的可用模型。整个工作流需要可靠地访问上下文、正确使用工具、适当的权限以及可追溯的输出。
专用电子表格模型可以处理分析阶段。图像模型可以创建或编辑演示资产。前沿推理模型则可以审阅最终论证。
用户体验到的是一个流程,但背后有多个模型共同参与。Microsoft 可以优化每个阶段,而不必要求员工理解模型目录。
这种方法也使内部知识质量变得更加重要。即使模型很高效,在源文件分散、过时或缺乏上下文时,它仍会举步维艰。
构建 AI 工作流的团队需要一个可靠的知识层。可搜索的 AI knowledge base 可以在任何模型分析之前整理源材料。
这种关联之所以重要,是因为模型替换无法修复糟糕的输入。从 OpenAI 模型改用 MAI,无法解决相互矛盾的文档或不完整的项目记录。
企业应先评估工作流,再评估模型。他们需要理解错误从何处产生,以及哪些步骤消耗最多资源。
随后,模型路由器可以将重复性强、定义明确的工作发送给高效系统,并为那些额外推理会改变结果的模糊请求保留前沿模型容量。
这种结构会带来组织层面的影响。采购团队可能不再围绕一项覆盖全企业的模型协议谈判,而是开始管理一个获批准的模型组合。
安全团队将需要针对模型的控制措施。开发者将需要可移植的评估机制,以便在供应商更换模型时随时运行。
产品经理将需要面向用户的恢复路径。如果所选模型失败,应用应能安全重试或升级处理,而不丢失用户的工作。
这种经济模式也更有利于拥有大量重复性工作负载的公司。当效率小幅提升被应用于数百万次交互时,其意义会更大。
Microsoft 拥有数个符合这一条件的产品。Excel、Outlook、GitHub、Bing、PowerPoint、Teams 和 Dynamics 创造了多样但可重复的需求。
这些需求提供评估数据,并为专用训练提供了正当性。它们还为每一个成功的 MAI 模型提供了 Microsoft 的分发渠道。
独立实验室必须通过 API、合作伙伴关系或自己的应用触达这些用户。Microsoft 则可以在现有按钮背后部署内部模型。
这并不保证用户会接受。如果质量下降,员工可能会避开该功能、要求使用其他模型,或将敏感工作移出获批准的平台。
因此,模型选择可能成为一种产品功能。高级用户可能要求可见的控制选项,而管理员可能更倾向于集中管理的路由。
Microsoft 必须在这些偏好之间取得平衡。透明度过低可能削弱信任,而配置过多则可能让日常工作变得令人困惑。
胜出的设计很可能会将自动路由与清晰的治理机制结合起来。用户应当理解一项任务何时需要审核,即使他们从未亲自选择底层模型。
Microsoft 挑战 Google News 后值得关注的事项
三个信号将表明 MAI 能否成为持久的 OpenAI 替代方案:流量迁移、独立任务结果和客户采用情况。
第一个信号是 Microsoft 将多少生产请求路由至其自有模型。相比公开发布模型,在 Excel、Outlook、GitHub Copilot 和 PowerPoint 中的持续使用更为重要。
Microsoft 不需要公布每一项内部运营数据,但确实需要提供足够证据,证明 MAI 的部署正在超出有限测试的范围。
更广泛的迁移将强化这样一种观点:专用模型能够在日常工作中取代前沿系统。若推广停滞,则说明质量或可靠性方面的限制依然显著。
第二个信号是独立的任务级评估。研究人员和企业客户应测试完整工作流,而非孤立的提示词。
对于 Excel,这意味着衡量模型是否能创建正确的公式、保留数据、正确使用工具,并从模糊指令中恢复。
对于编程,评估应涵盖代码库上下文、测试执行、依赖项变更、安全问题以及最终补丁的准确性。
对于图像和语音,测试应覆盖真实生产环境。受控排行榜无法代表每一种口音、品牌要求、编辑请求或敏感场景。
与 Microsoft 主张相符的独立结果将增强其成本论证。若存在较大差距,则会削弱 MAI 性能能够超出公司自行设计评估的说法。
第三个信号是客户行为。Microsoft 有强烈动机突出展示那些以 MAI 模型替代前沿模型调用,并获得可量化工作流节省的组织。
有价值的案例研究应明确任务、此前系统、质量门槛、迁移投入以及人工审核负担。泛泛而谈效率提升,无法回答这些问题。
OpenAI 的回应也属于这一信号的一部分。它可以通过提升效率、提供专用模型,或交付足以证明前沿级资源投入合理性的能力,来缩小 Microsoft 的优势。
两家公司之间的关系使这种回应显得不同寻常。Microsoft 可以从 OpenAI 的改进中获益,同时利用 MAI 进行谈判、路由和竞争。
这种重叠正是为何这一事件比一次普通的模型发布更具影响力。Microsoft 正在为一家供应商构建替代方案,而该供应商的技术曾帮助建立 Copilot。
它也在检验一个将影响企业 AI 支出的命题:买方或许更看重一个经过良好路由的模型组合,而不是对某个单一模型品牌的忠诚。
知识工作者应当关注,因为所选模型会影响速度、准确性、隐私控制,以及助手需要被纠正的频率。这些差异体现在日常工作中,而不只是在基准测试上。
开发者应当关注,因为模型可移植性正成为一项应用要求。提示词、评估和回退系统必须能在底层提供商变化时继续适用。
企业买方应当关注,因为表面费率只是成本的一部分。迁移工作、失败情况、审核时间、延迟和工具准确性都会影响最终结果。
下一步很务实:选择一个重复性工作流,进行端到端测量。比较可用模型在完成任务数、修正次数、响应时间和升级频率方面的表现。
应将 Google News 的说法视为一个假设,而非采购结论。如果 Microsoft 的 MAI 模型能以更少资源达到所需质量,就将更多工作路由给它。如果它在重要场景中失败,则保留前沿模型作为回退方案,并记录原因。
这些证据将揭示 Microsoft 是否已打造出真正的 OpenAI 替代方案,还是仅仅提供了一个有用的专业模型。无论结果如何都很重要,因为单一默认模型的时代已经在结束。


