Satya Nadella 将 Grok 引入 Microsoft Copilot,但模型选择也带来新风险
Satya Nadella 于 9 月 12 日宣布 Microsoft Copilot 引入 Grok,为 Microsoft 持续扩展的 AI 助手加入了一款主要竞争对手模型。这一宣布标志着 Copilot 再次偏离其最初主要围绕 OpenAI 技术构建的产品定位。
最初的信息很简短。Nadella 写道,Copilot 将提供更多模型选择,并欢迎 Grok 加入。Elon Musk 随后放大了这一消息,告诉其关注者 Grok 已可用 于 Microsoft Copilot。
然而,这番互动并未解答关键的产品细节。Microsoft 尚未发布相应的上线公告,说明包含哪些 Grok 版本、用户可在何处选择这些版本,或访问权限已在多大范围内推出。
这一差别很重要,因为“Copilot”如今涵盖多种产品。该名称可能指 Microsoft 的消费者助手、Microsoft 365 Copilot、Copilot Studio、Security Copilot 或 GitHub Copilot。
在 Nadella 发帖之前,Grok 已经出现在该产品组合的部分领域。Microsoft 于 2026 年 2 月在 Copilot Studio 中引入 xAI 模型,GitHub 随后则为编程加入了更新的 Grok 模型。
这项新宣布似乎扩大了双方的合作关系,但其具体范围仍需确认。不应将其解读为所有 Copilot 用户都能立即访问所有 Grok 模型的证据。
战略方向比发布机制清晰得多。Microsoft 希望让 Copilot 成为一个面向竞争性 AI 模型的中立访问层,即使这些模型的开发者直接与 Microsoft 和 OpenAI 竞争。
这一策略为用户带来更多选择。但同时,Microsoft 也需负责说明不同提供商如何处理提示词、实施安全防护,以及在冠以 Copilot 名称的产品中生成回答。
Grok Copilot 的推出实际改变了什么
这项宣布改变 Copilot 的公众定位,远多于改变 Microsoft 的底层技术方向。
Nadella 的帖子将 Grok 定位为 Copilot 内又一个可选择的选项。这种表述将模型选择置于 Microsoft 推介的核心,而非将单一模型本身视为产品。
在该宣布之后,Musk 直接表示 Grok 已在 Microsoft Copilot 中可用。两条信息都未说明模型编号、地域范围、订阅要求,或适用的 Copilot 体验。
这些缺失的细节使人无法精确描述此次推出。Microsoft 可能正在统一 Copilot 界面中引入 Grok、扩展现有测试,或先为有限用户群开放访问。
产品可用性也可能因账户、应用程序、管理员设置和地区而异。Microsoft 经常分阶段推出 Copilot,而非同时向所有客户开放。
因此,用户应在其具体 Copilot 体验对应的模型选择器中寻找 Grok。尤其在分阶段部署期间,即使没有看到它,也未必与该宣布相矛盾。
这一事件仍代表着有意义的变化。Microsoft 正在将 xAI 与日益扩大的外部及内部模型提供商集合,置于同一个 Copilot 品牌之下。
这种方式使 Copilot 成为一个编排层。在这里,编排是指选择、组合或监督模型,同时将它们连接到 Microsoft 的应用程序、数据和工具。
Copilot Studio 已提供了这一模式的早期版本。Microsoft 于 2 月向使用早期访问环境、位于美国的创建者开放了 Grok 4.1 Fast。
根据 Microsoft 的 Grok 4.1 发布公告,该模型面向文本生成、大上下文处理和深度工具使用设计。该集成不支持图像及其他媒体生成。
Copilot Studio 的这一版本默认关闭。组织管理员必须启用外部模型,并明确选择接入 xAI,创建者才能使用它。
这些限制说明,为何需要谨慎解读 Nadella 更广泛的表述。某一 Copilot 产品中的可用性,并不自动意味着它也适用于 Microsoft 365 Copilot 或消费者版 Copilot 应用。
GitHub Copilot 提供了另一项先例。其当前的支持模型列表包括 Grok 4.5 和 Grok 4.6,以及来自 OpenAI、Anthropic、Google、Microsoft、Moonshot AI 和其他提供商的模型。
GitHub 还指出,可用性因套餐和开发环境而异。组织所有者可以限制特定模型,而某些功能需要较新版本的编辑器或扩展程序。
因此,新的 Grok Copilot 推出延续了既有模式,而非开启新的合作伙伴关系。Microsoft 已在云开发、智能体构建和软件编程领域测试 xAI 模型。
9 月 12 日发生的变化,是这一关系的可见度。Nadella 公开欢迎 Grok 加入更广泛的 Copilot 叙事,表明 xAI 不再只是边缘化的目录供应商。
这也构成了本文的核心张力。Microsoft 可以提供更广泛的模型选择,但每增加一个提供商,Copilot 的说明和治理就会变得更复杂。
Microsoft Copilot 的模型选择正在成为产品本身
Microsoft 正押注于:对 AI 界面的控制,比对其背后模型的独家控制更重要。
Copilot 最初受益于 Microsoft 与 OpenAI 的紧密关系。获得 OpenAI 技术帮助 Microsoft 在 Bing、Windows、Microsoft 365、Azure 和 GitHub 中迅速推进。
这一关系仍然重要,但 Microsoft 不再将外部模型的多样性视为例外。它正日益将多样性视为核心产品功能。
2026 年 3 月,Microsoft 扩展 Microsoft 365 Copilot Researcher,使其同时使用 OpenAI 和 Anthropic 模型。一个模型可以起草回答,另一个模型则在交付前进行审查。
Microsoft 还引入了一种对比体验,让用户检视不同模型的回答。执行副总裁 Charles Lamanna 告诉 Axios,Copilot 内将出现许多模型这一趋势正变得愈发明确。
这一多模型研究系统展示了两种不同方法。Copilot 可以让用户选择提供商,也可以在幕后组合多个提供商。
引入 Grok 强化了这两种可能性。Microsoft 可以将其作为可见选项呈现、将适合的请求路由给它,或将其作为更大工作流中的一个组件。
这一策略向 OpenAI 施压,因为 Microsoft 不再需要让每一次 Copilot 改进都依赖单一合作伙伴的发布节奏。来自 xAI、Anthropic、Google 或 Microsoft 自身的强大模型,都可以填补特定角色。
这种压力具有战略意义,并不代表 Microsoft 已放弃 OpenAI。Microsoft 仍持续在其产品中加入新的 OpenAI 模型,并且在许多体验中仍依赖其能力。
不过,OpenAI 现在必须竞争 Microsoft 界面中的位置。它也在与 Copilot 本身竞争,以建立与个人用户和企业用户的直接关系。
Microsoft 的优势来自分发能力与上下文。Copilot 可以出现在人们本已用于撰写文档、审阅电子邮件、分析数据、管理会议和开发软件的应用程序中。
模型供应商提供智能能力,但 Microsoft 控制着围绕该智能能力的许多权限、应用程序连接、策略设置和用户交互。
这种结构类似于一个由活跃运营方管理的市场。Microsoft 决定哪些提供商符合资格、哪些模型会出现、管理员可启用哪些功能,以及适用哪些安全层。
模型选择可帮助 Copilot 服务不同任务。快速模型可能处理常规问题,而更具深度推理能力的模型则应对复杂分析或编程。
企业也可以针对敏感决策比较输出。不同回答之间的差异,可能暴露薄弱证据、缺失的假设,或值得人工审查的领域。
这一方式与 AI 软件更广泛的转变相一致。应用程序正日益将用户体验与底层语言模型分离,使模型可以被替换或选择。
对 Microsoft 而言,这降低了对任何单一供应商的依赖。它还使 Copilot 无需重建围绕模型的应用程序和数据连接,便能吸收新模型。
对 xAI 而言,Copilot 在 Grok 自有界面和 X 之外提供了宝贵的分发渠道。企业用户可以在已获其雇主批准的工具中接触该模型。
随着 xAI 进军企业工作负载,这种访问方式可能尤为重要。企业采用依赖管理、身份、监控和合规功能,而单靠消费者聊天机器人的分发无法提供这些能力。
因此,Grok Copilot 的推出为双方各自带来对方所缺少的东西。Microsoft 获得了又一家主要模型提供商,而 xAI 则获得了进入成熟企业软件的途径。
OpenAI 仍是这一战略转变中的主要对手,因为其早期优势帮助定义了 Copilot。Microsoft 目前正在证明,Copilot 品牌可以超越这一基础继续扩展。
竞争问题不再是 Microsoft 能否整合竞争对手的模型,而是当 Copilot 管理周边工作流后,用户是否还会在意由哪一个模型生成回答。
这一优势伴随着治理权衡
更多模型选择带来真正的灵活性,但也将比较、隐私和安全方面的工作转移给客户与管理员。
语言模型并不像可互换的数据库引擎。它们在推理、事实可靠性、回答风格、延迟、工具使用、内容限制以及抵抗恶意提示词的能力方面均存在差异。
在某项基准测试中表现出色的模型,可能难以处理企业的内部文档。另一个模型可能回答得更自由,却生成违反组织政策的内容。
Microsoft 在有关 Grok 4.1 Fast 的自身文档中承认了这种差异。其评估发现,非推理版本的对齐程度低于 Microsoft 测试的其他模型。
该公司报告称,其生成潜在有害输出的风险更高,在安全和越狱评估中的结果也更低。越狱是指旨在绕过模型行为限制的提示词。
Microsoft 的模型设置指南称,Grok 4.1 Fast 相比其他可用模型,可能更容易生成露骨内容。该指南还警告,Microsoft 的内容安全系统可能无法覆盖该模型可能产生的每一种危害类别。
这是一个异常直接的警告。Microsoft 将该模型归类为实验性产品,并不建议在生产环境中使用这一 Copilot Studio 版本。
这一警告并不能证明每个较新的 Grok 模型都具有相同限制。但它表明,为何 Microsoft 必须明确最新宣布所包含的具体模型。
Grok 4.5、Grok 4.6 和 Grok 4.1 Fast 是不同的产品。它们的能力、安全防护、支持的工具和发布状态,不能被视为可以互换。
产品层面同样重要。GitHub 表示,其默认模型生成的提示词和补全内容都会通过 Copilot 内容过滤器,包括对有害输出和公共代码匹配的检查。
Copilot Studio 使用不同的控制机制。管理员可以在环境层面阻止预览模型、外部提供商或跨区域处理。
Microsoft 2 月的集成还包含了具体的数据条款。该公司表示,xAI 不会保留 Copilot Studio 客户数据,也不会将其用于训练模型。
与此同时,Microsoft 披露,xAI 模型托管在 Microsoft 管理环境之外。客户与 xAI 的关系由 xAI 的企业条款和数据保护协议独立约束。
对于处理机密记录的企业而言,这些区别至关重要。一条提示词可能包含客户信息、源代码、内部战略、法律材料或未公开的财务数据。
组织需要了解这些信息在哪里被处理、由哪家公司担任提供商、数据会保留多久,以及区域性承诺是否仍然适用。
Microsoft 尚未公开确认,更广泛的 9 月发布是否采用与 2 月 Copilot Studio 集成相同的条款。读者不应假设不同产品之间的数据处理方式完全一致。
同样的谨慎也适用于消费者账户。Microsoft 面向个人 Copilot 用户的隐私规则,与员工使用组织身份登录 Microsoft 365 Copilot 时适用的保护措施并不相同。
仅靠模型标签无法传达这些差异。Microsoft 需要在用户切换提供商时给出清晰提示,而不能只在用户日后偶然发现的文档页面中说明。
管理员还需要审计记录,以显示每项请求由哪个模型处理。没有这种可见性,调查错误或不安全的回答将变得困难得多。
员工可能只会说,输出是由 Copilot 生成的。但组织仍必须确定,这项请求究竟发送到了 OpenAI、Anthropic、Microsoft、Google 还是 xAI 的模型。
这带来了责任归属问题。Microsoft 拥有 Copilot 界面,但另一家公司可能运营底层模型,并定义部分适用条款。
用户体验到的是一个助手,但合同和技术链条中却包含多个提供商。随着 Copilot 加入更多模型,这一鸿沟会不断扩大。
企业可以通过结构化评估来应对。他们应在大规模部署前,针对具有代表性的任务、敏感提示词、禁止内容和对抗性指令测试候选模型。
知识融合工作流也能帮助用户将模型输出与自己的源材料进行比较。目标不应是因为某个模型出现在熟悉的界面中,就盲目信任它。
只有当用户理解其中的权衡时,Microsoft Copilot 的模型选择才有价值。更大的菜单若缺乏清晰的模型身份与治理机制,可能制造混乱而非带来控制力。
Microsoft Copilot 引入 Grok:对 OpenAI 形成压力,但并非取而代之
Grok 为 Microsoft 带来谈判筹码和更多选择,但不会让 Copilot 变成一款反 OpenAI 产品。
Microsoft 仍持续支持大量 OpenAI 模型。这些模型依然深度集成于 Copilot 体验和 Microsoft 的云基础设施中。
该公司还加入了 Anthropic 模型、Google 模型、xAI 模型以及自有的 MAI 系统。这是一项组合策略,而非简单地更换供应商。
这一区别很重要,因为 Microsoft 与 OpenAI 同时处于多重关系之中。双方既是基础设施合作伙伴、产品合作者和模型供应商,也日益成为直接竞争对手。
Microsoft 可以在 Copilot 中使用 OpenAI 模型,同时与 ChatGPT 争夺用户。OpenAI 可以依赖 Microsoft 基础设施,同时开发与 Microsoft 软件业务重叠的产品。
xAI 又增添了一层复杂关系。Musk 与 OpenAI 竞争、批评其领导层,并已就涉及 OpenAI 和 Microsoft 的事项提出法律主张。
然而,Nadella 公开欢迎 Grok。这一信息表明,当模型供应成为战略问题时,商业分发可以压过个人与法律层面的冲突。
这种务实做法此前已有体现。在 Microsoft Build 2025 期间,Nadella 宣布 Grok 将登陆 Azure,而 Musk 则出现在一段预录讨论中。
这项合作将 Grok 与竞争系统一同纳入 Microsoft 的模型目录。它为开发者提供了一条共同的云端路径,以部署来自战略差异显著公司的模型。
从 Azure 可用性迈向直接接入 Copilot,影响更为深远。Azure 服务的是主动选择基础设施的开发者,而 Copilot 则通过面向终端用户的产品提供模型。
这一变化可能影响数百万员工和开发者如何看待 Grok。这个曾主要与 X 关联的模型,成为 Microsoft 生产力与编程环境中的一个选项。
不过,获得访问权限并不保证采用。用户仍需要理由,才会选择 Grok 而非默认模型或已成熟的替代方案。
他们可能看重其回答风格、速度、编码表现,或其愿意处理其他模型会限制的提示词。他们也可能因为信任、安全或治理方面的顾虑而拒绝它。
Microsoft 必须决定如何突出展示这一选项。即使客户在技术上保有控制权,模型菜单中的位置也会影响使用率。
默认设置的影响更大。大多数用户在提出日常问题之前,并不会进行细致的模型比较。
如果 Copilot 自动路由请求,Microsoft 必须解释选择逻辑。用户需要知道,路由是偏向质量、速度、容量、合同条款,还是 Microsoft 的运营成本。
透明的路由器可以让模型多样性更易使用。它可以为文档分析选择一个系统、为代码选择另一个系统、再为快速网络研究选择第三个系统。
不透明的路由器则会产生相反结果。用户可能得到不一致的答案,却不知道底层模型已在不同会话之间发生变化。
因此,OpenAI 最强的防御并非排他性,而是在 Microsoft 产品中关键任务上的持续表现。
如果 OpenAI 模型仍是复杂工作中的首选默认模型,Grok 就会成为有用的额外能力,而非替代品。如果用户主动切换提供商,Microsoft 就会获得证据,表明模型忠诚度弱于产品忠诚度。
Grok 在 Copilot 中的推出,也考验 Microsoft 能否在不同提供商之间维持一致的体验。不同模型在理解指令、引用来源、使用工具或拒绝请求方面,可能存在明显差异。
Copilot 必须在不抹杀模型选择价值的前提下,规范这些差异。这是一项产品挑战,而不只是采购决策。
Microsoft 同样承担声誉风险。无论由哪家公司运营模型,用户都可能因 Grok 产生有害或不准确的回答而责怪 Copilot。
Copilot 品牌充当信任外壳。该外壳内的每一家提供商,都会影响整个系统的可信度。
这正是为什么该公告一方面对 OpenAI 施压,另一方面也加重了 Microsoft 的负担。更大的独立性意味着在评估、披露和一致行为方面承担更大的责任。
Microsoft 和 xAI 接下来必须澄清的问题
下一阶段将由产品文档和用户控制来衡量,而不是社交媒体上的热情。
第一个值得关注的信号,是 Microsoft 的正式发布公告。它需要说明符合条件的 Copilot 产品、支持的 Grok 模型、账户要求、地区以及部署时间表。
此类文档将强化这样一个结论:这是一项广泛的产品扩展。若发布仅限于某个预览环境,Nadella 公告的重要性就会被缩小。
第二个信号是治理模型。Microsoft 应解释管理员能否独立禁用 Grok、提示词在哪里被处理,以及适用哪些保留规则。
客户还需要知道,xAI 是否会直接接收提示词内容,以及 Microsoft 现有的企业数据保护承诺是否保持不变。
清晰的披露将支持 Microsoft 的说法,即用户可以在不同模型之间选择,而不会放弃企业控制权。缺失或零散的披露则会削弱这一立场。
第三个信号是实际采用情况。Microsoft 应提供证据,说明用户是否选择 Grok、将哪些任务交给它,以及组织是否在测试之外启用它。
采用情况很重要,因为模型目录的增长速度可能快于有意义的使用。一项被大多数管理员禁用的选项,能增加谈判筹码,却几乎没有用户价值。
质量比较同样重要。Microsoft 和 xAI 应公布反映真实 Copilot 工作的评估方法,包括基于来源的研究、文档分析、编程和多步骤工具使用。
仅靠基准测试声明无法解决这个问题。组织关心的是,在其自身的权限、文档和工作流中是否可靠。
Microsoft 已公开发布的安全警告进一步增加了紧迫性。如果该公司广泛部署较新的 Grok 版本,就应说明该模型是否获得了与 Grok 4.1 Fast 不同的评估结果。
若缺少这类信息,用户可能会从实验性前代模型进行泛化。清晰的结果则有助于更公平地评估当前版本。
Copilot 的界面还应在整个对话过程中标明当前使用的模型。静默切换提供商可能改变语气、能力、拒绝方式和预期的数据处理方式。
可见的模型标签能让用户复现结果并报告故障,也会让有意义的比较成为可能。
对于开发者而言,GitHub Copilot 提供了一个有用的测试案例。Grok 4.5 和 Grok 4.6 已与一长串竞争性编程模型并列。
观察用户在最初尝试后是否继续选择 Grok。还应观察 GitHub 是否会将其可用性扩展到更多编辑器、套餐以及自动模型选择中。
对于企业买家,决定性问题不是 Grok 能否给出令人印象深刻的回答,而是 Microsoft 能否像治理其他支持模型的输出一样,以可预测的方式治理这些回答。
对于知识工作者,实际问题更简单:切换到 Grok 是否足以改善一项真实任务,从而值得接受不同的行为方式和潜在的政策考量?
Microsoft 的做法鼓励用户比较模型,而不是将任何一家提供商视为永久基础设施。如果这种比较保持透明,它可能带来更好的工具。
它也可能鼓励基于个性或头条新闻进行浅层的模型购物。可靠的评估需要来源核查、任务针对性测试和人工问责。
Grok 进入 Microsoft Copilot 证实,Nadella 希望 Copilot 能够摆脱对任何单一 AI 实验室的依赖而长期发展。Microsoft 正围绕竞争性的模型市场,构建界面、分发和治理层。
9 月的公告推进了这一战略,但并未完成它。Microsoft 仍需向用户准确说明 Grok 出现在哪里,以及选择它后会发生什么变化。
未来几周应会揭示,这究竟是面向消费者和工作场所的广泛推出,还是 Microsoft 更广泛 Copilot 产品组合中的又一次受控扩展。
用户应检查自己的模型选择器,审阅适用的数据条款,并使用与其他模型相同的循证任务测试 Grok。最佳结果并非来自选择一个永久赢家,而是来自理解由哪个模型处理了工作、它接收了哪些信息,以及其回答如何得到验证。



