Microsoft 价值 2.8 万美元的 AI 使用异常值考验其提升 AI 使用效率的努力
据报道,Microsoft 记录到一名员工在 28 天内消耗了价值 2.8 万美元的 AI 资源,这也让最新的 Google News 头条背后浮现出尖锐矛盾。该公司多年来一直鼓励员工拥抱 AI,如今却在告诉他们:消耗更多 token 并不必然创造更多价值。
这一惊人数字出现在一份自愿填写的薪酬电子表格中,而非经过审计的公司支出报告。据报道,约有 350 名员工填报了 AI 使用数据,提交数据的中位数约为 300 美元。这使得头条中的数字成为一个极端异常值,也可能是填报错误,或是异常昂贵的工作负载。
更大的故事并不取决于这一条目是否具有代表性。据有关其内部指引的报道,Microsoft 已分别引入部门 token 预算和个人使用情况追踪。其传递的信息已从最大化采用率,转向最大化每单位 AI 消耗所带来的可衡量成果。
这一变化反映出企业 AI 中日益普遍的问题。自主式编程系统可以反复读取文件、生成代码、运行测试、检查失败原因,然后再次尝试。每一次循环都会消耗 token;token 是用于处理提示词和生成回复的小型计量单位。
高消耗可能代表有价值的自动化、浪费性的重复操作,或两者兼而有之。使用情况仪表板能够记录活动,却很少能区分这些结果。Microsoft 正在同一个向企业出售 AI 驱动未来的组织内部,直面这一衡量缺口。
Microsoft 报告中的 AI 使用数据究竟说明了什么
2.8 万美元的条目很引人注目,但数据分布和质量不足比头条本身更重要。
该数字来自一份内部电子表格,Microsoft 员工在其中自愿分享薪酬细节和 AI 使用情况。它并非通过财报、监管文件或 Microsoft 官方公告发布。
根据最初的 AI 支出报道,最高的一笔提交来自 Microsoft 的 Customer and Partner Solutions 组织。该条目覆盖一个滚动的 28 天周期。
参与范围有限。报道显示,接近 600 名美国员工提交了部分信息,其中约 350 人包含了 AI 使用情况。Microsoft 在全球拥有超过 22.3 万名员工,因此该样本规模很小,且属于自我选择的群体。
这一限制使得任何将报告中的中位数外推至整个 Microsoft 的做法都不负责任。填写使用情况的员工可能与未填写者存在显著差异。该电子表格也可能混合了内部系统生成的估算值与手动输入的数值。
不过,报告中的数字仍展现出一个重要模式:AI 消耗量相差数个数量级,即便是在相似组织中工作的人也是如此。
据报道,CoreAI 的部门中位数最高,为 975 美元。Security 紧随其后,为 526 美元;Microsoft AI 为 490 美元;Cloud and AI 为 325 美元;Experiences and Devices 为 250 美元。
据报道,Azure 的中位数为 241 美元,而 Customer and Partner Solutions 的中位数为 134 美元。然而,最高的个人条目恰恰来自这一中位数较低的组织。
其他被报道的异常值包括:CoreAI 的 1.6 万美元、Cloud and AI 的 1.5 万美元,以及 Security 的 1 万美元。这些数字表明,仅凭职位或部门无法解释使用量。
这些数据没有揭示任何员工产出了什么。它没有说明每笔金额背后的模型、工作负载、智能体数量、计费方式或业务结果。
缺失的这一背景信息具有决定性意义。一名工程师可能在处理重大事故、迁移大型代码库或测试内部产品时大量消耗资源。另一名用户也可能因控制不佳的循环而产生相似账单,却几乎没有产出可用成果。
这笔 2.8 万美元的条目也可能是错误的。单位换算、重复记账事件或错误的自行填报,都可能制造人为异常值。Microsoft 尚未公开核实这一个人数据,也未解释其计算方式。
即使存在这些保留条件,该电子表格仍揭示了为什么原始消耗量是一个薄弱的绩效信号。最高使用者的支出超过报告中位数的 90 倍,但现有数据并未说明其价值是否也相应提高。
这才是事件真正的触发点。Microsoft 不再只需面对员工是否采用 AI 的问题,它还必须判断哪些采用方式足以证明其可变基础设施成本是合理的。
Google News 头条只是故事的一部分
Google News 的关注点集中在一名员工身上,而 Microsoft 的内部政策揭示了一场覆盖全公司的激励机制变化。
据报道,Microsoft 的应对措施早在这一异常值成为病毒式传播的头条之前就已开始。2026 年 7 月,公司各部门据称收到了 AI token 预算目标。员工也可以通过内部仪表板查看自己的个人消耗情况。
Microsoft CoreAI 集团执行副总裁 Jay Parikh 在 8 月初的一份备忘录中强化了这一政策。他的信息聚焦于价值,而不是全面减少 AI 使用。
据报道的 内部 AI 指引,Parikh 写道:“Tokenmaxxing 并不是我们正在优化的目标。”他要求员工关注影响客户和业务的结果。
Parikh 还表示,Microsoft 将以管理其他关键资源时同样的纪律来管理 token 支出。据报道,该备忘录并未公布统一的支出上限。
这一区别很重要。Microsoft 并没有要求工程师停止使用 AI,而是告诉他们,仅有使用量并不能满足公司的目标。
这项政策反映出企业采用初期产生的激励问题。公司希望员工开展实验,因此领导者赞扬不断增长的使用量和可见的参与度。
一些组织引入了仪表板或非正式竞赛。这些系统让 token 消耗很容易被衡量,即使有用产出依然难以量化。
员工会对可见的衡量指标作出反应。如果管理层强调使用量,员工就有理由让模型持续运行、启动并行智能体,或选择资源密集型系统。
这种行为后来被称为 tokenmaxxing。该术语指的是最大化 AI token 消耗的努力,有时是因为高使用量被视为雄心或生产力的证据。
Microsoft CEO Satya Nadella 曾承认自己也偏爱高强度使用 AI。更重要的是,他曾质疑客户是否从昂贵的前沿模型及输入其中的数据中获得了足够价值。
这一变化类似于软件管理中过去的失误。代码行数曾是一项方便的生产力指标。这种衡量方式奖励产出量,尽管更短、更易维护的代码往往能更好地解决问题。
Token 也带来了同样的诱惑。它们提供一个看似客观的精确数字。然而,这个数字衡量的是计算活动,而非已完成工作、客户满意度、可靠性或收入。
因此,这一病毒式传播的异常值分散了人们对 Microsoft 更艰巨任务的注意力。该公司必须用一种能够跨越工程、销售、安全和产品团队运作的成果模型,取代简单的采用指标。
管理者需要将消耗量与具体交付成果联系起来。这些成果可能包括已解决的事故、已完成的迁移、已接受的代码变更、更短的支持队列,或已验证的客户机会。
这种衡量需要的不只是月度仪表板。团队需要可追溯的工作流,以保留提示词、输出、审核决策和最终结果。
结构化的 AI 工作流 可以帮助团队将生成材料与其支持的决策关联起来。这种背景信息比 token 总数更有参考价值。
Microsoft 的政策变化表明,采用 AI 已进入一个要求更高的阶段。实验仍然受到鼓励,但无法解释的消耗将受到审视。
更多 Token 并不保证更好的 AI 结果
自主式系统可能消耗大量上下文,却无法带来与之成比例的准确性提升。
传统聊天交互相对有边界。用户发送提示词,模型处理其上下文并返回答案。随后,用户再决定是否值得进行下一轮互动。
AI 编程智能体的运作方式不同。它们可以检查代码仓库、搜索文档、修改文件、执行命令、审查失败情况,并重复这一循环。
每项操作都会增加上下文。较长的代码文件、命令输出、日志和先前的尝试,都可能在后续步骤中重新交给模型。因而,一项单独任务可能扩展为许多规模庞大的推理调用。
并行智能体会放大这种影响。一名员工可能要求多个智能体调查同一个 bug,或构建相互竞争的实现方案。这种方法可以提高覆盖范围,但也可能重复昂贵的工作。
投入与质量之间并非线性关系。一项针对八个前沿模型的 2026 年研究发现,自主式编程任务消耗的 token 远多于普通编程对话。
研究人员报告称,相同任务的 token 消耗量最多可能相差 30 倍。更高的使用量并不总能带来更高准确性。
根据这项 智能体支出研究,性能通常会提升至中间水平,随后趋于饱和。前沿模型也难以预测自身最终会使用多少 token。
这些发现解释了为何实行统一的员工上限会过于粗糙。一些困难任务需要广泛探索代码仓库;另一些任务则因智能体缺乏信息或遵循薄弱计划而陷入重复循环。
输入上下文驱动了测得消耗量的大部分。这一点挑战了这样一种观点:员工只需要求更短的回答,就能轻松控制成本。
一个反复加载大型代码仓库的智能体,可能在生成任何可见输出之前就消耗大量资源。工具结果和测试日志还会进一步扩大上下文。
模型选择又增加了一个变量。最强大的模型可能适用于架构决策、复杂调试或安全分析;但对于格式调整、常规文档或简单代码转换,它可能并无必要。
据报道,Microsoft 的应对方式是将 GPT-5.6 Sol 设为内部工作的默认选项。报道将其描述为更适合该公司工作流、token 效率更高的选择。
默认选项并不禁止使用其他模型。它改变的是起点,因此无需员工手动评估每项请求,便可影响成千上万项日常选择。
这类似于模型路由:软件将较简单的任务发送给高效系统,并将昂贵模型留给更困难的工作。路由可以通过政策、自动分类或用户选择实现。
Microsoft 自己的商业文档强调了对 AI 智能体的使用控制。其 Copilot 成本指引 介绍了计量消耗、支出控制以及减少不必要处理的方法。
因此,这一内部转向与 Microsoft 客户面临的产品挑战不谋而合。企业希望智能体能够完成有价值的工作,同时让浮动用量保持可理解、可治理。
效率并不意味着压缩每一条提示词。它意味着选择足够的上下文、推理和验证,以获得可靠结果。
一次更短的运行若产出错误代码,并不经济。同样,一个智能体在得出可接受答案后仍无限重复测试,也谈不上经济。
真正有意义的衡量单位,是以可接受质量完成的工作。Token 数量之所以重要,是因为它会影响达成这一结果的成本;但它本身无法定义结果。
Microsoft 的 AI-First 承诺遭遇预算现实
Microsoft 正试图遏制低效消耗,同时不削弱其此前要求员工践行的 AI-First 行为。
这是本文最核心的反转。Microsoft 鼓励广泛采用 AI,因为内部使用既能加快开发,也能展现对自家产品的信心。
但这一战略带来了次级问题。一旦 AI 深度嵌入各类工作流程,其边际消耗就变得难以预测。
按席位计费的软件能为财务团队带来可预测的经常性成本。智能体服务的用量则会随任务复杂度、模型选择、上下文长度和重试行为而变化。
一名员工可以启动一个或多个智能体。每个智能体都能调用工具,并在初始提示后继续执行工作。固定数量的员工不再意味着固定规模的软件消耗。
这种张力不止存在于 Microsoft 的内部预算中。该公司向面临同样核算难题的客户销售云基础设施、Copilot 产品、开发者工具和智能体平台。
因此,Microsoft 身兼两种角色。客户使用更多 AI 会让它受益,但它也必须证明,更高的消耗能够带来商业价值。
其内部政策可以成为改善治理的证据,也可能暴露成本可见性、路由和产品默认行为方面的不足。
据报道,这份备忘录谨慎地平衡了这两种角色。Parikh 表示,Microsoft 并非追求更少的 Token,而是追求每个 Token 带来更大的影响力。
这句话既保留了公司的 AI-First 承诺,也改变了绩效标准。员工可以继续探索,但高频活动需要基于结果作出说明。
更广泛的市场也已开始进行类似调整。美联社报道称,随着 Token 开支上升,企业正在考察路由、开放模型和更高效的系统。
Bain 顾问 Jue Wang 表示,一些大型组织的 Token 成本几乎每隔一个月就会翻倍。她认为,公司经常将高端模型分配给其实并不需要它们的任务。
Mozilla 首席技术官 Raffi Krikorian 将 tokenmaxxing 比作按代码行数衡量程序员。他预计,随着企业认识到这种做法与生产力之间联系薄弱,它会逐渐淡出。
这场企业 Token 转向也给 OpenAI 和 Anthropic 带来压力。两家公司都受益于高强度使用,但客户会要求更高效率和更清晰的回报。
Microsoft 的处境尤其复杂,因为它在与 OpenAI 保持密切关系的同时,也在开发自己的模型、基础设施和编排层。
内部默认设置能够影响这种平衡。将常规工作路由至高效模型,可以在保留专业系统访问能力的同时降低消耗。
竞争对手面临同样的取舍。据报道,Amazon 曾尝试对内部 AI 使用量进行排名,随后将注意力转向成本。Meta 在采用热潮期间也曾鼓励激进的 Token 消耗。
据报道,Uber 在几个月内便用尽了原本为 AI 编程工具规划的年度额度。这一案例表明,智能体的采用速度可能迅速压垮围绕传统开发者软件设计的预算。
这些案例并不能证明企业 AI 缺乏价值。它们表明,采用速度可能快于治理和核算能力。
问题不在于智能体是否比文本编辑器消耗更多资源,而在于它是否缩短交付周期、提升可靠性、扩大产出,或减少足够多的人工工作,从而证明这种消耗合理。
Microsoft 的政策让这一问题无法回避。每一家购买 Copilot 或构建智能体的大型企业,最终都将面对财务负责人提出的同样要求。
这项 28,000 美元的说法仍无法证明什么
在缺少工作负载和结果数据的情况下,所报道的异常值无法证明浪费、生产力,或 Microsoft 全公司的行为模式。
该电子表格的自愿填报性质会造成选择偏差。密切追踪 AI 使用情况的员工可能更愿意提交,而轻度用户则可能忽略这一栏。
这些数值也是自行报告的。Microsoft 尚未说明员工是从标准化追踪工具中复制数据、进行估算,还是对不同用量类别作出了不同理解。
以美元等值呈现的字段还会带来额外歧义。它可能代表内部基础设施成本、面向客户的等值价格、分配额度,或另一种核算模型。
这些数值不可互换。零售等值金额可能远高于公司的边际计算成本;内部摊销也可能包含直接模型推理之外的管理费用。
现有报道并未确认该员工身份,也没有描述其角色、任务、模型、产出或业务结果。
这使得最具煽动性的解读无法得到验证。Microsoft 外部的任何人都无法判断,这名员工究竟是在浪费资源,还是完成了异常高价值的工作。
该条目可能反映压力测试,也可能涉及产品评估、客户演示、数据准备或大型软件项目。
它也可能反映某个智能体陷入了高成本循环。没有执行轨迹,这两种解释都仍属推测。
报道中的部门中位数也应同样谨慎对待。基于自愿提交得出的中位数,无法衡量 Microsoft 各组织的平均消耗。
各部门执行的工作也不同。CoreAI 工程师与模型交互得更频繁,是完全合理的;而专注客户关系或行政流程的团队则未必如此。
即使是有效比较,也需要产出指标。一次高成本的安全调查可能避免更大的损失;一份低成本生成的摘要若包含未被发现的错误,同样可能造成损害。
这种不确定性强化了改善衡量体系的理由,而非仓促实施严格上限。硬性限制可以阻止浪费,但也可能在最关键时刻中断有价值的工作。
按任务设定预算是一种替代方案。团队可以为复杂工作分配更多容量,同时通过高效系统处理常规请求。
审批阈值是另一种方案。员工可以在正常范围内自由使用模型,随后为异常高负载的工作记录用途。
结果评估可以审查已接受的代码、已解决的问题、部署频率、事故率和节省的时间。任何单一指标都无法独立提供完整答案。
质量必须仍是计算的一部分。生成看似合理却存在缺陷工作的智能体,可能只是将劳动从创作阶段转移到审查阶段。
数据治理又增加了一个成本维度。即使 Token 支出看似有限,将专有材料发送到外部模型中也可能引发安全、保密和留存方面的担忧。
因此,Microsoft 必须避免用另一项简单指标替代原有指标。奖励低消耗可能和奖励高消耗一样造成扭曲。
最强有力的政策应衡量高效、可靠的完成情况。它应认可必要的探索,同时调查无法解释的异常值。
这种方法还依赖可信记录。团队需要了解哪些来源、提示词、模型输出和人工决策共同促成了某个结果。
可搜索的知识库能够保留这些运营上下文。它无法自动计算回报,但能为审查者提供月度总额之外的证据。
Microsoft 尚未公开披露这样的评估框架。其据报道推出的预算和仪表板代表了成本可见性,而这只是治理的第一层。
该公司的下一个挑战是归因。它必须将消耗与有用结果联系起来,同时避免鼓励员工操纵任何取代 Token 的指标。
Microsoft 收紧 Token 管控后值得关注的事项
三个信号将表明,Microsoft 是在构建更好的 AI 经济模式,还是仅仅在压低显眼的成本问题。
第一个信号是 Microsoft 的默认模型政策。报道称,该公司将 GPT-5.6 Sol 设为内部标准选项,目标是提高效率。
值得关注的是,Microsoft 是否保留这一默认设置、扩大自动路由,或改变高消耗模型的访问权限。稳定的路由政策将支持这样一种说法:公司追求的是更聪明的资源配置,而非不加区分地削减成本。
模型路由必须继续对任务需求保持敏感。将每项任务都交给最便宜的系统,可能增加返工、降低质量,并抵消预期节省。
真正具有揭示性的指标将是任务是否成功完成,而不是 Token 图表是否下降。Microsoft 应审查,在默认设置变更后,团队是否维持交付速度、代码质量和事故表现。
第二个信号是部门预算如何影响员工行为。据报道,Microsoft 为各部门分配了 Token 目标,但没有公布统一的个人上限。
这种结构赋予管理者灵活性,但也可能造成执行标准不一致。一个团队可能将目标视为指导,另一个团队则可能把它变成硬性上限。
有用的系统应允许高价值工作的书面例外,也应调查反复出现的异常值,而不假定每个大数字都代表滥用。
如果 Microsoft 在缺乏结果控制的情况下引入僵硬限制,这次收紧将显得像传统的成本削减;如果它将预算与任务归因结合,这项政策则将支持更广泛的效率战略。
第三个信号是 Microsoft 向企业客户提供什么。内部经验应当影响 Copilot 仪表板、智能体控制、路由和成本预测。
客户需要的不只是消耗发生后的账单。他们还需要警报、预算、模型建议、任务级归因,以及对昂贵智能体行为的清晰解释。
如果这些控制功能能够更轻松地跨产品配置,Microsoft 就能巩固自身地位。这会将内部治理问题转化为产品经验。
失败则会呈现不同面貌:成本继续令客户措手不及,管理员实施粗糙的限制,员工则将工作转移到未被追踪的工具中。
竞争层面的反应同样重要。OpenAI、Anthropic、Google、Amazon 和开放模型提供商都拥有提高 Token 效率和可观测性的动力。
即使一款更便宜的模型在高难度基准测试上落后于最强系统,它仍可能赢得常规工作负载。对企业买家而言,可预测的完成成本可能与峰值能力同样重要。
这项 28,000 美元的异常值终将淡出 Google News 的新闻周期,但核算问题仍会存在。
Microsoft 让正确的问题变得清晰可见:组织从其 AI 消耗中获得了什么?答案不能只来自 Token。
开发者应关注这些新控制措施能否在不拖慢复杂工作的前提下减少浪费。企业采购方在扩大部署前,也应要求提供任务级别的成本与质量证据。
知识工作者同样应区分可见的忙碌与已完成的成果。运行更多 agent 可能会让人感觉效率更高,却也可能带来额外审核、重复劳动和碎片化的上下文。
企业 AI 的下一阶段,将奖励那些把模型与可问责工作流连接起来的组织。Microsoft 能否证明其内部控制措施确实改善了结果,还是下一条极端的电子表格记录又会再次暴露同样的衡量缺口?



