top of page

Microsoft 的 AI Agent 推进从编程走向财务

8月11日
讀畢需時 13 分鐘

Microsoft 表示,AI Agent 正首先改变工程工作,尽管其可靠性、监管方式以及对就业的影响仍存在悬而未决的问题。

该公司如今希望将同一模式扩展到销售、财务、运营及其他知识型岗位。员工将减少亲自执行常规步骤的时间,转而设定目标、委派工作、审查结果,并在 Agent 达到能力边界时介入。

Microsoft Copilot、Agents and Platform 执行副总裁 Charles Lamanna 在 8 月 10 日接受 Bloomberg Technology 采访时概述了这一转变。他的主张并不止于又一次 Copilot 产品更新。Microsoft 正要求企业围绕由人类监管、能够采取行动的软件来重组工作方式。

这一主张已获得更强的商业分量。Microsoft 在最新财报中披露,Microsoft 365 Copilot 的付费席位已超过 3000 万。三个月前,该公司曾报告付费席位突破 2000 万,同时新增席位数同比增长 250%。

悬而未决的问题是,这些许可证能否转化为高效的 Agent 使用。销售访问权限不同于改变工作流、衡量已完成的工作,以及让员工为自动化决策承担责任。

因此,Microsoft 的核心矛盾在于生产力与替代效应之间。该公司将 Agent 描述为能力放大器,让员工能够投入更高价值的工作。雇主也可以利用同样的效率放缓招聘、整合岗位或削减人员。

Microsoft 正将 Copilot 变成一名员工

Microsoft 的重要转变,是从回答员工问题转向代为完成界定清晰的一部分工作。

传统助手等待提示并返回文本。Agent 则可以规划多个步骤、使用获授权的工具、检查业务数据,并为达成既定结果采取行动。员工转向另一项任务后,它也可以继续工作。

Lamanna 将软件工程视为最清晰的早期案例。编程 Agent 可以检查代码仓库、起草修改、运行测试、回应审查意见,并准备拉取请求。工程师则负责方向把控、技术判断和最终批准。

GitHub 一直在调整其衡量体系,以适应这一运营模式。7 月,它新增了 仓库级指标,用于衡量由 Copilot Agent 创建、合并和审查的拉取请求。这让组织获得的不再只是许可证数量或提示总量。

这一指标之所以重要,是因为 Agent 的采用需要与已完成的工作建立联系。企业如今可以观察 Agent 在何处创建拉取请求、这些修改的合并频率,以及人工审查在哪些环节带来了修正。

Microsoft 希望将这一模式迁移到结构化程度较低的部门。销售 Agent 可以筛选潜在客户、汇集客户背景信息,或准备跟进材料。财务 Agent 则可以核对记录、调查差异,或为审查人员起草说明。

员工仍然拥有业务决策权。然而,通往该决策的流程中将包含更多机器执行。这将改变哪些技能占用时间,以及管理者必须预判哪些失败风险。

Microsoft 多年来一直在推进这一方向。在宣布 2024 年的 Copilot for Finance 之前,该公司已推出面向销售和服务岗位的 Copilot。当前的推进将这些专用体验与可跨应用程序和数据源运行的 Agent 结合起来。

这并不只是一个更好的聊天界面。产品边界正从生成建议转向参与业务流程。每增加一项行动,潜在的生产力收益和错误结果的代价都会同步提高。

工程领域为 Microsoft 提供了一个有利起点。代码可以被编译、测试、比较、审查和回滚。当团队正确运用这些控制手段时,错误可在部署前被发现。

销售和财务中可普遍适用的检查机制较少。一份看似合理的客户摘要可能遗漏一段会改变建议的关系。一条技术上有效的财务记录,仍可能违反内部政策,或导致错误的业务解读。

因此,Microsoft 推进的下一阶段取决于控制措施,而不仅是模型能力。在 Agent 能够处理影响重大的工作之前,企业需要权限设置、日志、评估规则、升级路径以及明确的人类负责人。

3000 万席位改变了赌注

Microsoft 365 Copilot 已不再只是有限的企业试验,但付费席位并不能证明其能够持续创造业务价值。

Microsoft 在 2026 财年第三季度业绩中表示,Copilot 的付费席位已超过 2000 万。拥有超过 5 万个席位的客户数量较上年增长至四倍。

该公司还列举了规模异常庞大的部署。Accenture 的席位数超过 74 万,而 Bayer、Johnson & Johnson、Mercedes 和 Roche 分别承诺部署至少 9 万席位。这些推广使 Microsoft 能够进入众多可测试 Agent 的部门。

截至最新财报更新,付费席位已突破 3000 万。这一增长为 Lamanna 的论述赋予了不同的规模。Microsoft 已无需证明大型雇主愿意购买企业 AI 许可证。

它必须证明员工会将其用于有价值的任务。它还必须表明,组织能够在不失去控制的情况下,从个人辅助过渡到由 Agent 驱动的流程。

Microsoft 的第三季度说明将组织上下文描述为 Copilot 的优势。Microsoft 的上下文层 Work IQ 在企业安全边界内连接人员、角色、文档、通信信息和权限。

Microsoft 表示,该系统覆盖的数据超过 17 EB,同比增长 35%。该系统每天还接收数十亿封电子邮件、文档和聊天信息,以及数亿场 Teams 会议。

这些数字描述的是可用上下文的规模,而不是其在每项任务中的准确性或实用性。更多信息可以帮助 Agent 理解组织,也会使权限设计、检索质量和数据治理变得更加重要。

这正是 Microsoft 可以对 Google、Salesforce、ServiceNow 以及专业 Agent 开发商施压的领域。模型之间的竞争越来越多地取决于其对工作上下文、工具和分发渠道的访问能力,而不仅仅是文本生成能力。

Google 可以将 Gemini 与 Workspace 应用程序和组织数据连接起来。Salesforce 可以让 Agentforce 基于客户记录和销售工作流运行。ServiceNow 则可以将 Agent 置于结构化的服务和运营流程中。

Microsoft 的优势覆盖面异常广泛,因为许多雇主已在使用其身份管理、生产力、开发者、云和安全产品。该公司能够将 Agent 部署在员工阅读消息、参加会议、创建文档、分析电子表格和编写代码的场景中。

广度并不能保证采用。但它确实减少了企业采购者在测试自动化工作流之前必须连接的独立系统数量。

3000 万这一数字也给 Microsoft 带来了内部压力。客户将期待看到部署带来的证据,而不仅是更快地起草文档。他们会希望看到与销售周期、财务结账时间、支持问题解决、软件交付或其他可衡量工作相关的成果。

这一要求解释了 GitHub 为何转向仓库级 Agent 指标。采购者在工程领域之外也需要类似的衡量方式。提示数量和活跃用户数无法说明 Agent 是改善了决策,还是仅仅生成了更多供人类审查的材料。

因此,这一商业增长标志着更艰难评估阶段的开始。Microsoft 已证明自身具备分发能力。现在,它将面对一项更缓慢的工作:在风险容忍度不同的各部门证明可重复的价值。

生产力与人员规模才是真正的对手

Microsoft 将 Agent 描述为扩大产出的方式,而雇主仍可选择将这种产出转化为更低的用工需求。

Lamanna 关于生产力的论点遵循一种熟悉的经济规律。当技术降低完成某项任务所需的投入时,企业可以增加产出、提高质量、降低成本,或兼而有之。

这不会带来单一固定的就业结果。需求可能扩大到足以创造新工作。企业也可以保持产出不变,同时减少人员。

Microsoft 强调的是扩张。在其模式下,一名工程师监管多项编程任务,而非手动完成一套流程。一名销售人员因为 Agent 负责研究和准备工作,可以将更多时间花在客户身上。

财务专业人员可以调查异常情况,而非整理例行报告。管理者可以测试更多情景,因为 Agent 会收集信息并准备初步分析。

这些案例支持的是能力扩张的叙事,但并未消除替代问题。同一套让员工摆脱重复性工作的软件,也可能让一个部门在不新增岗位的情况下吸收增长。

Salesforce 提供了一个明显的对照。其管理层已将 AI 生产力与放缓工程招聘、减少客户支持人员联系起来。这使就业层面的取舍更难被视为纯粹的理论担忧。

Microsoft 自身也处于同样的张力之中。该公司在更广泛的基础设施投资周期中进行人员缩减,同时宣传由 AI 驱动的显著节省。即便管理层表示两者并不存在直接因果关系,生产力主张与裁员仍可能并存。

取消一个岗位与避免未来招聘之间的区别同样重要。使用 Agent 未必会立即引发裁员公告,但仍可能通过自然流失、缩减初级岗位招聘或提高产出预期来改变就业状况。

软件工程再次提供了早期信号。如果资深工程师监管负责执行任务的 Agent,企业对于处理常规编程工作的初级开发人员需求可能减少。同时,它们可能需要更多能够设计系统、审查复杂改动并管理生产风险的人才。

这一转变带来了培训问题。初级任务历来帮助员工培养胜任高级工作的判断力。若将过多此类练习自动化,未来人才管道可能会被削弱。

财务领域面临类似问题。初级分析师通常通过核对、文档整理以及反复接触业务记录来学习。委派这些步骤可以节省时间,但前提是雇主另行建立培养分析判断力的方式。

Microsoft 自身的 2026 年研究也反映了这一担忧。高级用户表示,他们有意保留一部分不使用 AI 的工作,以维持技能的时效性。他们也会更频繁地暂停,以判断应由人类还是 Agent 执行某项任务。

这种行为表明,有效监管需要持续的专业能力。员工一旦失去识别错误所需的知识,就无法可靠地评估 Agent 的输出。

劳动力结果因此将取决于管理层的选择,而非软件本身。管理者决定节省下来的时间是用于增加客户沟通、开展更多分析、缩短截止期限、减少招聘,还是裁减员工。

将这一转变称为生产力提升,并不能决定这一选择。它描述的是一种能力。雇主仍然决定经济价值如何在客户、股东和员工之间分配。

为什么工程部门先于财务和销售

编程智能体率先取得进展,是因为软件工作具备许多业务流程仍然缺乏的反馈闭环。

编程智能体可以接收明确的问题单、检查定义清晰的代码仓库,并提出可审计的修改。自动化测试随后至少会检验其部分工作成果。版本控制会记录变更内容,审查人员则可以拒绝或撤销结果。

这些机制并不会让编程智能体天然可靠。它们只是让错误更容易被控制。一项失败的测试、意外的差异,或一条审查意见,都能在代码抵达用户之前发出可见信号。

GitHub 在 4 月的更新中,向企业报告新增了每日、每周和每月的智能体用户数量。结合拉取请求指标,这些数据可以将采用情况与可观察的交付流程关联起来。

财务和销售往往依赖无法简化为一次测试通过的判断。正确答案会随会计政策、合同条款、客户历史、市场条件,以及经验丰富员工所知晓的例外情况而变化。

负责准备销售机会的智能体可以检索消息和会议记录,但仍需要规则来区分随意评论与购买承诺。一项错误推断可能损害客户关系,却不会触发技术错误。

财务智能体可以比对交易并标记异常,但不能做出缺乏依据的分录、暴露受限数据,或将异常但合法的付款视为欺诈。

这使得限定范围至关重要。企业可以从智能体负责准备工作、由具备资质的员工批准的任务开始。更广泛的自主权应建立在经验证的准确性之上,而不应先于它。

Microsoft 的产品布局为这种设计提供了若干所需组件。Entra 可以管理身份与访问权限。Microsoft 365 提供工作上下文。Copilot Studio 支持定制智能体,而 Agent 365 旨在帮助组织登记和治理这些智能体。

该公司也支持来自自身模型产品组合之外的智能体。在其第二财季电话会议上,Microsoft 将 GitHub Agent HQ 描述为一个用于组织来自 Anthropic、OpenAI、Google、Cognition、xAI 等公司的编程智能体的平台层。

这种平台路径承认企业将使用多个智能体。即使底层模型由其他公司提供,Microsoft 仍希望掌控工作界面、身份、上下文和治理。

这带来了第二重竞争压力。智能体开发者需要访问业务系统,但企业希望集中控制。无论客户选择第一方智能体,还是通过其基础设施接入外部智能体,Microsoft 都可能从中受益。

这一机制仍取决于组织知识的质量。建立在重复文档、过时流程和不清晰权限之上的智能体,只会以更快速度复制这些弱点。

因此,准备开展基于智能体工作的公司,可能需要在追求自主权之前先修复信息管理问题。一个可搜索的知识库既能支持人工审查,也能支持机器检索。

近期最好的部署方式,很可能类似于严格规范的委派。员工定义目标、限制数据和工具、审查中间证据,并对结果承担责任。

这种模式不如一名独立工作的数字员工那样戏剧化,但它与那些已使编程智能体发挥价值的控制机制更为兼容。

Microsoft 的数据无法证明什么

证据显示其分发速度快、使用量不断增长,但并不能证明自主智能体能够持续提升全公司的生产力。

Microsoft 的 2026 年《Work Trend Index》详细说明了员工如何使用 AI。该公司分析了 Microsoft 365 信号,并在 10 个市场调查了 20,000 名已在工作中使用 AI 的知识工作者。

一项保护隐私、涵盖逾 100,000 段 Copilot 对话的分析发现,49% 的对话支持认知工作。另外 19% 涉及与人协作,17% 涉及产出工作,15% 涉及查找信息。

Microsoft 还报告称,66% 的受访 AI 用户表示,该技术让他们有更多时间从事有价值的工作。58% 表示,他们完成了自己一年前无法完成的工作。

这些发现支持 AI 使用已超越起草内容这一说法。不过,该调查聚焦于已经在工作中使用生成式 AI 的人群,许多结果来自自我报告,而非对组织产出的独立测量。

Microsoft 在《Work Trend Index》中明确解释了这些局限性。其准备度分类依赖于报告的行为、信心、文化、管理支持和价值创造情况。

报告发现,只有 19% 的 AI 用户同时具备较高的个人能力和强大的组织准备度。另有 10% 拥有技能,却缺乏支持性的公司系统。半数仍处于新兴的中间类别。

只有 26% 表示其领导层在 AI 问题上明确且持续地保持一致。这一发现让“购买 Copilot 席位自然就能打造适合智能体的业务”这一观点变得复杂。

许可证提供的是技术访问权。它不会界定智能体应处理哪些任务、解决相互冲突的政策,或建立升级处理流程。它也不会培训管理者如何公平评估人类和智能体的贡献。

安全仍是另一项限制。拥有工具访问权限的智能体能做的不止是生成一段不准确的文字。它可以检索敏感数据、发送错误信息、修改记录,或触发另一项自动化流程。

Microsoft 的智能体设计指南强调可靠性、隐私、安全、透明度和问责制。该指南建议团队解释智能体的局限性、监控其行为,并在部署后持续维持缓解措施。

这份指南说明,自主权不能被视为一次性的软件安装。智能体会随着模型、提示词、工具、权限和底层数据的变化而变化。组织需要持续评估,而非一次上线审批。

人工审查的成本也值得关注。智能体产出材料的速度可能快于员工核验的速度。如果审查成为瓶颈,表面上的自动化收益可能只是转移了劳动,而非消除了劳动。

监督还可能造成自动化偏见。员工可能因为系统大多数时候都能正常工作,特别是在截止期限压力下,而接受看似合理的输出。这样一来,罕见的错误就可能穿过原本用于捕捉它的控制环节。

反过来,员工也可能不信任智能体,并重做每一项任务。这会造成重复劳动,并削弱预期回报。有效部署介于盲目接受与完全重复之间。

Microsoft 的席位增长无法解决这些问题。更有力的证据将来自任务层面的结果,包括周期时间、更正率、异常频率、客户结果和经验证的财务影响。

该公司的生产力论点作为一种方向仍然可信,但作为普遍结论尚不完整。工程领域提供了令人鼓舞的机制。财务和销售仍需在各自的运营条件下获得证据。

三个信号将检验 Microsoft 的 AI 智能体推进计划

下一项考验在于,Microsoft 及其客户能否将智能体活动与可信赖的业务结果联系起来。

第一个信号是工程领域以外的任务级测量。GitHub 已按代码仓库报告由智能体创建和审查的拉取请求活动。Microsoft 需要为销售、财务和服务工作流程提供可比的结果衡量指标。

对于销售,有用的证据应将智能体工作与合格销售机会、响应时间、转化率和更正率联系起来。对于财务,则应衡量结账时长、异常处理、被拒绝的建议和审计发现。

如果 Microsoft 公开可信的运营指标,其生产力论点将得到加强。如果报告仍以席位、提示词和活跃用户为中心,买家将难以区分采用情况与业务价值。

第二个信号是 Copilot 增长与劳动力规划之间的关系。投资者和员工将关注采用智能体的部门在招聘、人员流失、重组和产出预期方面的变化。

在稳定就业的同时扩大产出的模式,将支持 Microsoft 关于产能的论点。若反复出现与自动化相关的人员削减,无论供应商如何描述该技术,都会强化替代的解读。

这种区别可能仍然难以证明。公司在调整人员配置时,很少会孤立出单一原因。不过,买家仍可披露节省的时间是用于开展新工作、吸收增长,还是减少劳动力需求。

第三个信号是真实自主权下的治理。智能体注册表、权限边界、审计日志和人工批准必须能在第一方及外部智能体之间发挥作用。一旦发生严重的访问或操作失误,受监管职能的部署就会放缓。

如果公司在保持低错误率和低事故率的同时扩大智能体权限,Microsoft 的战略将更具说服力。如果大多数部署仍仅限于起草工作,因为组织无法信任自主操作,其战略就会被削弱。

买家还应关注竞争对手如何应对。Google 可以利用 Workspace 的分发渠道,Salesforce 可以利用客户数据,ServiceNow 可以利用结构化运营流程。它们各自都有进入企业智能体工作领域的不同路径。

Microsoft 不需要提供每一个胜出的模型。其更大的目标是成为将智能体与身份、公司知识、应用程序和控制机制连接起来的操作层。

这一雄心解释了从编程到财务的发展路径。工程领域提供了可衡量的任务和既有的审查系统。Microsoft 现在希望证明,人工监督能够让智能体在确定性较低的工作中保持可靠。

3,000 万个付费席位提供了一个大型试验场,而非最终结论。决定性的数字不会是有多少员工获得 Copilot,而是有多少可信赖的工作流程在不掩盖额外审查、风险或被替代劳动的情况下带来了更好的结果。

对于开发者、财务团队、销售负责人和企业买家而言,眼下应采取的行动是在扩大访问范围之前选择一个可衡量的流程。定义预期结果、获授权的数据、审查负责人、失败阈值和升级路径。然后将智能体辅助流程与现有工作流程进行比较。Microsoft 的 AI 智能体推进计划将在这种比较支持更广泛委派时取得成功,而不是在管理员仪表板中又出现一张许可证时。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page