top of page

为什么程序员比其他专业人士更常使用 AI

The Economist 将一场冲突置于 Google News 的核心:AI 公司需要其他专业人士开始像软件开发者一样工作。

程序员已经会将重要工作交给来自 Anthropic、OpenAI、Google、GitHub 以及专业初创公司的助手。许多人如今通过对话描述任务,让智能体检查文件、编辑代码、运行测试并汇报结果。

这种工作流在软件开发之外仍不常见。律师、银行家、客服人员和管理者面对的数据结构化程度较低,评估更困难,规则更严格,尝试新工具的激励也更少。

这一差别之所以重要,是因为 AI 供应商正在为规模远大得多的市场建设基础设施。The Economist 估计,到 2030 年,年度 AI 收入必须达到 2.5 万亿美元,才能覆盖计划中的数据中心投资;其估计当前收入约为 1500 亿美元。

因此,这并不是一个关于编程助手是否受欢迎的故事。问题在于,编程是否为职场采用提供了可复制的模式,还是仅仅代表了一个格外有利的例外。

证据指向一个令人不太舒服的答案。编程展现了高强度 AI 使用的样子,但其成功依赖于大多数职业并不具备的条件。

Google News 将程序员差距置于核心

AI 编程已成为一项商业标杆,其他所有职场应用如今都必须努力追赶。

The Economist 发表、Mint 刊载的原始分析描述了软件工作中的显著变化。一些硅谷工程师如今会对着麦克风说出指令,而不再亲自输入每一行代码。

语音转录会将这些指令发送给 AI 智能体。智能体是一种能够检查自身环境、选择行动,并在有限人工指导下完成多个步骤的软件。

可见的产出仍然是代码,但生产过程正日益类似于监督、审查与纠错。

据 The Economist 报道,五分之四的开发者表示自己使用 AI 编程工具。2025 年的开发者调查提供了一个高度相关的指标:84% 的受访者已使用或计划使用 AI 工具。

调查还发现,51% 的专业开发者每天使用 AI 工具。这一频率使软件开发区别于偶尔尝试聊天机器人的行为。

采用推动了市场快速增长。The Economist 估计,Cognition、Cursor、Lovable 和 Replit 在 2025 年 6 月合计创造了约 8 亿美元的年度经常性收入。

其估计这些公司的当前合计总额为 60 亿美元。年度经常性收入(ARR)指按全年预测的订阅收入。

这些数字是估计值,而非经审计的合并账目。不过,趋势很明确:开发者正在为直接嵌入日常工作流的工具付费。

The Economist 还援引 SemiAnalysis 的估计称,在 2026 年第二季度,编程贡献了 Anthropic 和 OpenAI 合计 ARR 的一半以上。两家公司均未公开详细的编程收入拆分。

这种集中度揭示了 Google News 标题背后的利害关系。编程并不只是众多成功应用中的一个,它正在帮助支撑领先模型供应商的经济模式。

OpenAI 高管 Colin Jarvis 以异常直接的方式承认了采用差距。他告诉 The Economist,其他白领工作者尚未“进入这个世界”。

这一表态之所以重要,是因为 AI 公司无法仅靠开发者订阅来证明扩张基础设施的合理性。它们需要在规模大得多的专业市场中实现同样高强度的活动。

法律、金融和客户服务看起来是最主要的候选领域。每个领域都涉及高成本劳动力、重复的信息处理,以及软件能够部分支持的决策。

它们的增长是真实的,但采用程度尚未达到编程所具备的使用频率、自主性和自下而上热情的组合。

这一差别改变了核心问题。问题不再是 AI 能否起草合同、总结通话或构建财务模型。

问题在于,专业人士是否会在真实工作中反复信任这些输出。持续依赖,而非令人印象深刻的演示,才能创造持久收入。

为什么编程成为 AI 理想的职场场景

代码为 AI 提供了知识工作中罕见的条件:大量示例、机器可读的上下文,以及答案失败时快速获得的反馈。

公共代码仓库包含海量源代码,也包含文档、问题讨论、变更历史,以及开发者如何修复早期错误的示例。

The Economist 报道称,代码在某些模型训练数据集中可占近五分之一。对于私下谈判、客户纠纷或内部投资决策,并不存在可比的公共数据集合。

这种供给为模型提供了大量输入、输出、模式和纠正示例。它不能保证生成的代码正确,却创造了异常有利的训练条件。

软件还拥有内置验证系统。编译器能够发现无效语法,自动化测试则会将行为与预期结果进行比对。

代码检查器、类型检查器、安全扫描器和持续集成系统提供更多反馈。编程智能体通常可以自行运行这些工具,无需等待人工审查者。

这在生成与评估之间形成了一个循环。模型提出改动、执行测试、读取错误信息,再尝试另一种解决方案。

其他专业任务很少提供如此清晰的信号。一位平静的客户仍可能流失,一份措辞精致的合同也可能隐藏不利义务。

一份财务预测可以在内部保持一致,却仍建立在薄弱假设之上。一项有说服力的招聘建议可能会复制偏见,而不会触发机器可读的错误。

软件项目还以数字形式保存了大量运营上下文。智能体可以检查代码库、工单系统、文档、日志和应用程序编程接口。

应用程序编程接口,即 API,使软件能够与另一个系统交换结构化信息。API 为编程智能体提供了通往完成任务所需工具的直接路径。

相比之下,其他职业中的关键上下文往往仍然分散。它可能存在于私下对话、未成文惯例、旧附件,或经验丰富员工的记忆中。

这一上下文问题解释了为什么组织知识系统如此重要。团队需要先建立一个可搜索的知识库,智能体才能可靠地找到相关的本地资料。

开发者还有另一项优势:他们将失败视为工作流的正常组成部分。他们本就习惯调试、审查差异、回退改动和重新运行测试。

编程工具也频繁变化。工程师会持续学习新的框架、语言、编辑器和部署系统。

这种文化使 AI 采用呈现出异常明显的自下而上特征。个人开发者可以先尝试助手,而不必等雇主重新设计整个业务流程。

这些工具也在用户熟悉的界面中出现。自动补全出现在编辑器里,聊天窗口在源文件旁打开,智能体则进入终端。

最初的尝试并不需要独立的转型计划。开发者可以将 AI 用于一个函数、一项测试或一条错误信息。

这种渐进式入口降低了采用摩擦。成功的尝试随后扩展到更大的任务,包括代码审查、迁移、调试和功能实现。

这一机制类似于阶梯。每一个经过验证的结果都支持稍大范围的委派,而现有工程控制措施限制了错误造成的损害。

大多数白领工作者没有这样的阶梯。他们需要从偶发协助跃升到影响重大的委派,却没有可比的测试基础设施。

扩张逻辑真实存在,但并不均衡

法律、金融和客户服务增长迅速,但收入增长并不能证明其从业者会达到开发者的使用强度。

The Economist 将法律科技列为竞争者之一。其估计 Harvey、Clio 和 Legora 的合计 ARR 在一年内翻倍,达到约 10 亿美元。

Harvey 表示,在其平台上花费的时间正以每月翻倍的速度增长。这一说法表明用户参与度正在加深,尽管该公司尚未发布经独立审计的使用数据。

法律工作具有若干类似编程的元素。合同会使用重复出现的条款,研究遵循既有权威资料,文档审阅则涉及大量文本集合。

差异同样重要。法律含义取决于司法管辖区、客户目标、谈判历史和风险承受度。

一项条款可以在语法上正确,却在法律上危险。几乎不存在自动化测试能够判断某项妥协是否真正服务于客户。

金融提供了另一个大型市场。The Economist 报道称,Rogo 在一个季度内新增了 100 家企业客户,并将 ARR 提升了 50%。

金融专业人士本就使用结构化数据、模型和可重复的文档。这些特点为研究与分析助手创造了有前景的切入点。

然而,金融决策将数字输出与时机、判断和问责结合在一起。模型可以准确检索数字,却可能误解哪些假设真正重要。

客户服务看起来更接近软件,因为公司拥有通话记录、政策和历史解决方案。Cresta CEO Ping Wu 告诉 The Economist,对数千通电话的分析能够揭示过去仅掌握在员工手中的知识。

据报道,另一家客户服务 AI 公司 Sierra 在 6 月达到 2 亿美元 ARR。The Economist 称,这一数字是其 2025 年 11 月水平的两倍。

风险投资也随之跟进。该刊物估计,投资者在 2026 年向客户服务 AI 初创公司投入了 30 亿美元,超过其他任何 AI 应用类别。

这些市场表明职场 AI 正在普及,但尚未证明已达到程序员级别的使用。

客户服务人员通常无法自行安装实验性工具。雇主选择软件、连接数据库、建立权限,并界定可接受的回复。

律师和银行家面临更多限制。保密要求、记录保存、监管义务和职业责任,使不受控制的试验代价高昂。

这形成了一种自上而下的采用模式。供应商必须完成安全审查、系统集成、评估和培训,使用规模才能增长。

编程的推进方式往往恰恰相反。开发者先个别采用助手、证明本地价值,随后推动全公司采购。

AI 供应商正试图缩小这种差距。Harvey 使用合成数据,即由模型生成、而非直接从人类活动中收集的训练材料。

专业劳动力平台也将领域专家与模型开发者连接起来。这些专家创建示例、评估答案,并说明专业决策背后的推理过程。

与此同时,前置部署工程师在客户组织内部工作,以使模型适应本地系统。他们的角色结合了技术实施与持续的流程探索。

这些方法可以让专业工作环境更适合机器读取。然而,每一种方法都需要投入人力、完成集成,并掌握客户特定的知识。

这削弱了这样一种假设:一个通用模型能够像编程助手一样轻松进入每一种工作场景。软件业以外的采用模式,可能更接近“咨询服务加软件”,而非单纯的自助式软件。

编程的流行并不能证明生产力

高使用率证明开发者重视 AI 访问能力,但并不能证明每项任务都会更快或更好地完成。

Stack Overflow 的调查揭示了这种张力。尽管 84% 的受访者正在使用或计划使用 AI 工具,但只有 33% 信任其准确性。

46% 的受访者明确不信任 AI 输出。只有 3% 表示自己高度信任 AI。

采用与信任之间的差距并不矛盾。开发者可以频繁使用 AI,同时审查每一项重要结果。

同一项调查发现,52% 的受访者认为 AI 工具或智能体提升了生产力。然而,大多数人并未使用智能体,或仅依赖更简单的助手。

开发者也不愿在高责任领域委托 AI。76% 的受访者不计划将 AI 用于部署和监控,69% 则拒绝将其用于项目规划。

这些发现表明,采用具有任务针对性。即便架构决策仍由人主导,搜索、解释、文档编写、样板代码和测试仍可能具有吸引力。

METR 的一项随机生产力研究提出了更明确的警示。16 名经验丰富的开源开发者在成熟代码库中完成了 246 项任务。

在获准使用 2025 年初的 AI 工具时,参与者完成任务的时间反而增加了 19%。研究开始前,他们预计 AI 能将完成时间缩短 24%。

研究结束后,他们仍相信这些工具节省了 20% 的时间。他们的主观感受与实际测得的完成时间朝着相反方向变化。

这一结果不应被泛化到所有开发者。该研究聚焦于熟悉大型代码库的资深贡献者。

自实验以来,工具也已有所改进。不同的开发者、项目和工作流程可能产生不同结果。

但这项发现挑战了一种常见的思维捷径:使用率、满意度和主观速度感,并不能等同于可测量的生产力。

AI 之所以让人感觉有用,可能是因为它减少了令人厌烦的输入工作、提供了陌生语法建议,或让探索过程更具吸引力。即使审查输出需要额外时间,开发者也可能更喜欢这种体验。

更广泛的就业证据同样需要谨慎解读。美联储研究人员发现,计算机和数学相关工作产生了超过三分之一的 Claude 查询样本。

这些职业仅占劳动力的 3.4%。这种失衡证实了异常高的暴露程度,但该样本排除了企业、团队和 API 活动。

作者还发现,不同的暴露度衡量方法存在显著分歧。两种方法都将编程列为暴露度最高的职业之一,但暴露度本身并不能识别对就业的影响。

这一差异对投资逻辑至关重要。AI 提供商需要让客户获得足够可测量的价值,才能使使用在预算审查后得以延续。

产品可以凭借新鲜感和便利性迅速扩散。持续的企业支出则需要证据证明它能改善产出、质量、速度或产能。

即使从这种怀疑视角来看,编程仍保有优势。软件团队可以衡量被接受的变更、缺陷率、审查时间、部署频率和任务完成情况。

其他职能通常缺乏类似的基准。因此,改进与失败都更难证明。

因此,风险不止于模型准确性。企业可能部署了 AI,却不知道它是否节省时间、是否将工作转移给审查者,或只是把成本转移到其他环节。

为什么程序员可能仍是例外

承诺是实现普遍的办公自动化,但当前机制异常依赖软件的结构及其用户的行为。

Anthropic 自身的数据支持这一集中度论点。其 2025 年 9 月的使用报告发现,编程占 Claude 活动样本的 36%。

教育类活动从 9.3% 上升至 12.4%,科学任务则从 6.3% 增至 7.2%。这些增长显示出多样化趋势,但并未取代编程的首位。

Anthropic 2026 年 1 月的报告发现,到 2025 年 11 月,主要与编程相关的 Claude.ai 对话占比已从 40% 的峰值降至 34%。这一变化表明其正扩展到其他活动。

然而,三分之一的对话仍代表高度集中。它也只反映一家公司的产品组合,而非整个 AI 市场。

Anthropic 后续的方法论更新指出,长时间运行的智能体使简单的对话计数参考价值下降。Claude Code 和 Cowork 会话可能包含比普通聊天更多的工作。

这使跨职业比较更加复杂。一次编程会话可能包括文件检查、实现、测试和修订,而另一位用户可能只提出一个写作问题。

软件开发还会将模糊性转化为明确的产物。需求会变成工单,设计会变成文档,改动会变成提交,故障会变成日志。

这个过程为智能体提供了可观察的状态,也为人类提供了可以批准、拒绝或修改工作的检查点。

其他领域的专业知识往往具有关系性。良好结果可能取决于信任、同理心、时机、组织政治,或未明说的偏好。

这些信号很难转化为训练数据。记录它们还可能带来隐私、同意和治理问题。

监管进一步加剧了这种差异。律师必须保护特权信息,金融机构必须监督通信,而客户服务系统必须遵守消费者保护规则。

AI 供应商可以增加控制措施、审计日志和检索系统。这些措施有所帮助,但在员工获得价值之前,也增加了实施工作。

编程助手市场同样表明,要实现可靠的委托仍面临很高要求。Anthropic 产品经理 Cat Wu 表示,责任最终仍由工程师承担。

Gartner 分析师 Philip Walsh 同样认为,面向业务的软件仍需要专业人士参与。他列举了质量、可扩展性、安全性和稳健性等持续存在的限制。

这种对人类的要求并不意味着编程智能体不重要。它解释了为何它们在有能力评估其表现的人群中传播得最快。

最强的 AI 用户未必是最容易被自动化取代的劳动者,而可能是最有能力发现并修复自动化失败的人。

这一原则给普遍采用的预测带来麻烦。许多员工既没有试验的权限,也没有评估每项模型生成决策的专业能力。

企业可以通过围绕验证重构工作流程来应对。他们可以建立经过批准的数据来源、评估标准、升级规则和人工审查机制。

但这样做会将采用转化为组织工程。购买模型访问权限只是第一步。

因此,Google News 提出的问题带来了一个反转。编程被视为每个职业都会拥抱 AI 的证据,但它反而可能揭示了其他职业所缺乏的前提条件。

AI 投资热潮接下来必须证明什么

下一阶段取决于三个信号:更广泛的持续使用、可信的生产力衡量,以及成本更低的客户定制部署。

第一个信号是,法律、金融和客户服务产品在初次推广后,是否能维持高频使用。客户数量和 ARR 反映的是购买,而不是使用深度。

投资者应关注续约率、活跃用户、完成的工作流程,以及现有客户内部的扩展情况。供应商很少公开披露所有这些指标。

最有力的证据将显示,员工每天都会回来使用,并将更大比例的完整流程委托给 AI。偶尔起草或总结只能支持一个更小的市场。

如果非编程应用的使用频率接近开发者水平,普遍采用的论点将得到强化。如果使用仍然只是偶发的,编程看起来就更像一个上限。

第二个信号是独立的生产力证据。企业需要进行涵盖审查时间、错误修正、合规工作和下游故障的比较。

诸如生成文档数量或完成聊天次数等简单指标可能具有误导性。当员工必须花更多时间核查时,更高产出价值有限。

受控研究无法覆盖每一家组织。企业仍可采用分阶段推广、匹配团队、质量抽样,以及前后对比的运营指标。

更好的评估也将澄清人类判断在哪些地方创造价值。AI 系统可能加快初步分析,同时不触及最终决策。

这样的结果仍可为投资提供理由,只是它支持的主张比完整工作流程自动化更为有限。

第三个信号是部署成本。前置部署工程师和领域专家可以将私有组织知识转化为可用上下文,但这项工作必须能够以经济方式扩展。

应关注供应商是否构建可复用的连接器、共享评估方法和行业特定控制措施。这些组件可以减少每位客户所需的定制人力。

还应关注通用模型与专业系统之间的平衡。通用模型提供广泛能力,而专业产品则将领域数据、权限和工作流程打包在一起。

如果专业供应商无需庞大的实施团队也能增长,其他职业可能会变得更像编程。如果每次部署都需要大量定制,利润率和采用速度将面临压力。

对开发者而言,近期的教训是衡量结果,而不是统计生成的代码行数。有价值的技能是向任务定义、上下文管理、验证和系统判断转移。

对企业买家而言,教训同样务实。应从具备可访问数据、明确成功标准、可逆操作和可问责审查者的工作流程开始。

知识工作者应思考,他们的工作在哪些地方已经产生数字化反馈。这些领域最接近软件测试的等价物。

投资热潮并不要求每位员工都成为程序员。但它确实要求其他职业形成从指令到经验证输出的、同样可重复的路径。

这正是 Google News 故事背后尚未解决的挑战。模型仍在持续改进,商业采用也正从工程领域向外扩展。

然而,软件开发结合了公开训练材料、数字化上下文、自动验证、适应性强的用户和可衡量的产出。目前没有其他主要职业具备同样的组合。

在接下来的几个月里,忽略孤立的演示,关注持续性的行为。专业人士是否在委托完整工作流程、衡量结果,并且无需持续技术支持就会回来使用?

如果答案变成肯定,程序员就是广泛职场转型的第一个例子。如果答案仍是否定,他们便是支撑更大投资承诺的有利例外。

有用的问题不是你的团队能否访问 AI,而是你的工作流程能否提供正确的上下文、发现错误,并证明委托创造了价值。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page