top of page

Anthropic 因 Claude 进入高风险工作而面临反弹

Anthropic 于 2026 年 5 月发布了针对复杂职场任务的 Claude 模型更新。此举将系统置于财务审查、法律草案和采购工作流中,错误将产生直接成本。与 Anthropic 直接分享的匿名反馈显示,与五家企业早期采用者(两家投资银行、一家全球物流运营商和两家私募股权公司)的内部测试表明,文档审查时间持续减半。

Claude 职场 AI 现可处理多页合同并生成电子表格模型。早期采用者的内部测试显示,其将文档审查时间缩短一半。但多家公司报告了行项目不匹配和遗漏风险条款的问题。

此转变发生在 OpenAI 和 Google 上季度均限制受监管行业的代理访问之后。Anthropic 选择了相反的路径。

新的 Claude 功能引发企业试点

Anthropic 增加了跨会话的持久记忆以及与 Slack 和 Google Drive 的直接连接器。这些变化让团队只需上传一次项目文件,即可查询数周后的结果。

一家物流公司对供应商合同分析进行了为期四周的测试。该模型标记出 87% 的人工审核者后来确认的定价不一致。一家私募股权公司用它来总结董事会材料并提取行动项。这两家机构的客户报告后来促使 Anthropic 更新了文档。

使用率从 3 月的 12% 付费席位跃升至 5 月的 41%。公司将增长归因于名为 Deep Research 的新技能,该技能无需额外提示即可从上传的文件夹中提取上下文。

模型在实际工作中的不足之处

当 Claude 处理财务模型时,多个团队遇到了反复失败。导出时列发生偏移,公式引用了错误单元格,总计与源数据不符。

一家中型银行的合规官描述了一起事件:Claude 遗漏了一条价值 200 万美元的终止条款。该错误仅在最终法律审查时被发现。同一家公司在三周内记录了八起类似问题,包括将 45 万美元的设备行项目显示为 4.5 万美元,以及遗漏将责任上限设定为 12 个月的赔偿条款。

Anthropic 更新了文档,指出用户必须验证每个数值输出。该警告是在中型银行和物流公司的客户报告到达公司支持渠道后出现的。Anthropic support update

评论者指出速度与准确性的权衡

Stanford 的研究人员将 Claude 的输出与早期的基于规则的合同工具进行了比较。“Claude 生成了更易读的摘要,但在未见协议上的新事实错误率达到 19%,”Stanford AI Lab 团队表示。(Stanford AI Lab comparison

一家大型律师事务所的合伙人表示,一旦助理花费额外时间检查每个条款,时间节省就消失了。他补充说,初级员工现在将模型视为初稿生成器,而非最终权威。

欧盟监管机构上月发布了草案指南,要求在 AI 对财务建议有实质贡献时进行披露;一位欧盟发言人指出,“只要 AI 实质性影响财务建议,透明度义务就将适用。”(EU draft AI guidance)多家合规团队暂停了推广计划,等待更明确的规则。

公司权衡内部防护措施

继续测试的公司增加了新的审查层。一家保险公司要求对任何包含现金流预测的 Claude 生成电子表格进行人工签字确认。另一家公司编写了一个脚本,在文件到达财务团队之前,根据原始数据交叉检查总计。

这些步骤减少了标头时间节省,但降低了风险。5 月的采用数据显示,拥有正式审查协议的团队报告的升级事件少于仅依赖模型输出的团队。

第一波之后仍不明确的问题

目前尚不清楚当 Claude 串联多项技能(如研究后生成演示文稿)时,错误复合的频率如何。早期测试侧重于单一任务。

Anthropic 已安排在 9 月发布后续报告,其中将包含生产使用中的错误率。在此之前,采购团队继续运行小型试点而非全面部署。

演示性能与生产风险之间的差距仍定义了 Claude 职场 AI 的当前阶段。

9 月前需关注的信号

关注 9 月的错误报告,了解财务模型准确性的变化。若降至 10% 以下,将缓解 5 月浮现的担忧。

跟踪欧洲监管机构是否在夏季结束前最终确定披露规则。新要求可能放缓任何处理欧盟客户的公司的采用时间表。

观察 Google 或 OpenAI 的竞争代理工具是否扩展到相同的合同和建模工作流。他们的回应将显示当前反弹是 Anthropic 独有的,还是整个类别共有的。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page