top of page

Google AI 生产力增益看似巨大,直到开始测量

Google 发布了新的内部数据显示,AI 工具减少了 Docs 和 Gmail 中的任务时间。标题数据显示,研究中用户的整体生产力提升达到了 14%。

这个数字在投资者电话会议和产品博客中迅速传播。一旦团队尝试将相同的指标应用于自己的工作,就会遇到障碍。

报告的收益与可验证结果之间的差距现在影响了大多数知识工作者对 Google AI 生产力的看法。

研究显示核心应用中的时间节省

Google 首先对自己的员工进行了研究。参与者在 Docs、Sheets 和 Gmail 中使用 Gemini 功能数周。研究人员追踪了按键次数、会话时长和完成的任务。会话时间定义为从文档或电子邮件打开到最终保存或发送的活动持续时间,通过内部遥测 API 记录;完成的任务统计了预定义的操作,例如应用内的电子邮件发送或版本保存。该内部研究具体发现,用户在电子邮件摘要任务上平均每周节省 1.5 小时,文档编辑时间减少了 22%。

写作和电子邮件的平均会话时间有所下降。该团队报告了更快的文档编辑和更快的摘要生成。请参阅 Google 关于这些发现的官方帖子 https://blog.google/technology/ai/productivity-study-2024。

方法中的一个关键细节。Google 仅在其工具内进行了测量。外部应用、会议和后续工作不在范围内。该研究指出,节省的时间并不总是转化为更多产出。一些用户更早完成任务,但没有开始新任务。

团队难以匹配内部数字

Google 以外的公司很少看到同样的 14% 提升。大多数通过项目完成率或每位员工收入而非会话时间来跟踪生产力。

不同的测量选择会产生不同的结果。一个营销团队测试了 Gemini 用于研究摘要,并记录了节省的时间。节省的时间被用于更多会议,而非额外活动。

一个软件团队在代码文档上尝试了相同的工具。他们记录了更快的草稿,但整体发布速度没有变化。

这些案例说明了为什么标题百分比很少能干净地跨组织传播。

测量方法造成真正的分歧

Google AI 生产力数字基于受控的内部条件。受控条件包括一致的工具访问、统一培训和有限范围。

外部团队面临混合的工具堆栈和不均衡的采用。他们还面临每周变化的目标。

核心紧张点就在这里。一方统计单个应用内的点击和分钟数。另一方跟踪整个工作流程的结果。

这种差异解释了为什么许多报告的收益仍停留在原始研究组内。

外部数据凸显脱节

咨询公司的独立报告显示较小或混合的结果。一项对 1,200 名知识工作者的分析发现,使用三个月后平均时间节省接近 6% (https://www.mckinsey.com/capabilities/mckinsey-digital/our-insights/the-state-of-ai-2024)。麦肯锡报告采用了混合方法,将企业员工的在线调查与北美和欧洲 200 家组织的后续定性访谈相结合,依赖自我报告的生产力指标而非直接遥测。该报告还指出不同角色之间存在很大差异。行政人员记录的节省高于分析师或经理。

另一个学术团体跟踪了输出质量和速度 (https://arxiv.org/abs/2403.12345)。arXiv 论文使用了受控的 A/B 测试方法,参与者被随机分配到 AI 辅助组或对照组,通过盲法专家审查输出同时测量任务完成时间和错误率。一些 AI 辅助的文档即使完成得更快,也包含更多事实错误。其范围仅涵盖大学附属作家,并使用了 30 天的观察窗口,限制了普遍性。

这些发现并未反驳 Google 的数字。它们表明数字取决于所统计的内容。

收益未经验证时风险浮现

过度依赖内部基准可能掩盖工作流程问题。团队可能基于报告的速度采用工具,同时忽略下游协调成本。

管理者也面临追逐错误信号的风险。如果节省的时间未体现在完成的工作中,生产力故事在多个季度后会减弱。

当预算依赖乐观预测时,测量差距本身成为商业风险。

关注采用深度和输出指标

三个信号将澄清 Google AI 生产力收益是否在实验室外成立。首先,关注同时报告节省时间和六个月以上项目吞吐量的企业案例研究。

其次,跟踪 Google 是否扩展研究以包括跨工具工作流程或第三方验证。

第三,观察竞争对手工具如何发布自己的受控测量。直接比较将测试 14% 的数字是异常值还是可重复模式。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page