top of page

IBM 称 AI 可提升生产力,MIT 称边界至关重要

IBM的研究显示人工智能提升了工作场所的产出,而MIT的发现强调结果取决于将任务保持在人工智能工具的限制范围内。

这两项研究本周发布了发现。IBM追踪了不同岗位的数百名员工。MIT考察了人们超出标准人工智能提示时产出如何变化。两个团队研究了同一核心领域,即人工智能生产力研究,但在收益出现的位置上得出了不同结论。

IBM报告了更高的任务完成率和更快的周转时间。MIT报告称,一旦人们试图将工具超出既定边界,这些收益就消失了。这种对比提出了一个问题,即公司在推动人工智能之前能走多远,结果才会趋于平缓。

IBM数据表明产出明显提升

IBM对480名知识工作者进行了为期四个月的研究。使用人工智能的群体每周完成的任务比对照组多28%。会议摘要和报告草稿的返回时间缩短至正常时间的一半。

研究人员通过统计已完成的可交付成果和跟踪时间日志来衡量产出。最大的改进出现在重复性研究和初稿撰写中。参与者表示该工具帮助他们克服了空白页的困境。

IBM研究人员表示,当员工停留在常见用例内时,结果最为显著。他们没有测试极端创意任务或高度专业化的技术工作。

MIT研究强调硬性限制

MIT研究人员对210名参与者进行了平行实验。他们测量了用户试图推动人工智能超出其通常范围时的情况。当任务保持在标准边界内时,生产力上升。一旦人们要求进行新颖分析或模型训练模式之外的自定义代码,产出便会下降。

MIT团队使用了与IBM相同的任务集,但增加了边界测试。当员工要求人工智能生成远离源数据的想法时,错误率上升。随后需要更多审核时间来纠正输出。

MIT研究人员指出,其他研究中报告的许多收益来自狭窄、可重复的工作。将提示集扩展到该狭窄范围之外,就消除了测得的收益。

两项研究,一个共同条件

当人工智能停留在熟悉的工作流程内时,两个团队都看到了收益。差异出现在边缘地带。IBM专注于日常平均任务。MIT测试了当这些任务移出模型可靠区域时会发生什么。

这一模式与早期的人工智能生产力研究一致,后者发现收益集中在结构化活动中。开放式工作需要额外的人工监督,从而抵消了速度提升。

跟踪人工智能采用情况的公司现在面临更窄的目标。他们必须确定哪些工作停留在工具的有效范围内,哪些不在。

什么算作边界内

IBM将边界内任务定义为数据摘要、标准报告格式化和会议转录清理。MIT确认了同样的任务能产生可靠结果。边界外任务包括自定义财务建模、推测性策略撰写以及新编程语言的代码。

停留在边界内的员工报告需要更少的修订。那些走出边界的人在编辑上花费的时间多于初稿节省的时间。

这一共同发现指向一条实用规则。在扩大人工智能访问之前,先衡量当前任务类型。那些已经由模板或重复步骤处理的任务,是显示出可衡量提升的任务。

限制出现在真实工作流程中

MIT研究的员工日志显示出明显的下降。当提示偏离训练示例超过两个标准差时,准确率下降19%。平均每份文档纠正错误的时间增加34分钟。

IBM记录了用户尝试为新行业生成客户提案时类似的纠正。该工具生成了看似合理的文本,但遗漏了行业特定约束。审核人员不得不重写大部分内容。

这些模式表明,公司在宣布广泛的生产力成果之前,应先审核工作流程。IBM的标题数字仅在大多数日常工作仍属于测试类别时才成立。

公司现在关注任务类别

几家审查这些研究的公司开始按边界契合度对任务进行分类。一个团队根据MIT标准映射了每周的每一项可交付成果。他们发现62%的当前工作处于安全范围内。

其余38%需要更重的人工审核或完全不同的方法。管理者相应调整了推广计划,而不是将人工智能应用于每个流程。

这一调整避免了初始速度收益在更广泛使用三个月后消失的常见模式。

接下来要跟踪的信号

三项进展将澄清生产力效应能延伸多远。首先,IBM计划在8月发布后续数据集,其中包括创意和技术角色。其次,第三个学术团体将于下季度在销售和工程团队上测试相同的边界框架。第三,MIT将于9月发布最常见模型系列的错误率曲线。

每次发布都将显示边界效应是否保持一致,或随新模型版本而变化。等待这些数据的公司 meanwhile 可以使用相同的任务类别进行较小的内部审核。

这两项研究共同缩小了公司可以提出的主张。人工智能能改善停留在限定限制内的工作的产出。超出这些限制的结果需要单独测量。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page