top of page

MIT研究发现人工智能仅在明确边界内帮助专家

MIT研究显示,生成式人工智能在专家执行限定任务时生产力大幅提升,但超出这些限制使用时则会下降。

该研究追踪了400名法律、咨询和软件开发领域的专业人士,历时六个月。那些将人工智能使用限制在明确工作流内的参与者,平均产出增长34%。而将相同工具应用于开放式问题的参与者,产出下降12%。

研究人员将明确边界定义为具有可重复输入、固定成功指标和已知数据格式的任务。开放式工作包括战略规划和新颖问题构建。该差距与先前人工智能经验无关。

这些发现给鼓励无限制采用人工智能的公司施加了压力。管理者现在必须决定在哪里限制工具访问,或增加强调边界检测的培训。

研究设计聚焦真实工作流

MIT研究人员招募了中型公司的全职员工,并为他们配备了标准生成式工具。每位参与者记录了24周内每次人工智能交互。研究人员根据速度、准确性和下游影响对输出进行评分。

任务在试验开始前分为两组。第一组包括合同审查、代码调试和幻灯片制作。第二组包括市场进入策略、团队重组和产品愿景工作。

两组之间的差距在第八周后扩大。限定任务的专家在第十二周达到峰值增益。开放任务的专家在第二十周前持续显示分数下降。

生产力增益仅限于狭窄范围

使用人工智能进行合同审查的专业人士每周完成的文件多47%。错误率与人工智能使用前基线相比保持不变。同一专业人士尝试用人工智能进行合同谈判策略时,可用草稿减少18%。

咨询师要求人工智能将客户数据格式化为表格,平均减少报告准备时间29分钟。当这些咨询师要求人工智能为新市场推荐定价模型时,修订周期增加了三轮。

软件工程师使用人工智能重构已知代码模式,功能交付速度加快22%。当他们要求人工智能为不熟悉领域选择新架构时,缺陷数量上升31%。

边界充当隐藏护栏

研究确定了三个可预测积极结果的边界标记。首先,任务需要已知的输出格式。其次,输入数据以一致结构到达。第三,成功可通过现有检查清单或测试套件评分。

当任何标记缺失时,性能下降。研究人员将此模式称为清晰度阈值。低于阈值时,人工智能引入噪声,专家必须纠正。

一位参与者用简单的话描述了这种模式。他说,当他提供确切数据点时,人工智能能制作出吸引人的幻灯片,但当他要求在没有数字的情况下提供战略建议时,它会编造无根据的说法。

专家在阈值外损失时间

生产力损失主要来自验证工作。参与者花费额外时间检查事实、纠正语气并删除编造的引用。额外验证抵消了初始时间节省。

高级员工比初级员工显示更小的损失。高级员工更快识别幻觉并一次性编辑删除。初级员工需要两到三遍才能使输出可用。

研究未发现更多培训能消除损失的证据。相反,教授边界识别的培训将下降幅度从12%减至4%。

公司面临新的工作流选择

许多公司仍在开展内部活动,敦促员工在每项任务上尝试人工智能。MIT数据表明,如果忽略边界,这些活动可能降低总产出。

提前定义批准人工智能用例的公司,团队产出高于让选择开放的公司。批准列表与研究发现增益的任务相符。

研究中一位受访经理表示,他的团队现在在打开任何人工智能工具前,都会用边界分数标记每个请求。低于阈值的请求仅由人工处理。

接下来要跟踪的信号

关注公司是否在下一季度发布内部边界指南。早期采用者可能在行业论坛上分享他们的列表。

跟踪教授人工智能工作流设计角色的招聘模式。如果清晰度阈值模式成立,对这些专家的需求可能会上升。

监控测试创意领域(如广告和工业设计)相同划分的学术后续研究。这些领域更接近开放式光谱的一端,可能显示更大损失。

管理知识工作团队的读者可以通过将一个项目拆分为限定和开放任务,并测量有无人工智能支持下的完成时间,来自行测试该模式。结果很可能反映MIT的划分。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page