Ludicity 称 AI 狂热正在摧毁全球决策能力,证据也印证了这一警告
- Sophie Larsen

- 3天前
- 讀畢需時 16 分鐘
已更新:3天前
Ludicity 于 2026 年 7 月 18 日发布了一则直言不讳的警告:AI 狂热正在摧毁全球决策能力,尽管越来越多的证据表明,许多企业项目从未带来可衡量的价值。
这篇文章并非又一次预测即将到来的 AI 泡沫。它描述的是机构已经在改变项目审批、员工招聘、绩效评估和失败报告的方式。其核心指控是,领导者越来越倾向于奖励显眼的 AI 应用,而不是有用的成果。
这一说法来自一位从业者的经历,而非具有代表性的全球研究。作者称自己进行了大约 300 次专业交流,并表示在 18 个月期间观察到的每个 AI 项目都失败了。这一据称为零的成功率尚未得到独立验证。
然而,这一更广泛的警告并非孤立无援。RAND 发现,据部分估算,超过 80% 的 AI 项目以失败告终。IBM 则发现,在接受调查的 CEO 中,只有 25% 表示其 AI 计划实现了预期回报。
如今的冲突已不再是 AI 信徒与 AI 怀疑者之间的对立,而是理性投资的制度承诺,与一个可能惩罚任何质疑 AI 项目是否有效之人的体系之间的冲突。
一篇爆红文章将 AI 失败转化为治理问题
重要的变化并不是又一个令人失望的聊天机器人,而是组织识别并叫停失败项目的能力正在不断下降。
这篇关于 AI 狂热的警告 以一项异常广泛的观察开篇。作者表示,与专业人士、高管及公共部门机构的交流显示,组织正受困于高管的热情与私下的疑虑之间。
文章称,领导者往往缺乏切实可行的 AI 计划。其他决策者虽然意识到了问题,却不敢提出质疑,因为他们的职业发展取决于对既定叙事的支持。
这一区别使问题超越了普通的技术失败。软件项目一直都可能超出预算、错过截止日期并令用户失望。当员工无法在不承担职业风险的情况下讨论这些失败时,它们就会变得更加危险。
文章中最具挑衅性的数字,也是最难验证的数字。作者称,其团队在此前一年半内观察到的 AI 项目成功率为零。
该样本既没有明确界定,也未经过独立审计。我们不知道其中包含多少项目、如何衡量成功,也不知道作者是否接触了过多陷入困境的组织。咨询工作往往让从业者接触到棘手项目,而不是具有代表性的项目。
因此,这一数字应被视为作者报告的亲身经历,而非全球失败率。不过,围绕这一数字的案例确实揭示了扭曲的激励机制如何掩盖糟糕的绩效。
其中一个案例涉及内部聊天机器人。文章认为,员工很少采用这类工具,是因为底层公司文档不完整、已过时或无法访问。
大语言模型(即 LLM)根据其可访问数据中的模式生成回答。对于从未被记录或接入系统的机构知识,它无法可靠地加以恢复。
这造成了一种令人不安的依赖关系。聊天机器人被当作解决知识碎片化问题的方案来销售,但它实际上依赖于组织已经解决了大部分知识碎片化问题。
企业有时会在规划中颠倒这种关系。他们先购买交互界面,随后才发现其底层信息缺失、相互矛盾,或受到彼此不兼容的权限规则管理。
文章还描述了一次与 Mitsubishi 客服的互动。一个语音自然的机器人收集了作者的汽车问题,并承诺回电,但作者表示始终没有接到电话。
原文称,此事发生在文章发表前六个月。AIHOT 的摘要称延迟了六周,但源文章本身写的是六个月。已发布的叙述支持的是时间更长的那个说法。
Mitsubishi 尚未独立证实这一事件。不过,该案例揭示了一个远远超出单一公司的衡量问题。
仪表盘可能会记录机器人已完成通话、识别了请求,或避免了立即转接。客户的实际体验却完全不同:问题没有解决,承诺也没有兑现。
如果管理层追踪的是拦截率而非解决率,失败就可能呈现为成功。拦截率衡量自动化是否阻止了客户与员工取得联系。解决率衡量客户的实际需求是否得到满足。
这一差距解释了 AI 狂热为何正在摧毁全球决策能力。领导者可能收到积极的运营指标,而客户、员工和未完成的工作却承担了真正的成本。
文章还提供了另一个引人注目的案例,涉及一次自然语言分析工具演示。据称,即使在被明确告知其回答的可靠性尚不足以投入生产后,潜在买家仍急于购买这款工具。
演示会将不确定性压缩成一个极具说服力的瞬间。它展示对预设问题的正确回答,却很少呈现权限故障、术语歧义、记录缺失或异常用户行为。
这些问题会在部署后浮现。到那时,高管发起人往往已经将个人信誉与该项目绑定。
因此,新闻点并不在于生成式 AI 有时会失败,而在于 AI 演示、强制命令和职业激励机制可能削弱通常用于揭示失败的反馈系统。
AI 狂热正通过不良激励机制摧毁全球决策能力
当 AI 使用量成为目标时,员工会针对显眼的使用行为进行优化,而不是改善工作。
文章描述了一些企业要求员工先证明 AI 无法解决某个问题,然后才会批准增加人员编制。类似政策将自动化设为默认选项,将人力劳动视为需要额外说明理由的例外。
这项规则听起来颇具财务纪律。它要求管理者在扩大薪资支出前,先测试成本更低的选项。
问题在于这项规则实际衡量的内容。它并不询问自动化能否可靠地完成任务、维持客户信任或应对异常情况。它只要求某个人能够声称自己尝试过 AI。
员工还面临着不对称风险。报告成功意味着支持领导层的战略;报告失败则可能被视为抵触变革、技术能力不足或无法适应。
一旦这种激励机制变得清晰,诚实报告便不再是理性的职业选择。员工学会把普通工作描述为由 AI 辅助完成,避免记录质量欠佳的输出,或选择能让采用情况看起来良好的指标。
文章称,一些组织使用 token 消耗排行榜和使用配额。在这些环境中,更高的模型使用量可能成为投入程度的证明。
消耗量并不等于生产力。奖励 token 用量的制度会鼓励更长的提示词、重复实验,以及无法产生任何可用成果的自动化活动。
这是一个披着技术衡量外衣的常见管理失误。组织之所以选择替代指标,是因为预期成果难以衡量,随后员工便开始针对这些替代指标进行优化。
其结果类似于 Goodhart 定律:一旦某项指标成为目标,它通常就不再是有用的指标。AI 加剧了这一问题,因为它能以极低的边际投入制造大量显眼的活动。
高管可能看到使用量上升、生成的代码增多,或初稿完成时间缩短。这些数字却遗漏了审查成本、纠错工作、安全测试、客户升级处理,以及被放弃优先事项所产生的机会成本。
AI 辅助编程很好地说明了这一问题。统计生成的代码行数会奖励代码数量,尽管可维护的软件通常需要删除代码。衡量建议采纳量则忽略了检查这些建议所需的时间。
同样的扭曲也出现在客户服务中。统计自动化对话次数有利于提高拦截率,却完全无法说明客户是否再次联系、是否通过其他渠道升级问题,或是否悄然流失。
知识工作面临的问题更加棘手。AI 生成的摘要可以缩短起草时间,却可能引入细微的事实错误。节省下来的几分钟清晰可见,但此后基于该错误做出的决策却很难追溯归因。
组织必须先拥有可信的信息,才能围绕这些信息实现决策自动化。可搜索的知识库 可以帮助人们检索证据,但它无法取代所有权管理、访问控制或来源核验。
压力不只体现在个人指标层面。高管还面临来自董事会、投资者、竞争对手和供应商的激励压力。
如果竞争对手宣布了一项 AI 投资,选择推迟投资的领导者就可能显得消极被动。批准薄弱项目的领导者则可以在日后将责任归咎于技术不成熟、集成困难或市场环境变化。
这种失衡奖励行动,而非判断。宣布一项 AI 计划会立即带来声誉价值,其运营成本则会逐渐分散到多个部门中显现。
IBM 2025 年的 CEO 研究 清晰地捕捉到了这种压力。该研究调查了来自 33 个国家和 24 个行业的 2,000 名 CEO。
64% 的受访者表示,对落后的恐惧会驱动部分技术投资,即使领导者尚未清楚理解其价值。只有 37% 的受访者宁愿迅速行动但犯错,也不愿正确但迟缓。
这些回答揭示出一种矛盾。大多数 CEO 原则上反对草率求快,然而近三分之二的人承认,在价值尚未明确之前就已进行投资。
同一项研究发现,50% 的受访者表示,快速投资造成了彼此割裂的技术。只有 25% 表示 AI 计划实现了预期回报,16% 表示已在企业范围内实现规模化应用。
这些发现并不能证明大多数 AI 支出都不理性。IBM 销售 AI 和咨询服务,且其调查记录的是高管的回答,而不是经过审计的项目结果。
不过,这些数据证实了 Ludicity 所描述的组织张力。领导者感到不得不进行投资,而他们的数据、系统和管理结构却仍未做好准备。
中层管理者和技术专家承受着最大的压力。高管确定 AI 优先的方向,而下属必须将这一抽象要求转化为生产软件。
他们承担着相互冲突的职责。他们必须支持战略、保护运营、管理合规,并在不显得妨碍进展的前提下报告进度。
治理正是从这里开始崩裂。最接近实施工作的人掌握着最可靠的证据,却可能最没有挑战项目的自由。
真正的失败往往始于模型之前
当组织在定义问题、用户和可接受错误率之前就选择技术时,企业 AI 最容易失败。
将 Ludicity 的论点与有关 AI 项目失败的独立研究进行比较后,其可信度变得更高。
RAND 为其 2024 年的 AI 失败研究采访了 65 位经验丰富的数据科学家和工程师。参与者来自学术界、不同行业以及规模各异的公司。
研究人员确定了五个反复出现的原因。组织误解了问题、缺乏合适的数据、追逐新技术、缺少部署基础设施,或试图完成超出当前 AI 能力范围的任务。
这些原因之所以重要,是因为其中只有一个聚焦于模型性能。其他原因涉及管理、信息、基础设施和问题选择。
RAND 还援引估算称,超过 80% 的 AI 项目以失败告终。它指出,这将是非 AI 企业 IT 项目失败率的两倍。
这一研究范围需要谨慎看待。RAND 明确排除了仅通过提示工程使用预训练 LLM 的项目。因此,不应将其研究结果视为对所有聊天机器人或生成式 AI 部署的直接衡量。
但这些机制仍然适用。若没有准确的政策、清晰的升级处理规则、可靠的集成,以及对未解决请求负责的人员,客服机器人便无法取得成功。
如果各部门使用不一致的定义,或限制访问必要文档,内部助手便无法可靠地回答问题。编码助手也无法弥补测试缺失和系统归属不清的问题。
AI 会放大软件交付中已有的每一个薄弱环节所带来的不确定性。不同运行之间的输出可能有所不同,模型行为可能在更新后发生变化,而自信的语言可能掩盖错误答案。
这使评估变得更加重要,而不是不那么重要。然而,评估得到的关注往往少于演示,因为它会在采购过程中制造阻力。
可靠的评估始于具体工作。团队必须明确谁使用该系统、它支持什么决策、它需要什么证据,以及哪些错误仍可接受。
他们还必须明确后备方案。如果 AI 系统信心不足、遇到数据缺失或给出相互矛盾的答案,责任必须明确转移给某个主体。
许多项目始终没有解决这些问题。它们从“使用 AI”的指令开始,然后寻找一种能够证明所选技术合理性的工作流程。
这正是 RAND 警告应避免的本末倒置。其研究人员建议关注长期存在的问题,而不是追逐最新工具。
RAND 建议领导者选择值得团队持续投入至少一年的问题。不断变化的优先事项会阻碍团队理解数据并进入生产阶段。
这与狂热驱动的采购形成直接冲突。高管希望在本季度看到明显进展,而可靠的系统则需要耐心完成集成、评估和工作流程重构。
生成式 AI 试点也揭示了同样的分歧。一份 2025 年 MIT NANDA 报告(其内容概述于 GenAI Divide 研究结果)考察了 300 个公开部署案例,并纳入了访谈和员工调查。
该报告称,约 5% 的试点实现了收入快速增长。其余部署则陷入停滞,或几乎没有产生可衡量的损益影响。
被广泛重复引用的 95% 这一数字需要准确界定。它指的是所研究企业实施案例中可衡量的业务影响,并非所有生成式 AI 应用的普遍技术失败率。
试点项目可能在技术上正常运行,却在财务上失败。员工或许会使用它,但在计入许可、集成、审核、培训和支持成本后,组织可能看不到任何可衡量的改善。
该报告将这种差距主要归因于集成和组织学习。通用助手能够很好地服务个人,因为用户可以将其调整用于各种任务。
企业系统面临不同的要求。它们必须从特定工作流程中学习、保留上下文、连接记录系统,并契合现有职责。
该报告还发现了采购方式上的差异。据报告,专业化外部解决方案的成功率高于内部构建的系统,尽管“成功”取决于该研究的定义和样本。
这并不意味着公司应该外包所有 AI 项目。它表明,构建模型界面比围绕一个持久的运营问题维护应用程序更容易。
成功的供应商通常会缩小任务范围。他们围绕单一工作流程进行构建、深度集成,并承担持续评估的负担。
内部团队也可以这样做,但前提是拥有稳定的责任归属和领域知识。临时组建的 AI 专项小组通常两者都不具备。
这就是为什么模型比较可能会分散高管的注意力。嵌入精心设计流程的普通模型,可能比连接到不可靠数据的领先模型创造更多价值。
艰苦的工作依然是那些熟悉的内容:梳理工作流程、清理记录、界定权限、测试边缘情况、培训用户、监控结果并为维护提供资金。
AI 并不会消除这些义务。它会让组织以更难预测的方式,为忽视这些义务付出代价。
零成功率的说法未经证实,但警告依然成立
这篇文章将一家咨询公司的样本上升为全球性结论,确实言过其实,但其对激励机制的分析仍然难以忽视。
负责任的解读必须区分三项主张。
第一,Ludicity 称其团队在 18 个月内观察到的 AI 项目没有一个成功。这是一项第一手主张,但读者无法独立评估项目清单或成功标准。
第二,文章暗示,大多数有关 AI 显著提高生产力的公开说法都不真实。现有证据并不足以支持如此宽泛的结论。
第三,它认为组织正越来越多地扭曲决策,以表达对 AI 的热情。独立的调查和项目研究为这一较狭义的主张提供了有力支持。
将这些主张分开,可以防止怀疑主义变成另一种群体忠诚。读者无需接受文章的完整世界观,也能认识到其中的治理问题。
零成功率这一数字存在明显的选择偏差。咨询公司接触到某些组织,可能恰恰是因为这些组织的系统、流程或内部能力较弱。
成功的公司也可能披露较少的信息。范围较窄的内部自动化可以创造价值,却无需形成公开案例研究,也不需要外部干预。
定义带来了另一项复杂因素。一个团队将成功定义为完成部署。另一个团队则要求实现采用、财务回报、客户满意度或持续的运营改善。
聊天机器人可以按期上线,却仍然损害客户信任。编码工具可以加快初稿编写,却增加审核时间。
相反,即使从未作为单独的利润项目体现出来,微小的生产力提升也可能意义重大。员工可能更快地完成研究或探索更多替代方案,而无需裁减人员。
这篇文章有时将低效的企业项目视为 LLM 普遍缺乏效用的证据。这一推论走得太远了。
个人用户已经在编码辅助、转录、翻译、起草和信息检索中发现了切实价值。机构部署的失败并不能抹去这些用途。
MIT 的研究结果凸显了这一区别的重要性。通用 AI 工具可以在灵活的个人任务中取得成功,而定制企业系统则可能在集成阶段陷入停滞。
因此,一个平衡的结论并不是 AI 毫无作用,而是有用的局部能力不会自动转化为有效的全组织项目。
规模会改变问题的性质。个人助手可以容忍偶尔出错,因为用户会审核输出并理解相关上下文。
企业服务会跨越部门、权限、法规和客户关系。组织必须明确模型出错时由谁负责。
AI 的支持者也可以指出对话式助手之外的成功应用。RAND 援引了 AI 在药物开发、供应链预测、国防传感和自主飞行等领域的应用。
这些案例通常具备范围明确的目标、专业团队、强大的数据管道和广泛的测试。它们支持以问题为先的模式,而非 Ludicity 所批评的以采用为先的模式。
因此,这篇文章最有力的贡献在于诊断,而非统计。它解释了为什么薄弱的项目会在证据转为不利之后继续存在。
高管发起人宣布启动计划。采购部门投入资源。团队构建演示。管理者报告使用情况。员工认识到,提出质疑会带来风险。
每一步都会增加撤销决定的社会成本。取消项目将要求领导者承认,他们先前的信心超出了现有证据所能支持的程度。
组织通常会通过改变衡量标准来应对。收入目标变成参与度目标。采用目标变成许可证分发里程碑。
项目得以存续,但其最初目的却消失了。即使软件仍在线运行,这也是决策失败。
AI 可能会加剧这种模式,因为它的输出看起来很智能。流畅的文字和自然的语音会促使人们推断出系统具备超出实际证明范围的推理、理解和可靠性。
精致的界面也会让技术不确定性显得更小。用户看到的是一个自信的答案,而不是其背后无法访问的文档、概率性生成和脆弱的集成。
这就是为什么治理不能依赖演示或高管信心。它需要独立评估,以及与基础工作直接相关的指标。
美国国家标准与技术研究院的 AI 风险框架提供了一项有用的参考。它围绕治理、映射、衡量和管理系统来组织 AI 风险工作。
这种结构的价值在于程序性。它迫使组织将模型行为与具体情境、受影响的用户、衡量方式和持续责任联系起来。
仅凭框架无法克服惩罚坏消息的文化。领导者还必须保护那些报告测试失败、采用率低和客户受损情况的人。
如果没有这种保护,正式治理就会沦为表演。委员会批准文件,而运营团队继续优化领导层希望看到的任何数字。
关键的不确定性在于文化。公司知道如何开展对照试验、分阶段部署和衡量客户结果。
尚不明确的是,当证据与领导者已经推动的 AI 优先战略发生冲突时,他们是否会接受这些结果。
三个信号将表明机构能否恢复理性
下一阶段将取决于取消项目的纪律、以结果为基础的报告方式,以及员工能否安全地质疑 AI 指令。
第一个信号是如何处理失败的试点。在接下来的几个月里,公司应开始披露哪些项目进入了生产阶段,哪些项目被终止。
取消并不必然意味着失败。实验的目的就是检验不确定性,而健康的项目组合应当关闭无法达到目标的项目。
真正具有揭示意义的问题是,高管会将取消视为学习机会,还是悄悄重新定义项目。透明地结束项目,将有力证明机构决策正在恢复理性。
项目在启动前应明确指定用户、基准、可接受错误率、负责人和停止条件。这些字段会让事后改写叙事变得更加困难。
观察企业是否公布这些运营细节。只关注模型合作、许可证或已启用员工数量的公告,几乎无法证明其价值。
第二个信号是从采用指标转向成果指标。Token 使用量、生成的文档和聊天机器人对话衡量的是活动量。
更有用的衡量指标包括已完成的案例、经验证的准确性、重复使用率、升级处理率、周期时间、客户留存率和总体审核工作量。
这些指标必须配对考量。如果纠错时间增加,输出更快也毫无意义。如果未解决问题的客户悄然流失,自动化问题拦截也毫无意义。
IBM 报告称,68% 的受访 CEO 认为其组织拥有明确的创新回报指标。这种信心与同一调查所显示的有限规模化程度和回报数据显得格格不入。
这种差异值得关注。如果指标确实明确,企业就应该能够说明哪些工作流程得到了改进,以及它们如何将 AI 的影响与其他变化区分开来。
更详细的报告将削弱 Ludicity 对组织正在掩盖不佳表现的广泛质疑。继续依赖模糊的生产力主张则会强化这种质疑。
第三个信号是企业是否允许异议存在。员工应该能够质疑某个 AI 用例,而不会被贴上抵制变革或技术能力不足的标签。
这并不意味着要允许无休止的阻挠。它要求建立一个审查流程,让有关数据、可靠性、安全性和客户影响的疑虑都能得到有记录的答复。
领导者可以用一个简单的问题来检验组织文化:项目的技术负责人能否在不承担职业风险的情况下建议取消项目?
如果答案是否定的,那么组织就没有有效的停止机制。它只有一项由形式化评估背书的 AI 强制任务。
知识工作者也应该审视自己的习惯。这种危险并不局限于高管战略层面。
员工可能会依赖生成式摘要而不核查来源。管理者可能会将一份精美的计划误认为可行的计划。采购者可能会将流畅的演示误认为系统已具备生产就绪能力。
能够融合个人笔记和源材料的工具,在保留证据时可以辅助判断。当用户能够将结论追溯到原始记录时,个人知识工作流最为有用。
目标不是将 AI 排除在决策之外,而是防止对 AI 的热情决定组织愿意看到哪些证据。
这种区别对开发者、企业采购者和普通 AI 用户都很重要。开发者要接手由模糊指令催生的系统。采购者要承担集成风险。用户则要亲身经历那些可能被仪表板掩盖的故障。
Ludicity 的文章无法为企业 AI 之争盖棺定论。其轶事过于片面,最重大的主张仍未得到验证。
但它确实指出了一种关键的失效模式。当机构奖励技术忠诚、压制负面证据,并以活动量而非已解决的问题作为衡量标准时,AI 狂热正在侵蚀全球决策能力。
下一步取决于批准这些系统的人。在为下一个试点项目拨款之前,请先问清楚:什么样的结果足以证明应该停止项目,谁能够报告这一结果,以及领导层是否做好了倾听的准备。


