top of page

“不问不说”AI 经济的兴起

9月1日
讀畢需時 12 分鐘

Google News 呈现了 Bloomberg 的一个尖锐观点:在规则尚未明确、衡量机制薄弱、以更少资源完成更多工作的压力日益加大的情况下,员工仍在采用 AI。

“不要问,也不要说的 AI 经济”这一说法,概括了一种令人不安的交换。雇主希望获得更快的产出,却往往避免追究这些产出是如何生成的。员工使用个人 AI 账户,将材料复制到公开工具中,并保持沉默,因为获批的替代方案可能更慢,或者根本无法使用。

这并不只是又一个关于聊天机器人普及的故事,而是可见的生产力与不可见的流程风险之间的冲突。Microsoft、Anthropic 及职场研究人员都记录了这种分歧的部分表现,尽管没有任何单一数据集能完整呈现其规模。

核心矛盾很简单:企业希望获得 AI 带来的效率,但许多企业缺乏让 AI 使用情况变得可观察所需的政策、系统和激励机制。这一缺口在日常办公工作中催生了一种影子经济。

Google News 聚焦了什么

重要的变化并非员工发现了 AI,而是非正式的 AI 使用已成为日常生产流程的一部分。

生成式 AI 进入许多工作场所,更多是通过个人行为,而不是有计划的软件部署。员工开设个人账户、测试提示词,并找到模型可以节省时间的任务。采购、安全和法务团队往往在之后才介入。

这种采用模式不同于传统的企业软件上线。企业通常会选择供应商、配置访问权限、培训用户并监控活动。影子 AI 则颠倒了这一顺序,因为员工在组织评估服务之前就已开始使用它。

Microsoft 和 LinkedIn 的职场 AI 研究发现,2024 年员工主导的 AI 采用已相当普遍。在接受调查且使用 AI 的知识型员工中,78% 将自己的工具带入了工作场景。

这一数字并不意味着每个个人工具都会造成安全事件。它表明,正式采购记录无法描述职场中真实的采用程度。软件清单与实际工作状况已经脱节。

这种行为也跨越了组织层级。普通员工使用 AI 来总结文档、起草信息、编写代码、分析反馈和制作演示文稿。管理者则使用类似工具审阅计划、组织会议,并将不完整的笔记转化为精致文档。

这些活动往往看似无害,因为每一条提示都很短小。但累积效应则截然不同。一连串提示可能泄露客户姓名、产品计划、源代码、财务假设、法律策略或内部意见分歧。

Bloomberg 的表述之所以重要,是因为它为围绕这类活动形成的社会安排命名。员工可能不会主动说明自己使用了多少 AI。只要产出有所改善、又没有明显问题出现,管理者也可能不会追问。

因此,Google News 突出的不只是技术趋势,而是一个围绕策略性模糊构建的劳动与治理问题。所有人都能从工具中获益,但责任仍未被界定。

这种模糊性在日常运营中显得高效。当客户质疑某个回答、机密数据出现在未获批准的系统之外,或自动化决策伤害了某个人时,它就会变得脆弱。届时,组织必须重建一个自己从未选择观察的流程。

将其称为隐蔽经济,并不意味着每项 AI 辅助任务都被禁止。它意味着,AI 在持续创造经济价值,却并未稳定地出现在官方工作流、预算、绩效指标或风险登记册中。

产出是可见的,方法却不是。

为什么雇主和员工都接受这种沉默

这种非正式交易得以延续,是因为双方都能从让 AI 使用部分保持不言明中立即获益。

雇主面临着提高生产率的巨大压力。他们已经为模型、助手、基础设施和实验投入资金,但许多人仍难以将这些投资与可衡量的业务成果联系起来。员工悄然采用 AI,可以带来收益,却无需启动一套完整的转型计划。

员工面对的是另一种压力。他们必须处理不断增加的信息、文档、会议、研究和行政工作。AI 可以减少将信息从一种格式转换为另一种格式所花费的时间。

一名员工若用 AI 将会议笔记整理为项目更新,就几乎没有动力披露每一条提示。披露可能引发额外审查、对工作质量的质疑,或对更高产出的要求。沉默保住了节省下来的时间。

管理者也可能从“不问”中受益。如果团队更早交付,管理者就能获得结果,而无需直面数据处理、署名归属或评估方面的棘手问题。眼前的回报是具体的,风险却显得遥远。

这种安排可能扭曲绩效预期。一名员工可能借助 AI 将原本需要四小时的任务压缩至两小时。一旦管理层将更快的节奏视为常态,节省下来的时间就不再属于员工。

生产率提升会变成更高的基准。员工随后需要持续使用该工具,才能满足由早期 AI 使用所形成的预期。自愿的捷径会逐渐变成非正式的岗位要求。

其中还存在披露难题。一些员工担心,承认广泛使用 AI 会让自己的岗位显得可被替代。另一些人则担心,隐瞒此事日后会显得不诚实。

管理者则从另一个方向面临同样的矛盾。他们可能鼓励试验,同时又警告员工不要暴露敏感信息。若没有获批工具和清晰示例,这类信息只是表达了雄心,却没有提供可用的运营模式。

研究支持 AI 能在明确场景中提升绩效这一说法。一项 NBER 实地研究考察了客服人员使用的生成式 AI 助手,并报告平均生产率提升了 14%。

这些收益并非均匀分布。经验较少、技能较低的员工获益更多,这表明系统有助于传递与高绩效员工相关的工作模式。这一发现使简单的替代叙事变得更为复杂。

受控的客服环境并不等同于整个经济体。研究人员可以观察工具、工作流、产出和绩效指标。许多办公室部署并不具备这种可见性。

当员工使用未经批准的服务时,组织无法可靠地区分有用协助与虚构内容、复制文本、隐性偏见或处理不当的数据。它看到的只有最终文档或决策。

这正是“不要问,也不要说”依然具有诱惑力的原因。衡量成本高昂。沉默让双方都能先主张收益,再决定由谁承担风险。

真正的较量是生产率与问责之间的较量

首要冲突不是员工对抗雇主,而是可衡量的产出对抗可问责的生产过程。

组织早已评估完成的工作。他们审查销售结果、已解决的工单、已发布的功能、已完成的分析和已发布的文档。生成式 AI 改变的是产生这些结果的隐秘过程。

一份精致的答案可能包含捏造的说法。可运行的代码可能引入不安全的依赖项。一份简洁的客户摘要可能遗漏关键异议。一项有说服力的招聘评估可能复制早期决策中的偏见。

这些失败并不总会体现在产出中。因此,问责依赖于有关来源、审查步骤、模型行为和人类判断的信息。影子 AI 剥离了其中大量背景。

Anthropic 的首份 Economic Index分析了 Claude 对话中的模式,而非仅依赖问卷回答。其早期发现显示,增强型使用多于完全自动化,尽管这一界限取决于任务分类方式。

增强是指人和模型共同完成工作。自动化则是指模型在有限人工参与下完成任务。两者都能改善产出,但需要不同的控制措施。

员工要求模型提供备选标题时,仍由员工负责选择。若系统生成并发布标题而无人审查,更多责任就转移到工作流设计者和模型运营者身上。

这种差异在调查过程中至关重要。企业必须知道员工是获得了协助、委托了决策,还是在未经核验的情况下接受了输出。最终文件很少能回答这些问题。

正式的 AI 系统可以保留日志、限制数据保留时间、执行身份控制,并限制模型访问。它们还可以将输出与获批的知识来源连接起来。个人账户未必遵循相同的配置。

仅仅批准工具并不能解决问题。员工即使获得企业聊天机器人,仍可能使用其他模型,因为它响应更好、支持所需的文件类型,或使用起来更方便。治理必须与便利性竞争。

这给技术领导者带来了压力。他们不能只是封锁所有公共服务,然后宣布成功。过度限制的政策会将更多活动推向不可见的系统之外。

他们也不能宣布每项试验都可接受。当模型让工作变快时,客户合同、隐私义务、职业责任、版权问题和安全要求依然适用。

实际的较量在于两种运营模式之间。

一种模式只衡量结果。它将 AI 协助视为一种看不见的个人技巧,直到某件事出错。这种做法将摩擦降到最低,但几乎不保留证据。

第二种模式将 AI 使用视为生产系统的一部分。它识别获批任务、记录重要交互、测试输出,并分配审查责任。这种做法需要投资,也可能放慢试验速度。

两种模式都无法消除人类判断。区别在于,这种判断是成为有意设计的控制措施,还是被假定存在的安全网。

Google News 的报道指向了一个更广泛的经济问题。如果 AI 生产率始终处于隐蔽状态,企业便无法准确地在员工、雇主和技术提供商之间分配其价值,也无法为相关风险定价。

员工可能贡献了领域知识、机密背景、提示词设计、验证工作和最终问责。模型贡献的是生成的语言或分析。组织贡献的是数据、系统、声誉和法律风险敞口。

将最终结果称为“AI 生成”,抹去了这些贡献。将其称为完全由人类产出,则抹去了其中的机制。更好的衡量必须同时保留两者。

生产率数字无法证明什么

证明 AI 能加快特定任务,并不能证明它能改善整个组织。

许多 AI 研究测试的是边界明确、产出清晰的活动。参与者总结文本、起草商业文档、编写代码,或回答客服问题。研究人员可以比较完成时间,并根据既定标准评估质量。

真实工作包含更多依赖关系。更快的初稿可能导致更慢的审查。更多生成的代码可能增加测试要求。简洁的摘要可能掩盖不确定性,进而在之后导致糟糕的决策。

本地生产力与组织生产力并不相同。一名员工可以节省一小时,却把核验工作转移给同事。一个部门可以产出更多内容,同时在其他环节制造更高的审核成本。

任务复杂度也会改变质量衡量方式。与战略建议相比,结构化客服答复的正确性更容易测试。后者取决于假设、背景和未来事件。

Stanford AI Index汇集了显示 AI 能力和采用率快速提升的研究。它也记录了持续存在的评估难题,以及 AI 在不同任务上的表现不均衡。

基准测试可以表明模型能够回答一组明确的问题,却无法证明员工知道模型何时出错。这种人的校准能力是另一项独立能力。

影子 AI 让这种校准更难审查。组织可能不知道答案由哪个模型生成、提示词中输入了哪些信息,或员工是否核查了引用来源。

调查数据也存在另一项局限。员工可能少报被禁止的行为、夸大生产力,或对“使用 AI”有不同理解。有人把偶尔编辑算作使用,另一些人则把整篇初稿交给 AI 完成。

使用日志也有自身盲点。它们能显示服务内的交互,却无法说明输出是否有用;同时还可能遗漏个人设备、外部账户或嵌入式 AI 功能上的活动。

这种不确定性并不会抹杀生产力提升的可能性,但会改变领导者能够负责任地作出的表述。企业可以说员工正在采用 AI,或某项明确部署改善了可衡量的工作流程。

但企业不应仅凭订阅数量就推断全公司的收益,也不应因为员工生成了更多文字、代码或演示文稿,就宣称实现了转型。

需要审慎追问的是净价值:在审核、纠错、协作和安全工作之后,AI 是否降低了产出可靠结果的完整成本?

这个问题必须逐一按工作流程回答。一个通用的生产力百分比会掩盖客服、软件开发、法律审查、研究、销售和管理之间的重大差异。

同样的审慎原则也适用于失业论断。自动化完成任务的一部分,并不必然取消整个岗位。它可能改变技能结构、减少初级工作、提高产出预期,或将责任转移到其他地方。

不过,不确定性不应成为无所作为的借口。组织已经依赖于不可见的 AI 使用。拒绝衡量既无法保障安全,也无法维持就业稳定。

恰当的回应是谨慎的可见性。企业需要掌握足够的信息来理解重大风险,而不是把每一条普通提示词都变成合规事件。

影子 AI 要求不同的治理模式

一项可行的政策,必须让安全披露比隐瞒更容易。

许多治理计划都从禁止活动清单开始。限制措施很重要,尤其涉及机密数据、受监管的决策和高影响力的自动化行动时。然而,禁止规定不能替代易于使用的工具和易于理解的流程。

员工需要清晰的分类。某些任务可以允许广泛试验;另一些则要求使用获批账户、妥善处理受保护数据、进行人工审核,或完全禁止使用生成式 AI 系统。

一项有用的政策应提供示例,而不只是抽象原则。它应说明员工是否可以总结公开报告、编辑内部文件、分析客户记录、起草法律文本,或审查源代码。

组织还必须区分低风险辅助和具有重大后果的决策。语法纠正与决定谁能获得信贷、工作、保险、医疗服务或服务访问权,风险并不相同。

高影响力使用需要更严格的审核和记录。批准输出的人必须理解决策依据。聊天机器人不能成为一个无人能够辩护的结果的便利解释。

数据边界也必须同样具体。员工应知道哪些信息分类可以输入每个获批系统。当公共工具提供企业产品缺少的功能时,他们也需要有安全的替代方案。

技术控制可以支持这些规则。身份管理、保留设置、访问限制、审计日志和数据泄露防护都能降低暴露风险。但没有任何一种控制能够判断某个答案是否适合其业务背景。

人工审核仍然必要,但“人在回路中”并不是完整的控制措施。疲惫的员工可能未经实质检查就批准输出。审核需要明确标准、充足时间,以及拒绝自动化工作的权力。

组织应同时衡量纠错成本和速度。它们可以跟踪核验主张、修复错误、解决客户问题或重写生成内容所需的时间。这些成本决定净生产力。

它们还应审视 AI 如何改变初级工作。入门级任务往往提供培养专业能力的练习。取消所有基础任务,可能削弱未来能够识别复杂错误的审核人员储备。

管理者同样需要培训。如果领导者只奖励数量而不讨论方法,员工就会为可见产出而优化。负责任的体系会将绩效目标与核验和披露相结合。

最佳的报告机制不应像一张认错表。它应通过日常工作流程设计捕捉有意义的 AI 使用。获批助手可以保留相关记录,而不要求员工记录每一句话。

知识溯源同样重要。团队应区分公开网页材料、授权内容、内部记录和人类专业知识。个人知识系统可以帮助个人在 AI 将来源和推理压缩成答案之前,保留这些内容。

这条来源轨迹的作用不止于合规。当模型摘要遗漏细微差别时,它让员工能够回到原始证据。它还保护了原本可能消失在一次性聊天中的宝贵人类背景。

当员工无需规避规则就能完成正当工作时,治理才能成功。如果获批系统难以访问、速度缓慢或不适合任务,违规行为就会变得可预见。

目标并非实现完美观察,而是围绕有价值的数据和具有重大后果的输出建立适度问责。

三个信号将检验“别问,别说”的 AI 经济

下一阶段将取决于企业是否衡量结果、重新设计工作,并为员工披露 AI 使用提供可信理由。

第一个信号是报告方式的变化。企业经常宣布 AI 访问权限、许可证、助手或培训计划。更有力的证据将把这些投入与完成的工作流程、错误率、审核时间、客户结果或运营成本联系起来。

如果雇主公布可信的净生产力指标,这个隐蔽经济就更容易评估。如果它们继续强调工具可用性,AI 支出与已证明价值之间的缺口仍将存在。

第二个信号是工作流程重设计。在不变的流程旁加上一个聊天机器人,很少能解决由谁审核输出、承担错误责任或记录来源的问题。持久的采用需要改变岗位、检查点和绩效预期。

重新设计的流程让模型的贡献可见。它界定员工何时可以依赖 AI、何时必须核验,以及何时不能委托人工判断。

第三个信号是获批工具改进后的员工行为。如果员工从个人账户转向受管理系统,便利性就是影子 AI 的主要成因。如果隐蔽使用仍在持续,员工可能不信任监控,或更偏好雇主未提供的能力。

这种区分很重要。技术问题需要更好的产品和访问方式;信任问题则需要更清晰的激励、对监控的限制,以及关于生产力收益如何影响工作量和岗位的坦诚讨论。

Google News 让一个契合当下的说法受到关注。经济体系已经在接收由 AI 参与塑造的工作成果,但组织往往无法准确说明这些工作在哪里、如何完成,或由谁授权。

答案不是假装每一项 AI 辅助任务都很危险,也不是把更快的产出当作流程健全的证明。

雇主需要问清 AI 在何处改变了具有重大后果的工作。员工需要有安全的方式作答,而不把有益的试验变成自我定罪。双方都需要能够在初稿之后衡量质量的证据。

读者应关注企业选择哪些指标。许可证数量有利于讲述采用故事;净生产力、纠错成本、事件发生率,以及员工转入获批系统的情况,才能揭示运营模式是否真正有效。

只要收益依然即时、失败依然分散,“别问,别说”的安排就可能持续存在。一旦客户、监管机构、审计人员或员工要求清楚说明重要工作是如何完成的,它就会弱化。

决定性的问题不再是人们是否在工作中使用 AI,而是机构能否识别这种使用、明确责任,并保留挑战机器所需的人类知识。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page