大型企业为小公司示范 AI 的该做与不该做
- Sophie Larsen

- 1小时前
- 讀畢需時 16 分鐘
Google News 在 8 月 30 日推送了 Gene Marks 的一个直白警示:小公司应借鉴大型企业的 AI 成功经验,而不是照搬它们的支出习惯。
他在《卫报》专栏中指出,大公司已经为许多代价高昂的试验买过单。如今,小企业可以观察哪些项目带来了实际成果,哪些项目只是烧钱却未改变运营。
这听起来像是小公司的简单优势。然而,背后的证据揭示了更棘手的矛盾。大型组织更频繁地使用 AI,但只有少数企业报告获得了有意义的全公司财务收益。
分野并不在于企业是否使用 AI,而在于它们是聚焦于工作流程的改进,还是围绕预期、高管压力或害怕错失机会而启动广泛项目。
大型企业已在软件开发、客户服务、安全和语音应用中找到实际用途。它们也遭遇了不断上升的计算成本、不可靠的输出、员工抵触,以及令人失望的回报。
小公司面临相同的技术风险,却缺少足够的财务缓冲。它们的优势不在于技术更好,而在于能够选择一个狭窄的问题、改变一项工作流程,并在结果不佳时迅速停止。
这一差异至关重要,因为 AI 的采用正在整个经济体中上升。赢家未必是预算最大的企业,而是能够将支出与可衡量工作相连的企业。
Google News 标题背后遗漏了什么
核心事件是:AI 正从实验阶段转向基于大型企业部署证据的选择性采用。
在多年密集的企业投资之后,Marks 在 small business AI 发表了这一观点。他的论点侧重观察,而非技术本身。大型企业以小公司通常难以承担的规模测试了 AI。
其中一些测试形成了有用的模式。AI 辅助编程可以帮助开发者起草、审查、编写文档和测试软件。客户服务团队可以使用模型总结对话,或提出供人工批准的回复建议。
安全系统可以使用机器学习标记异常活动。语音工具可以转录通话、识别待办事项,并让录制信息可被搜索。
这些应用有一个重要共性:每一种都从企业中已经存在的明确任务开始。公司可以将新流程与既有基线进行比较。
软件团队可以衡量审查时间、缺陷率和交付速度。支持团队经理可以监测回复质量、解决时间、升级情况和客户满意度。
销售团队可以比较处理通话和更新记录所需的时间。安全人员可以衡量误报、调查时间和捕获到的事件数量。
较弱的项目往往有不同的起点。领导者在尚未确定必须改善的工作之前,就宣布企业级 AI 战略。团队随后采购工具、建设基础设施,再去寻找用途。
这种顺序会制造昂贵的组织表演。一家企业可以积累试点、演示文稿、供应商合同和培训课程,却没有形成可靠的生产工作流程。
Google News 会让这些故事显得彼此相邻,即使它们背后的证据并不相同。一次成功的编程助手部署和一个雄心勃勃的自主代理项目,都可能被贴上“企业 AI”的标签。
对于小企业主而言,这个标签过于宽泛,无法指导决策。真正相关的问题是任务、数据、人工审查流程和经济结果。
原专栏还将生产率与裁员区分开来。Marks 认为,小型雇主应利用 AI 提升员工能力,而不是宣传立即裁员。
这一选择具有运营价值。当既定目标是提升产出而非减少岗位时,员工更没有理由掩盖问题。他们的反馈可以在客户遇到错误之前暴露问题。
这也减少了在系统尚未奏效前就计算预期人工节省的诱惑。预测中的缩减并不等于实际价值,尤其是在员工还需花时间纠正不可靠输出时。
因此,这一标题标志着 AI 决策方式的更广泛转变。采用正从抽象的热情,转向关于何处值得信任自动化的选择。
在这个故事中,小公司并非只是较晚采用者。它们是在第一轮企业证据变得可见后才进入的观察者。
大型企业采用率更高,但价值依然集中
大型企业在采用方面拥有明显优势,但要证明广泛的财务影响仍困难得多。
美国人口普查局审查了 2025 年 12 月至 2026 年 5 月 3 日期间收集的企业调查数据。在此期间,整体 AI 使用率维持在 17% 至 20% 之间。
同一份 business AI data 显示,公司规模带来了显著差异。员工人数至少为 250 人的企业中,37% 表示正在使用 AI。
在员工人数为 100 至 249 人的企业中,截至 5 月 3 日的统计期内,32% 报告使用了 AI。这些数字证实,较大的企业仍拥有更多能力来采用新系统。
它们可以聘请专家、协商供应商协议、准备数据,并建立内部治理项目。当早期回报仍不确定时,它们也可以让试验维持更长时间。
然而,采用并不代表创造了价值。它可以指员工起草一封电子邮件,也可以指公司重建一项重大的运营流程。
美联储在 2026 年 4 月的评估中强调了这一衡量问题。人口普查数据表明,到 2025 年底,约 18% 的企业已采用 AI。
然而,一项按就业人数加权的高管调查估计,78% 的劳动者受雇于使用 AI 的公司。约 54% 的劳动者在使用大语言模型的企业工作。
这项 adoption measurement 之所以不同,是因为调查统计的单位不同。在企业层面的数据中,一家小公司和一家全国性雇主都只算作一个企业。
这一结果解释了为何 AI 在工作场所中可能显得普遍,却仍未出现在大多数公司中。大型雇主覆盖了劳动力中的很大一部分。
问题措辞也带来了另一项差异。美国人口普查局在 2025 年 11 月将其调查范围从生产活动扩大为任何业务职能中的 AI 使用。
这一变化涵盖了更多活动,包括行政工作。它也使得与较早结果的比较不再那么直接。
小公司应将采用统计视为背景,而非命令。较高的比例并不能说明某个特定工具适合它们的客户、数据或运营模式。
财务证据更具启发性。McKinsey 的 2026 年全球调查收到了来自 97 个国家的 1,719 名参与者的回复。
37% 的受访者将至少部分盈利影响归因于 AI。然而,只有约 6% 符合高绩效者标准:影响显著,且至少 5% 的盈利与 AI 有关。
这项 enterprise AI results 还显示,这一高绩效群体的占比并未较 2025 年增加。采用范围扩大的速度快于高层级财务成果的改善速度。
这一差距形成了本故事背后的压力。供应商希望扩大部署,高管希望看到可见进展,员工希望获得能让日常工作更轻松的工具。
财务负责人希望看到经过验证的回报。安全和法务团队希望获得控制措施。客户则期待准确性,以及对其信息的负责任处理。
小企业无法凭借一份更厚的战略文件解决这些相互竞争的需求。它需要一个更小、每个人都能审视的经济单元。
这个单元就是工作流程。它有输入、输出、负责人、质量门槛和成本。
例如,支持团队可以使用 AI 起草回复,同时由员工批准每一条消息。企业可以衡量节省的时间并追踪纠正率。
它也可以在不扰乱整个公司的情况下停止测试。这种可逆性很有价值,因为模型、价格、政策和供应商能力仍在持续变化。
因此,企业采用带来的最重要启示并非“多用 AI”,而是“让每个用例证明自身价值”。
聚焦的工作流程胜过企业 AI 表演
主要竞争在于可衡量的工作流程重塑,与将可见活动误认为运营进展的 AI 项目之间。
工作流程重塑意味着改变一项明确任务从开始到结束的推进方式。它并不意味着在未改变的流程旁边加一个聊天机器人。
以一次销售通话为例。表面的部署会给销售代表提供通用写作工具,并记录估算的时间节省。
重新设计的工作流程则会捕捉对话、生成结构化摘要、识别承诺事项,并提出客户记录更新建议。信息在进入系统前由人工核实。
第二种方法建立了明确的检查点。管理者可以衡量记录是否变得更完整、跟进是否更及时,以及员工是否花更少时间处理行政事务。
同样的原则也适用于内部知识。一家公司可能拥有数千份文件,而员工依然找不到正确的政策或项目决策。
将 AI 接入杂乱无章的文件并不会自动解决这个问题。系统需要适当的访问控制、最新的源材料,以及能够显示答案来源的方式。
当证据缺失时,员工也需要有明确的应对方式。AI 系统应表达不确定性,而不是编造看似合理的答案。
小公司可以在一个团队内测试这种模式。它可以从已批准的销售材料、技术文档或内部流程开始。
当其来源和权限与工作流程相匹配时,可搜索的 AI knowledge base 能够支持这项工作。它无法取代信息所有权。
大型组织已经展示了聚焦部署通常在哪些领域有效。软件开发就是一个例子,因为代码可以经过测试、审查和版本控制。
AI 可以提出代码建议,而无需获得最终决策权。开发者可以检查变更,并在必要时将其撤销。
客户服务提供了另一种有用模式。模型可以对请求分类、总结冗长对话、检索已批准的信息,或起草回复。
风险环节出现在公司尚未衡量普通与异常情况中的准确性,就取消人工审查之时。流畅的回答仍可能是错误的。
语音应用遵循类似模式。转录和摘要可以减少文书工作,但敏感录音需要明确的保留和访问规则。
安全应用可以在大量活动中检测异常行为。然而,误报仍需调查,而自动化响应可能中断正当工作。
这些例子解释了为何小企业 AI 应从辅助而非不受约束的自主性开始。辅助模式将决策权保留给了解客户和业务背景的人。
自主性会提高每一次出错的代价。一个起草出糟糕信息的模型,只会制造一项审核任务;而一个独立发送这条信息的模型,则可能造成客户问题。
当 AI 智能体跨多个系统采取行动时,差异会进一步放大。智能体是一种能够为实现目标规划并执行多个步骤的软件。
一个智能体可能会读取电子邮件、更新数据库、准备报价并安排后续跟进。每新增一项连接,潜在价值和潜在损害都会随之扩大。
大型企业可以投入资金建设测试环境、开展访问控制审查、部署监控系统,并组建事件响应团队。许多小企业无法复制这种基础设施。
因此,它们应当降低系统的权限。只读访问、有限的数据范围、审批关口和交易限额,都可以让试点更安全。
这种做法并不反对创新。它把可靠性视为产品的一部分,而不是部署后才额外加上的障碍。
组织还应衡量全部工作量,而不只是初稿节省的分钟数。审核时间、修正时间、再培训、集成以及供应商管理,都应纳入计算。
一款能够快速起草内容的工具,如果员工必须核实每一项缺乏依据的主张,仍可能产生负价值。某个环节的提速,可能只是把劳动转移到了别处。
这就是为什么“生产率提升”需要明确分母。企业应说明,这指的是完成更多案件、缩短周期时间、提高质量,还是降低运营成本。
它们还应在足够长的时间内衡量结果,以涵盖例外情况。使用整洁示例的演示,无法代表充满杂乱客户活动的普通一个月。
Google News 的报道可能会让一次孤立的成功看起来像一套通用公式。小企业应越过标题,找出使结果成为可能的条件。
这些条件往往包括准备就绪的数据、积极参与的流程负责人、清晰的质量指标和高管支持。模型本身只是其中一个组成部分。
成本、准确性与信任可能抵消节省
只有当 AI 的运营成本和失败风险低于其所改善工作所创造的价值时,AI 才能创造价值。
计算成本已成为采用 AI 讨论的一部分。AI 系统通常按 token 收费,token 是用于处理和生成信息的单位。
一次简短交互可能只消耗少量 token。一份长文档、重复运行的智能体循环或大规模检索流程,则可能消耗得多得多。
McKinsey 发现,五分之一的受访者表示,运营成本正在限制其组织使用 AI。该限制包括 token 支出,并且出现在不同规模的公司中。
约十分之一的受访者表示,聊天机器人、AI 智能体和编程智能体这三类工具分别受到成本限制。这些数据挑战了这样一种观念:软件在部署后会自动变得更便宜。
小企业在扩大试点前需要设置成本控制措施。它们应了解每项任务的平均支出,以及使用量在繁忙时期如何变化。
它们还应测试系统失败时会发生什么。重试、更长的提示词、重复搜索和升级处理,都会增加计算和人工成本。
一个在演示规模下看似负担得起的流程,在生产规模下可能变得不经济。相关指标应是每个被接受结果的成本,而不是每个生成答案的成本。
准确性带来另一种风险。生成式 AI 根据数据中的模式预测输出,这意味着自信的表达并不保证事实正确。
面向客户的错误可能引发退款、投诉或信任流失。不正确的财务或法律表述,则可能带来更严重的风险敞口。
NIST 的 AI 风险框架 为组织管理这些问题提供了自愿采用的结构。其核心活动涉及治理、映射、衡量和管理风险。
NIST 还在 2024 年 7 月发布了生成式 AI 概况文件。该文件识别了生成式系统特有的风险,并提出了组织可调整采用的行动建议。
小型公司无需设立庞大的合规部门,也能应用其中的核心逻辑。但它确实需要一名明确指定的负责人,以及有文档记录的边界。
负责人应了解哪些数据进入系统、谁能够查看输出,以及哪些行动始终需要审批。企业还应记录失败情况。
这些记录能将个别经验转化为证据。如果员工反复纠正同一种错误,工作流程就需要不同的指令、更好的源数据,或改用其他工具。
有些问题无法通过提示词解决。模型可能缺乏最新信息、可靠的访问控制,或无法为高风险任务提供足够的准确性。
当证据支持这一结论时,停止一个薄弱项目就是一次成功的决策。小企业不应仅因已经投入时间,就维持试点项目。
员工信任与技术表现同样重要。员工会抵触那些主要被包装成裁员理由的工具。
如果每一次纠正都似乎会削弱自身的工作保障,他们也可能避免报告缺陷。这种行为会让管理层失去改进系统所需的信息。
企业层面的记录提供了有用的现实检验。McKinsey 报告称,在使用 AI 的组织中,14% 的受访者认为 AI 在过去一年促成了整体员工人数下降。
这一比例不到预期会出现人员减少的 32% 的一半。三分之二的受访者表示,总就业人数几乎没有或没有发生与 AI 相关的变化。
因此,预期与现实仍然相距甚远。然而,仍有 39% 的受访者预计 AI 会在随后一年减少员工人数。
小企业不应将这些预期中的人员减少计入回报。工具必须先可靠地运行,公司才能围绕它重新设计人员配置。
让员工持续参与能产生更好的证据。他们了解哪些情况是常规的、哪些客户需要谨慎处理,以及源信息会在何处变得不可靠。
他们可以在供应商演示影响项目之前,帮助定义验收标准。他们也能识别绝不应被委派出去的工作。
怀疑观点认为,小企业甚至缺乏开展严谨试点所需的时间、数据和技术专长。这种担忧是合理的。
即使是范围狭窄的测试,仍需要流程知识、评估、培训和监督。购买一项熟悉的订阅服务并不会免除这些责任。
然而,资源有限使纪律性更为重要,而不是更不重要。小型公司应选择更少的使用场景,并要求每个场景提供更明确的证据。
它还应优先选择可逆的决策。可导出的数据、较短的评估期、人工审批和有限权限,都能降低错误选择的后果。
这些控制措施并不能保证回报。它们能让失败在演变为企业级承诺之前显现出来。
小企业 AI 面临核心工作难题
小企业往往在工作边缘环节使用易获得的 AI,而更深层的运营采用仍然有限。
OECD 2025 年的评估发现,小型企业与大型企业之间持续存在采用差距。在成员国中,至少拥有 250 名员工的企业有 40% 使用了 AI。
在拥有 50 至 249 名员工的企业中,这一比例降至 20.4%。在拥有 10 至 49 名员工的企业中,则仅为 11.9%。
这些数字采用了 2024 年或最新可获得的国家数据。不同国家的定义有所不同,因此 OECD 警告不要进行草率比较。
但更广泛的模式依然一致:在 G7 国家中,小企业采用 AI 的频率低于大型企业。
这种差距会因应用而异。欧洲数据表明,自然语言生成领域的差异小于自主机器领域的差异。
这很合理,因为文本工具更容易获得。它们通常不需要专用硬件,个人员工即可将其带入企业。
然而,可获得性并不等于运营深度。中小企业采用情况评估发现,使用 AI 的中小企业中,只有 29% 将生成式 AI 应用于核心活动。
许多企业将其用于支持运营、但不改变生产方式的外围任务。营销和销售是小企业相对积极使用 AI 的一个突出领域。
外围工作仍然可以带来价值。起草不同版本的营销活动内容或总结会议,可能节省可观的时间。
问题在于,企业可能会把分散的个人使用误认为是一种运营能力。员工可能使用不同的工具、上传不同的信息,并采用不一致的质量检查。
管理者因此无法清楚掌握风险和结果。公司无法判断 AI 是改善了工作流程,还是仅仅改变了员工完成零散任务的方式。
影子 AI,即员工未经批准使用 AI 工具,也会带来数据问题。员工可能会将机密材料粘贴到服务中,却不了解其保留政策。
小企业在追求更大规模的战略之前,需要建立一份简单清单。正在使用哪些工具、哪些信息会进入其中,以及哪些输出会触达客户?
这份清单可以揭示机会。多名员工可能都在花时间总结类似文档,或在系统之间转移相同的信息。
它也可能暴露不适合的使用方式。员工可能在每一项陈述都需要核实的场景中依赖生成的建议。
在梳理当前活动后,公司可以选择一个具有足够工作量、便于衡量的流程。它应避免从最敏感或最复杂的流程开始。
一个合适的候选流程具有重复性输入、清晰的输出,以及能够判断质量的人员。结果应足够重要,值得进行评估。
公司应在引入 AI 之前建立基线。没有时间、成本和质量的基线数据,改进就会沦为主观感受。
接下来是受控试点。系统处理一定比例的工作,同时由人员将其输出与现有流程进行比较。
评估应包括常规案例和例外情况。团队应记录错误事实、遗漏信息、不恰当语气、访问失败和意外成本。
随后,企业可以决定停止、修订或扩展。扩展应遵循证据,而不是高管的急躁情绪。
这一顺序将 Guardian 的观察转化为一项运营原则:让大公司揭示广泛模式,再在小企业内部验证相关模式。
Google News 可以帮助所有者发现这些模式。它无法判断某项工作流程是否适合其客户、记录和对错误的容忍度。
这种判断必须保留在本地。它取决于实际工作,以及理解其后果的员工。
三个信号将表明这一结论是否成立
下一阶段将取决于经过验证的工作流程回报、可控的运营成本,以及预期与实际劳动力变化之间的差距。
第一个信号是,是否有更多组织报告 AI 对全公司收益产生影响。在 McKinsey 的 2026 年调查中,高绩效者群体仍接近 6%。
如果这一比例上升,可重复的 AI 价值证据将得到加强。细节将比头条百分比更重要。
企业应关注收益背后的工作流程重塑、明确的绩效衡量指标和风险控制措施。如果结果仍然集中在少数企业,广泛采用仍将超过已被证明的转型。
对于小型公司而言,这一信号会影响其预期。更大规模的高绩效企业群体将提供更多可供研究的经过验证的模式。
如果结果持平,则支持继续保持谨慎。它意味着,仅仅获得更好的模型并不能解决组织问题。
第二个信号是生产级 AI 的成本。五分之一的 McKinsey 受访者已经报告了与运营成本相关的限制。
关注供应商是否降低推理成本,以及企业是否改善对智能体使用的管控。推理是指生成 AI 输出所需的计算工作。
更低的单位成本会让高频任务更具吸引力。然而,更便宜的输出也可能鼓励不必要的使用,并掩盖流程设计的薄弱之处。
更好的信号是每项被接受结果的成本下降。该指标结合了模型费用、质量和人工审核成本。
如果 token 支出下降,而修正工作增加,企业并未形成可靠的节省。如果两项成本都下降,规模化就更具可信度。
第三个信号是劳动力预测与实际就业变化之间的差异。先前预期远高于 2026 年调查中报告的裁员幅度。
持续存在的差距将削弱“AI 会自动消除大量岗位”的说法。它将支持 Marks 所描述的“生产力优先”路径。
如果经核实的裁员开始与预测相符,小型企业将面临不同的规划问题。它们需要了解哪些工作流程发生了变化,以及哪些能力仍由员工保留。
无论结果如何,都需要比财报电话会议上的承诺更精确的分析。员工人数可能因需求变化、重组、外包或此前过度招聘而发生变化。
企业不应在缺乏证据的情况下,将每一次裁员都归因于 AI。它们应综合审视产出、服务质量、工作负荷和财务结果。
对于通过 Google News 进入本文的读者而言,实际行动很直接。选择一项重复性工作流程,记录其当前所需时间、成本、质量和负责人。
随后确定可接受的 AI 辅助结果应具备什么标准。保留一名对审批负责的人员,并在测试期间跟踪每一次修正。
应询问系统是否改善了已完成的工作,而不是员工是否生成了更多文本。审查总成本,包括监督和失败造成的成本。
如果证据仍然不足,就停止。如果它在常规和困难情境中都成立,再谨慎扩大规模。
大型企业已经表明,AI 支出既可能产出有用的系统,也可能带来昂贵的失望。如今,小型企业有机会借鉴这种纪律,而不必照搬其规模。


