开源势在必行:美国能否通过公开其秘密赢得AI竞赛?
- Aisha Washington

- 6月6日
- 讀畢需時 8 分鐘
已更新:6月17日

硅谷正回荡着一个严厉的警告。Andy Konwinski,Databricks 的联合创始人,认为美国在人工智能研究领域的领先地位正面临被中国超越的边缘。他称这种转变是一个“生存”威胁,不仅是对科技行业,更是对民主本身。他的核心论点是直接挑战美国顶级 AI 实验室盛行的文化:对专有、闭源模型的痴迷。
在 Cerebral Valley AI 峰会上,Konwinski 分享了一个来自前线的令人心寒的轶事。“如果你现在去和伯克利和斯坦福大学研究 AI 的博士生交流,”他说,“他们会告诉你,在过去的一年里,他们读到的来自中国公司的有趣 AI 想法是美国公司的两倍。”这不仅仅是学术闲谈;这是一个关于创新发生地正在发生根本性转变的信号。虽然像 OpenAI、Meta 和 Anthropic 正在取得重大进展,但他们的成果仍然处于封闭状态。与此同时,他们正以巨额薪酬从学术界挖掘最聪明的头脑,破坏了历史上一直推动美国技术领先地位的思想自由交流。
这种情况呈现出一个悖论。现代生成式 AI 的基石——Transformer 架构,源于一篇免费发表、供任何人阅读和构建的研究论文。那次单一的开放行为催化了全球创新的爆发。
Konwinski 认为,这是唯一可持续的前进道路。第一个产生下一个“Transformer 架构级别”突破的国家将获得决定性优势,而这种突破更有可能出现在一个协作、开放的环境中。
两种策略的故事:开放生态系统 vs. 高墙花园

问题的核心在于两种截然不同的国家战略。在中国,政府积极鼓励并支持像 DeepSeek 和 Alibaba 的 Qwen 这样的 AI 实验室 开源其创新成果。这产生了一种强大的飞轮效应,全国的研究人员和公司可以相互借鉴,从而加快发现的速度。这是一种政府支持的协作技术生态系统愿景。
Konwinski 认为这与美国形成了鲜明对比。他说,在美国,“我们一直以来拥有的科学家之间的交流……已经枯竭了。”顶尖人才集中在少数几家公司的“高墙花园”内,这意味着新想法无法被更广泛的学术界自由讨论、辩论和改进。这种方法可能会带来短期的专利优势,但 Konwinski 将其视为长期隐患。他警告说:“我们正在坐吃山空;源泉正在枯竭。快进到五年后,大型实验室也将面临失败。”他呼吁美国重新夺回其地位,不仅是作为 AI 的领导者,而且是作为一个开放的领导者。
社区担忧:AI 开源是否存在安全风险?

这种对 AI open source 的呼吁并非没有批评者。当对话从高层战略转向实际的执行层面时,开发者和安全研究人员提出了合理的担忧。其中最常见的恐惧之一是恶意行为者可能会 在开放模型的训练数据中嵌入隐藏指令。例如,一个具有代理能力的 LLM 可能会被秘密编程,其目标是向特定国家机构报告新颖或政治敏感的想法,而其行为则隐蔽地融入到其余的训练内容中。
虽然这听起来像科技惊悚片的剧情,但从业者认为这比看起来更难实现。试图通过广泛、泛化的预训练过程来灌输非常具体的、工具层面的行为是公认的难题。代理工作流非常脆弱,高度依赖于特定的提示词、工具和参数。正如一位评论者所言,试图在不知道目标操作系统的情况下编写病毒是徒劳的。
更紧迫的论点是关于信任。一个被设计为间谍或破坏者的模型,很可能会在沙箱环境的严格测试下暴露无遗。你可以向其提供敏感信息,并监控其输出和网络调用。真正的风险可能在于那些我们无法检查的模型。来自任何供应商的闭源模型都是一个 不可审计的黑盒。有人认为,奇怪的是,我们被教导要不信任开放、可检查的模型,却对封闭模型寄予信任。OpenAI 未能保持开放,这可能最终被视为其最大的战略失策。
辩论席卷数据栈:Databricks 能否推翻 ERP 巨头?
这场关于 AI 开源的全球辩论在企业数据领域有一个引人入胜的平行现象。多年来,企业一直被锁定在来自 SAP、Oracle 和 Microsoft 等巨头的复杂、单体式企业资源规划(ERP)系统中。这些系统是封闭世界的定义——功能强大,但僵化且众所周知地难以提取数据。
进入 Databricks。对于许多在 Databricks 环境中工作的人来说,它感觉就像是未来。随着事务性数据库、Databricks Apps 以及大量分析和 ML 工具的加入,它正在演变成一个成熟的数据强权。这引发了一场激烈的辩论:一个建立在更开放原则之上的平台最终能否取代传统的 ERP?
乐观主义者看到了清晰的路径。大多数公司已经在使用 Databricks 来移动和转换其 ERP 数据。他们将标准 ERP 流程中无数的例外情况——Access 数据库、电子表格和随机的第三方系统——视为第一个滩头阵地。这些边缘流程可以逐渐重建为 Databricks Apps。随着时间的推移,越来越多的核心业务逻辑可以迁移到该平台,或许由合作伙伴构建的通用业务功能模板提供支持。其核心理念是,这些新系统可以根据业务需求进行高度定制,同时在灵活的、以数据为中心的平台上进行内部管理。
然而,任何尝试过对 SAP 报表进行逆向工程的人都知道残酷的现实。ERP 不仅仅是一个带有界面的数据库;它是几十年来建立的业务逻辑、数据库设计和监管合规性的极其复杂的网络。这种复杂性的存在是有原因的——它反映了业务本身的复杂性。正如一位资深顾问所指出的,复制这一切是一个任何理智的 CTO 都不会仅仅为了构建另一个 ERP 而批准的项目。正如另一位评论者直言不讳地说道,“SAP 睡得很香,别担心”.
真正的战场:通过 ETL 解放数据
或许“替代”这个问题本身就问错了。即使是在 ERP 的捍卫者中,大家也达成了一个共识:Databricks 是 ETL(提取、转换、加载)和数据迁移领域的游戏规则改变者。一位尽管声称更偏好 MS SQL 的 D365 顾问,也不得不承认 Databricks 在处理大型数据集的复杂 ETL 时拥有更卓越的动力和性能。该平台的引擎效率极高,开发者可以专注于逻辑,而不会陷入性能调优的泥潭。
这正是 AI open source 的原则与 Databricks 这类平台的实际应用相结合的地方。任务并不一定要替换 ERP 那极其复杂的代码层,而是获取 ERP 提供的数据,并将其转化为分析师、数据科学家和其他利益相关者可以使用的内容。
在这一角色中,Databricks 是无可争议的领跑者。它像一个强有力的杠杆,撬开了由专有 ERP 系统创建的数据孤岛。它体现了开放精神,提供了处理数据的工具,无论数据源多么受限,这使得数据网格(data mesh)和数据织网(data fabric)策略比以往任何时候都更具可行性。我们已经看到像 Workday 和 SAP 这样的 ERP 供应商通过发布自己的零拷贝数据云做出回应,这清楚地表明未来是开放数据共享,而非封闭的数据囤积。
更开放世界中的人文因素

这种技术变革也在重塑劳动力结构。Python 的兴起和 Databricks 等强大平台的出现降低了数据工程的技术门槛。雇主现在可以培训初级开发人员编写“满足需求”的脚本,而成本仅为资深 SQL 专家的一小部分。
但这并不是故事的全貌。正如该领域的许多资深人士所证明的那样,数据迁移和管理远不止是“吐出一段脚本”。这项工作中最困难的部分无法被自动化取代:深入挖掘混乱的源数据、考虑无数的变量,以及利用软技能与业务利益相关者进行沟通。将这些工作交给一个缺乏指导和深厚领域专业知识的初级工程师团队,无异于一场灾难。真正的价值正在发生转移。虽然 AI 代码生成将使跨越技能边界变得更加容易,但它不会消除对专业知识的需求。我们可能会看到混合型角色——数据科学家/工程师/分析师的组合,或者是兼任全栈开发的数据工程师。核心技能将是弥合技术工具与复杂且往往不理性的业务现实之间鸿沟的能力。工具固然强大,但它终究只是工具。它无法取代那些知道该问什么问题的专家。
地缘政治领域对 AI open source 的宏观推动,与开放数据平台对比封闭 ERP 系统的微观辩论,是同一枚硬币的两面。两者都反映了中心化控制与分布式创新之间的根本张力。未来并非简单的谁取代谁的故事,而是关于开放、灵活的工具将如何持续释放被困在封闭、专有系统中的巨大价值,迫使每个人要么适应,要么被淘汰。
常见问题解答

为什么 AI open source 在中美 AI 竞争中被认为是至关重要的?
AI open source 被视为必不可少,因为它加速了整个生态系统的创新步伐。当像 Transformer 架构这样的突破被自由分享时,整个研究社区都可以在此基础上进行构建,从而实现比少数孤立的专有实验室单独取得的更快的进展。
像 Databricks 这样的平台真的能取代 ERP 系统吗?
虽然 Databricks 正在成为一个全面的企业级数据平台,但在短期内完全取代像 SAP 这样复杂的 ERP 系统是极不可能的。ERP 包含数十年的嵌入式业务逻辑。一个更现实的场景是,像 Databricks 这样的平台将处理相邻流程,并擅长解锁 ERP 数据以用于分析和 AI。
闭源 AI 模型的主要安全风险是什么?
闭源 AI 模型的主要风险在于它们是不可审计的“黑盒”。用户无法检查训练数据、架构或代码,以排查隐藏的偏见、安全漏洞或恶意指令。这需要对供应商寄予完全的信任。
Databricks 如何改进 ERP 的 ETL 和数据迁移?
Databricks 擅长处理大型复杂数据集,使其成为涉及 ERP 数据的 ETL 工作负载的理想选择。其强大的引擎通常会自动处理性能调优,让开发人员能够专注于转换逻辑,从而显著加快数据迁移和仓库建设项目的进度。
向开放平台的转变是否正在改变对数据工程师的技能要求?
是的,重点正在发生转移。虽然掌握 Python 和 Databricks 等工具的技术熟练度至关重要,但资深工程师现在的价值更多地体现在他们深厚的领域知识、处理复杂业务需求的能力,以及与利益相关者沟通的软技能。工具降低了准入门槛,但专业经验依然至关重要。
什么是“Transformer 架构”,为什么它对 AI 开源很重要?
Transformer 是谷歌在 2017 年的一篇研究论文中提出的一种神经网络架构。它处理序列数据的能力使其成为包括 GPT 在内的大多数现代大语言模型的基础。它的公开发布是一个典型的例子,展示了单一的开源创新 可以点燃整个行业的进步。


