top of page

OpenAI 署名争议表明 AI 研究贡献认定需要新规则

9月17日
讀畢需時 15 分鐘

OpenAI 于 9 月 8 日宣称取得了一项具有历史意义的数学成果,但 OpenAI 署名争议很快将关注点从证明本身转向其思想来源。该公司称,一个内部 AI 系统经过 88 小时的努力,解决了 Navier–Stokes 方程的存在性与光滑性问题。然而,致力于高度相关方法的研究人员质疑,传统的贡献认定惯例能否在 AI 辅助发现时代继续适用。

OpenAI 发布了一份书面证明及其 Lean 形式化版本;Lean 是一种可让计算机检验数学论证的语言。该公司还披露,其系统在项目高峰期动用了约 10,000 个并发智能体。这些智能体在追求该成果的过程中交换了 270 万条消息,并生成约 1,300 亿个输出 token。

这场争议并不只是 OpenAI 与竞争实验室之间的冲突。它涉及企业 AI 研究,以及为这一成果提供理论、提示词、反馈和未发表工作的学术体系。核心问题在于:当模型也服务于其思想可能影响未来系统的研究人员时,企业能否建立可信的贡献认定机制。

OpenAI 的 Navier–Stokes 主张同时引发了两条叙事

在 OpenAI 公告发布数小时内,数学成果本身与其来源争议已变得密不可分。

Navier–Stokes 方程描述空气、水等流体如何运动。它们支撑着飞机设计、天气预报、血流建模及其他领域的工作。这些方程将流体视为连续介质,而非追踪每一个分子。

数学家长期以来一直在探究,平滑的三维流体运动是否会形成奇点。奇点是指数学上的速度在有限时间内无限增大的点。此类行为意味着,在允许的条件下,方程对平滑状态的描述可能会失效。

这项 悬赏难题 属于 Clay Mathematics Institute 于 2000 年公布的七项挑战之一。此前只有庞加莱猜想得到解决。这段历史让 OpenAI 的公告拥有了远超又一项基准测试成果的重要性。

根据 OpenAI 的研究时间线,该公司于 8 月 28 日开始训练一款新的内部模型。该公司称,其研究人员于 9 月 1 日获悉有关两项 Millennium Prize Problems 取得进展的传闻。随后,公司让模型评估尚未解决的问题及若干相关问题。

OpenAI 起初让智能体处理 Euler 方程的变体,该方程描述不含黏性的流体运动。据称,其中一个小组在无外力 Euler 问题中发现了有限时间爆破解。随后,OpenAI 将资源集中投入 Navier–Stokes 问题,并把这一中间成果提供给更多智能体。

该公司称,其智能体于 9 月 5 日得出 Navier–Stokes 问题的结果。形式化与验证又耗时 17 小时。三天后,OpenAI 发布了论文、其 Lean 表示以及项目说明。

然而,另一项研究工作当时已接近同一数学领域。纽约大学数学家 Tristan Buckmaster 与数学家 Levent Alpöge 花费约一年时间,扩展 Diego Córdoba 和 Luis Martínez-Zoroa 所发展的方法。Alpöge 就职于 Anthropic,不过两人将这项研究描述为个人合作。

Buckmaster 和 Alpöge 在研究过程中使用了 Anthropic 和 OpenAI 的模型。他们使用的工具包括 Claude 和 Codex;人类研究人员不断提出问题、阅读输出、纠正错误,并完善方法。

两人称,他们于 8 月 15 日取得了实质性进展,并于 8 月 22 日正式验证了一项相关结果。他们的工作涉及 Euler 方程及其他流体方程的爆破,为通向 Navier–Stokes 问题提供了一条可能路径。

就在 OpenAI 公布其宣称的解法之前不久,Buckmaster 发布了三篇论文和一份详细声明。这一时机使该公告同时成为两条新闻:其一是 AI 系统完成了一项非凡证明;其二是该公司如何选择问题,以及如何认可围绕这一成果的人类工作。

Nature 的署名社论认为,这些情况应当为研究人员和机构敲响警钟。该刊称,解决相关疑虑所需的信息尚未公开。不过,它仍将这一事件视为科学贡献认定实践亟需关注的证据。

OpenAI 坚称,其研究人员和智能体在 Buckmaster 与 Alpöge 的未发表工作公开前并未看到相关内容。该公司还表示,其证明与两人的结果存在显著差异。这些说法回应了直接抄袭的问题,但并未解决更广泛的治理问题。

一个系统可以避免复制某项具体证明,却仍在由其他研究人员创造的思想环境中运作。传闻、问题选择、工具交互、既有论文、提示词和人类反馈都可能塑造这一环境。科学贡献认定必须考虑的不止是最终的形式化陈述序列。

OpenAI 署名争议不止关乎训练数据

当同一家公司既提供研究工具、运营模型、保存交互记录,又发布竞争性成果时,贡献认定就会变得困难。

Buckmaster 的研究声明谨慎地区分了他所知与所怀疑的内容。他写道,自己没有看过 OpenAI 的证明,也不知道两人的数据是否被使用。他明确表示,并未指控该公司挪用了他们的工作。

他的担忧源于相关时间线。Buckmaster 表示,在其合作仍属私密期间,有关这项合作的信息已传至 OpenAI。他也知道,两人曾将草稿和研究讨论输入 Codex 会话。

这由此产生了几个不同的问题:OpenAI 员工是否查看过这些会话?内部模型是否可能检索到它们?去标识化交互是否被用于训练或强化学习?有关该项目的传闻是否决定了 OpenAI 将算力投向何处?

这些问题描述了不同的影响路径。针对其中一种路径的否认,并不会自动回答其他问题。

OpenAI 最初表示,其研究人员和智能体没有查看两人的工作。该公司后来称,一项调查认定,两人在此前两个月内的 Codex 提示词不可能影响该系统,包括通过训练产生影响。该公司解释称,内部模型是在更早的预训练模型之上进行大规模强化学习。

这一更有力的说法实质上缩小了争议范围。它表明,近期提示词不在相关训练窗口内。但它也留下了一个治理问题:在冲突公开之前,研究人员最初没有足够的信息来判断这种隔离是否存在。

信任不应取决于一家公司在冲突公开后自行开展内部调查。研究用户在将未发表的想法输入模型之前,需要明确的规则。这些规则应解释数据保留、人工访问、模型访问、训练资格、评估用途以及竞争性研究保障措施。

问题不止延伸至传统训练。OpenAI 表示,外部进展传闻帮助触发了其评估行动。即使没有私密提示词进入模型,得知另一支团队接近成功也可能影响资源配置。

问题选择本身就是科学工作的一部分。研究人员会通过阅读文献、参加研讨会、交换私密消息和评估部分结果来选择有前景的方向。一家公司若对特权信息作出反应,即使不复制定理或证明,也可能获得优势。

这种可能性并不能证明本案存在不当行为。OpenAI 称,其评估了所有尚未解决的 Millennium Prize Problems,而非仅仅针对一项已披露的证明策略。该公司的智能体还在投入更多资源研究 Navier–Stokes 前,找到了一个中间的 Euler 结果。

尽管如此,这一事件暴露出一种不对称性。学术研究人员通常只能使用有限算力,并且会在仔细检验论证后才发表成果。AI 公司则可以获知某一方向前景可观,调动数千个智能体,并在数天内发布经过形式化检验的结果。

该公司或许在每一个技术步骤上都独立行事。但外部信号仍可能决定其能力何时、何地被部署。现有的贡献认定实践并未提供一致的方式来认可这一贡献。

科学优先权传统上依赖公开记录、带日期的手稿、会议报告、通信往来和同行评议发表。AI 系统则增加了私密交互日志,其中可能同时包含研究证据与具有商业敏感性的平台注册数据。

这些日志或许有助于解决争议,但也可能泄露未发表研究、个人信息或专有系统行为。无约束的披露和彻底保密都无法提供令人满意的答案。

因此,AI 科学贡献认定需要程序性证据。公司需要保存受保护的记录,以便争议出现时由具备资格的独立审查者查验。研究人员也需要可预测的方法来记录自己的贡献,而不必过早发表尚未完成的工作。

科学贡献认定如今涵盖研究路径,而不只是最终证明

形式上正确的证明可以确立有效性,却无法识别是谁提供了决定性的想法、方向或中间发现。

Lean 验证之所以重要,是因为它会检验一项证明是否遵循明确陈述的假设和形式规则。它能够发现普通审查可能遗漏的步骤。对于冗长的 AI 生成论证,这种能力提供了宝贵的一层保障。

然而,形式验证回答的问题有限。它能够确认所表示的论证在其形式框架内是否逻辑有效,却无法重建产生该论证的社会与思想历史。

一份 Lean 证书无法揭示研究人员为何选择某种特定表述。它无法判定是谁发现了有用的类比,或是哪篇早期论文提供了富有成效的构造。它也无法决定模型生成的变体是否应获得独立的概念性贡献认定。

这种区别正是 OpenAI 署名争议的核心。Córdoba 和 Martínez-Zoroa 发展了更广泛的受迫爆破研究路线,后来的研究人员在此基础上继续扩展。Buckmaster 和 Alpöge 将他们视为关键方向的来源。

Buckmaster 将他们的想法描述为其合作的思想基础。随后,他的团队利用 AI 系统,将该研究路线推进至平滑外力和 Euler 结果。报道称,OpenAI 的 Navier–Stokes 构造采用了相关的受迫路径,尽管该公司表示,证明和精确结果均存在差异。

“AI 解决了它”这一说法将整条链条压缩为单一行动者。它掩盖了更早的数学研究计划、嵌入提示词中的人类选择,以及那些评估不可用输出的研究人员。它也掩盖了训练、编排和验证模型的公司工程师。

署名不能简单地赋予每一台参与贡献的机器。模型无法自行承担责任、披露利益冲突、为方法选择辩护,或回应同行评审。人类作者和机构作者必须继续对已发表的工作负责。

与此同时,仅列出一家公司也可能抹去思想的传承脉络。公司署名几乎无法说明是哪些人界定了问题,或指导了这些智能体。它还可能让独立贡献看起来像是源自模型内部。

研究共同体需要更详细的贡献说明。这些说明应明确谁选择了问题、设计了提示词、贡献了既有方法、审阅了中间输出、形式化了证明,并批准了最终主张。

AI 公司也应为重大科学成果发布溯源报告。溯源报告将在不暴露所有私有模型细节的前提下,记录一项成果的来源与发展过程。

至少,这类报告应包含项目时间线、初始提示词、智能体可获取的文献来源、重大人工干预、中间结果和验证流程。它还应说明用户交互在技术上是否可被该研究系统访问。

模型提供商已为重大发布制作系统卡和安全报告。科学溯源需要一份类似的产物,但重点应放在智力来源上。目标并非披露模型权重或无关的用户数据。

目标是让非同寻常的研究主张可供审计。如果一家公司称某个模型独立发展出一项证明,审稿人应能够依据保存的证据检验这一主张。

学术团队需要采取互补做法。使用托管 AI 系统的研究人员应记录提示词、模型版本、日期、输出和重要修正。结构化的知识库可以保存这段历史,同时将工作材料与最终论文分开。

仅靠文档无法自动分配署名,但它能为机构提供据此行动的证据。没有这些记录,争议将由公司声明、社交媒体帖子和不完整的记忆来裁决。

真正的取舍是速度与科学正当性

AI 可以将数年的数学探索压缩至数天,但速度会带来压力,迫使人们在署名和说明尚未准备就绪前发表成果。

OpenAI 的说明将规模视为这一成就的重要部分。数千个智能体尝试了不同的问题变体,分享有价值的发现,并协助整合有前景的路径。随着证据不断积累,公司在不同任务之间调度智能体。

这种方式不同于单个聊天机器人在一次提示后给出证明。它更像一个高度并行的研究组织,其成员可以持续生成、测试和交换想法。人类研究人员仍然负责选择目标,并决定哪些输出值得投入更多资源。

此类系统能够探索的可能性多于一个小型学术团队。但一旦问题显得可解,它们也可能催生激烈竞赛。竞争者知道,拖延或许会让另一家实验室抢先发表。

这种压力可能损害科学传播。Buckmaster 表示,其团队在尚未完成理想程度的阐释前就发布了论文。他形容其中一篇手稿比起润色完善的人类论文,更接近原始模型输出。

这一承认意义重大,因为理解本就是发表的目的之一。一项证明应让其他数学家能够审视其核心机制,将其与早期工作联系起来,并发展新的问题。通过形式化检查器并不保证人类能够从结果中学习。

OpenAI 的发布包含一份常规写作稿和一份 Lean 形式化证明。这种组合强于只发布新闻声明。然而,专家评审仍需要时间,尤其当主张涉及解决一个长期存在的问题时。

科学正当性不只取决于正确性。它还取决于推理是否易于理解、引用是否审慎、审查是否独立,以及对既有贡献是否给予公平说明。

这篇独立报道捕捉到了这一张力。数学家认可该结果可能具有的重要规模,同时质疑其思想传承脉络。研究人员还指出,追溯 AI 生成数学思想的来源异常困难。

AI 公司有商业动机迅速宣布显著的能力提升。重大科学成果比又一个基准测试分数更生动地展现模型性能。它可能影响客户、投资者、招聘对象和政策制定者。

学术规范往往朝相反方向发展。研究人员通常被期待传阅草稿、邀请批评、修订说明,并引用一长串相关工作。优先权固然重要,但理解与连续性同样重要。

任何一种文化都不能简单取代另一种。等待数年才披露已验证的成果,会浪费有用知识;而在没有稳定溯源的情况下立即发表,则会削弱信任并鼓励防御性保密。

可行的取舍是分阶段披露。公司可以宣布自己获得了一项候选结果,同时发布足以供独立评估的证据。随后,随着审稿人分析该证明及其与早期工作的关系,公司可以更新公开记录。

重大主张还应接受独立于技术验证之外的署名审查。审查者将考察文献、时间线、用户数据边界、贡献记录,以及与可能存在重叠的团队之间的沟通。

该流程应包括公司外部的研究人员。内部审查可以澄清事实,但无法解决所有利益冲突。独立参与能为公司和受影响的学者提供一个更可信的讨论平台。

AI 实验室可能会因详细溯源会暴露研究策略而抵触。学术研究人员也可能不愿分享会暴露未完成想法的提示词或草稿。保密审查安排可以保护这些利益,同时允许进行有意义的审查。

目标不是放慢每一篇 AI 辅助论文。常规工作可以遵循普通披露惯例。非同寻常的主张,尤其是与著名公开难题相关的主张,理应适用更严格的程序。

清晰的数据边界将保护研究人员和 AI 公司双方

最佳署名政策始于发现之前,即围绕未发表的用户研究建立可执行的边界。

研究人员越来越多地将商业模型作为协作者。他们要求系统寻找反例、将论证翻译成形式化语言、检查代码、改善阐释,并测试证明策略。

每一次交互透露的信息都可能多于最终提示词所暗示的内容。一连串失败的尝试可能显示一个团队认为哪个方向最有前景。修正内容可以编码模型此前未曾展现的专家知识。

这会形成从研究人员到平台提供商的知识转移通道。用户可能接受普通对话对产品改进的有限支持。但他们不太可能期望未发表的科学研究计划会支持提供商开展竞争性研究。

服务条款无法独自承担全部责任。冗长的法律文件很少以可操作的语言说明研究特有风险。机构也需要能够评估和执行的控制措施。

模型提供商应提供受保护的研究模式。在该模式下,提示词和输出将被排除在训练、模型评估、内部研究和人工审阅之外,除非出于狭义定义的安全需求。

该模式应公开保留期限和访问日志。它应允许研究团队导出经签名的交互历史。这样,机构便能保存证据,而无须信赖截图或个人档案。

公司还应在基础设施层面将产品数据与前沿研究系统分离。当技术控制阻止内部模型和研究人员接触受保护材料时,政策承诺才更有力。

这些控制措施也会在争议中惠及提供商。OpenAI 针对这场争议回应称,其正在调查近期 Codex 提示词是否可能影响其系统。预先定义的审计轨迹本可更快地回答这个问题,并支持外部验证。

独立审计机构应测试这种隔离。其报告不必披露用户内容或专有架构,但可以确认受保护会话的数据是否进入了训练、检索系统、评估或智能体记忆存储。

大学同样负有责任。研究管理部门应将 AI 平台视为研究基础设施,而非普通写作软件。敏感项目需要获批准的工具、数据分类、保留规则,以及合作者之间有文档记录的同意。

期刊和会议应更新披露要求。作者应说明所使用的模型、相关设置,以及每个系统所扮演的角色。他们应在规定期限内保存交互记录,以备审稿人提出溯源问题。

披露必须保持适度。公布每一条探索性提示词会淹没读者,并暴露无关材料。简明的贡献说明可以概述常规使用,而安全档案则保留详细记录。

最棘手的问题涉及衍生学习。公司可能排除原始提示词,却仍使用汇总反馈、奖励信号或行为模式。这些衍生信息无需保留可识别文本,也能影响模型。

因此,研究政策应广泛定义被禁止的影响范围。它们应涵盖训练、微调、强化学习、评估设计、检索、合成数据生成和内部问题选择。

这些保护措施并不意味着 OpenAI 在本案中使用了私人工作。该公司称,其调查已排除相关近期提示词造成影响的可能。关键在于,研究人员不应必须等到公开争议发生后,才能获得这种保证。

只要证据完全存放在 OpenAI 内部,OpenAI 研究成果的署名归属就仍会存在争议。强有力的数据边界和独立审计能够将机构保证转化为可验证的程序。

AI 研究署名下一步需要什么

下一项考验是,公司和研究机构能否在下一项高关注度发现引发同样冲突前,将这场争议转化为共同规则。

首先需要关注的信号是独立数学评审。专家必须判断 OpenAI 的证明是否正确,其形式化是否与书面定理一致,以及其构造与早期工作有何关系。

形式化证明减少了一部分不确定性,但并未消除专家分析的必要性。审稿人必须检查定义、引入的假设、形式化陈述,以及证明证书与公开主张之间的关系。

如果该结果经受住这一流程,先进 AI 作为真正研究工具的论据将大幅增强。如果出现重大缺口,企业快速发表将面临关于验证和传播方式的更尖锐问题。

第二个信号,是发布一份可信的溯源记录。OpenAI 已公布日期、智能体数量、token 总数及其内部工作流程的描述。一份更完整的记录应说明起决定性作用的提示词、来源、人工干预,以及用户数据的使用边界。

这些证据将强化 OpenAI 关于独立性的主张。拒绝提供可审计的溯源信息并不能证明存在不当影响,但会让核心的信任问题悬而未决。

第三个信号是制度层面的行动。大学、期刊、AI 公司和资助方需要制定有关受保护研究会话、贡献声明、审计留存和争议署名的规则。

若只聚焦于数学,回应就会忽视更大的风险。同样的问题也可能出现在药物发现、材料科学、计算机安全、工程,以及任何将未发表想法输入托管 AI 系统的领域。

OpenAI 与 Anthropic 之间的竞争增加了紧迫性。如果贡献者所在雇主会影响署名或访问权限,研究人员可能会犹豫是否跨越机构界限开展合作。这种寒蝉效应将损害科学进步所需要的开放性。

公司必须将企业竞争与学术署名区分开来。研究人员的所属机构可能带来披露和利益冲突管理义务,但不应抹去已有记录的智力贡献。

科学界也必须重新思考优先权问题。一旦一条有效路径变得可见,AI 便能迅速弥合差距。只认可最终证明的署名体系,将越来越低估那些发现这些路径的人。

更好的模式应区分概念起源、技术完成、形式化验证、系统开发和项目指导。不同贡献者可以因各自角色获得认可,而无需假装所有贡献都等同。

读者应避免得出两个轻率结论。这场争议并不表明 OpenAI 抄袭了另一团队的工作;同样,一项有效证明也不意味着有关溯源的问题无关紧要。

关键事实在于,科学工具与科学竞争者如今共处于同一基础设施之中。OpenAI 的署名争议表明,非正式信任无法治理这种安排。

决定是否将未发表工作置入 AI 系统的研究人员,应直接提出几个问题:提供商会使用这些会话训练模型吗?内部研究人员能否访问它们?日志是否可导出、可独立审计,并受到保护以免被用于竞争用途?

AI 公司应在用户启动项目之前回答这些问题。清晰的保护措施可以鼓励研究人员使用先进工具,而不必担心早期想法会成为企业资产。

下一项具有里程碑意义的 AI 发现,检验的不仅是模型能力,也检验这些系统背后的组织能否在加速人类思想发展的同时,保存其演变历史。

这段历史并非礼仪性的脚注。它告诉未来研究人员方法从何而来、哪些洞见至关重要,以及知识如何取得进展。保护它,本就是产出可靠科学的一部分。

OpenAI 及其他 AI 公司如今面临选择:它们可以将署名争议视为公关问题,也可以与研究界共同建立标准。后一条道路能为 AI 辅助科学奠定仅靠速度无法提供的基础。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page