研究人员提出以智能体原生工件作为科学工作的全新格式
- Olivia Johnson

- 2小时前
- 讀畢需時 13 分鐘
IEEE Spectrum 聚焦了一项由 37 位作者共同提出的方案,它挑战了一项科学界的基本惯例:研究人员不应再将人类可读的论文视为主要产出。作者主张改用为 AI 智能体打造、可由机器执行的研究包。他们并非认为人们应失去获取科学知识的渠道,而是指出,人工智能如今需要比传统论文所能承载的更多细节。
该提案发表于 The Last Human-Written Paper,于 2026 年 4 月 27 日提交至 ArXiv,并于 5 月 19 日修订。作者将这一替代形式称为 Agent-Native Research Artifact,即 ARA。该格式将科学主张、可执行代码、研究历史和原始证据整合在一个结构化包中。
这一构想引发的冲突,比其挑衅性的标题所暗示的更为尖锐。科学必须让机器更易于审查,同时不能让人们更难以质疑。真正的较量因此并非 AI 读者与人类读者之间的对立,而是机器效率与使研究可被理解的叙事、编辑和社会功能之间的平衡。
论文报告称,该方法在部分机器学习基准上取得了显著提升。然而,其自身结果也揭示了一项警示:以往失败的详细记录能引导 AI 智能体找到有价值的工作,但也可能使其固守过时的思路。
IEEE Spectrum 的报道究竟提出了什么
该提案将科学的主要对象从一份用于说服的文档,转变为一个可操作的软件包。
传统论文会将研究项目呈现为一条线性的论证。它提出问题、描述方法、报告结果,并说明这些结果为何重要。代码、数据、补充文件和实验室记录通常都置于这一核心叙事之外。
ARA 颠倒了这一层级关系。结构化包成为主要记录,而可读论文则成为其内容的一种编译视图。AI 智能体可以检查单项主张、追溯证据、执行代码,或了解塑造某项实验的决策过程。
这 37 位研究人员将 ARA 组织为四个相互关联的层次。认知层记录问题、概念、实验和可证伪的主张。物理层包含可执行代码、配置、依赖项、硬件要求和随机种子。
探索图保留分支、被否决的方法、失败经历和策略转向。证据层保存支撑每项主张的结果、日志、曲线和其他输出。交叉引用则将某项断言与其对应的实验、代码和证据连接起来。
这一结构回应了作者所称的“叙事税”和“工程税”两大问题。叙事税指研究人员将数月中不断分支的工作压缩为一条成功路径时产生的损失。在这种压缩过程中,失败实验和被否定的假设往往会消失。
工程税描述的是:足以说服他人的信息,与足以实际执行的信息之间存在差距。审稿人或许能理解某种方法为何应当有效,却不一定掌握复现实验所需的每一项设置。试图执行实验的 AI 智能体无法可靠地弥合这一缺口。
作者还提出了三套配套系统。Live Research Manager 将在使用 AI 助手进行日常工作时记录决策。ARA Compiler 则会把现有论文和代码库转换为新结构。
随后,原生支持 ARA 的评审流程将检查结构完整性、论证严谨性和可复现性。人类审稿人仍将负责涉及重要性、新颖性和科学品味的判断。
IEEE Spectrum 的分析之所以让这一提案具有新闻价值,是因为它不止于用 AI 总结论文。它提出的问题是:科学传播是否应围绕能够阅读、复现和拓展研究的自主系统重新设计。
这一区别至关重要。搜索工具将论文视为需要检索的文档。ARA 则将研究视为智能体能够在其中行动的环境。
该提案也比在 PDF 附上笔记本或代码库走得更远。其核心主张是,叙事论文属于有损编译结果。增加更多补充文件,并不必然能恢复主张、决策、实现细节和原始证据之间的联系。
因此,ARA 对机构提出了直接要求。大学、会议、期刊、资助方和研究团队都需要将结构化工件认可为一等产出。缺少这种认可,ARA 仍将只是精致的补充材料,而非替代方案。
为什么 AI 智能体正在给科学出版商施压
出版商如今面临格式问题,因为 AI 系统消费研究成果的方式不同于人类读者。
人们通常从标题、摘要、图表和结论开始阅读,再根据兴趣和专业知识在各个部分之间切换。优秀的叙事有助于他们理解一个问题为何重要,以及证据如何改变论证。
执行技术工作的 AI 智能体则有不同需求。它必须识别精确主张、解析依赖关系、定位配置、检查代码,并将报告中的数字与原始输出关联起来。它还需要区分已确认的结果、假设和被放弃的想法。
PDF 可以包含这些细节,但很少能以一致方式呈现。表格可能难以解析,公式在提取过程中可能失去结构。一种方法可能依赖于散落在正文、附录、代码和未被记录的讨论中的设置。
ARA 研究人员审查了与 23 篇 ICML 2024 论文相关的 8,921 项经专家标注的复现要求。他们报告称,相应 PDF 中仅有 45.4% 的要求得到了完整说明。代码开发要求的充分覆盖率为 37.3%。
缺失的超参数占已识别信息缺口的 26.2%。这些数字来自提案作者的分析,并非对 ARA 的独立审计。不过,它们以异常具体的方式描述了一个人们熟悉的可复现性问题。
其底层基准是 PaperBench,用于评估 AI 智能体能否复现机器学习研究。复现不仅仅是回答论文相关问题。智能体必须重建实验,并产出可由专家评审者评估的结果。
面临压力的不只是出版商。研究人员需要在项目进行期间捕捉更多结构化信息。实验室需要制定政策,在不披露机密材料的前提下保存内部决策。
会议审稿人需要工具来浏览可能包含数千个文件和事件的工件。档案管理人员需要为环境、依赖关系、溯源和访问权限制定稳定标准。研究机构还需要决定,哪些机器操作可以算作有效验证。
论文对作者负担的回答是自动化。其 Live Research Manager 将观察人类与智能体的协作,并将决策转化为结构化记录。这种方法假定 AI 助手会全程参与项目。
这一假设适用于某些计算机科学实验室。它对湿实验生物学、临床研究、田野调查和定性研究则不那么自然。这些领域的大量证据起源于物理观察、访谈、仪器、样本或受限记录。
作者承认,他们的评估覆盖的是机器学习。他们表示,对于在计算环境之外开展的实验,物理层和探索层可能需要进行大幅调整。这一限制显著缩小了该提案的即时主张范围。
科学出版同样服务于不执行代码的读者。政策制定者、记者、学生、跨学科研究人员和受影响的社区需要的是解释,而不是遍历代码库。一个只为智能体优化的格式将无法服务这些受众。
因此,该提案更有力的版本是双重出版。结构化研究对象可以承载可执行的细节,而面向人类的叙事则解释目的、不确定性和影响。论文本身实际上也支持这一做法,因为它将叙事称为编译视图。
IEEE Spectrum 揭示了一个真正的压力点,但务实的回应并不要求放弃文字叙述。它要求终结 PDF 作为项目唯一权威表述形式的角色。
IEEE Spectrum 的核心冲突是知识与叙事之争
机器可读的结构能够保留更多研究细节,但仅有细节并不能形成科学理解。
作者将其设计原则概括为“知识优先于叙事”。这句话点出了该提案最强的洞见,也揭示了其核心弱点。研究知识并不总能与论证的建构方式分离。
叙事可能掩盖失败,并淡化不确定性。它同样可以解释一个问题为何值得关注、哪些假设具有道德分量,以及证据在哪些地方仍存在模糊性。这些功能很难被简化为主张、依赖关系和可执行任务。
科学论文具有说服力,是因为科学需要判断。读者会评估一个问题是否重要、比较是否公平,以及解释是否符合证据。机器可验证的软件包能够支持这些判断,但无法让它们自动完成。
尽管如此,ARA 的四层结构仍提供了明确益处。主张与证据之间的关联可以暴露缺乏支撑的结论。配置记录可以减少徒劳的复现尝试。探索历史可以避免多个团队重复同一种失败路径。
拟议的 PAPER.md 入口也支持渐进式披露。智能体可以先阅读简明概览,再仅加载解决特定问题所需的文件。这种设计有助于控制上下文使用,同时保留更深层的材料。
这一方法扩展了早先让研究对象更易发现和复用的努力。FAIR 原则确立了数据应当可发现、可访问、可互操作和可复用。其他系统则对工作流、溯源、笔记本或原子化主张进行打包。
ARA 试图通过执行能力和决策历史将所有这些维度连接起来。其新颖性不在于任何单一文件类型,而在于它们之间的绑定关系。一项主张可以指向一个实验、代码路径、输出和一系列先前决策。
如果研究人员能如实维护这种结构,它将使科学工作更易于审计。它也可能让选择性报告变得更加明显。审稿人可以检查,在最终报告的方法成功之前,有多少种路径曾经失败。
不过,穷尽式记录也会带来新的解释问题。一次失败实验可能反映的是实现缺陷,而非错误假设。智能体可能将旧失败视为普遍约束,尽管它只适用于某一种环境。
论文自身的扩展测试展示了这一风险。配备 ARA 的智能体在五项 RE-Bench 任务中更快找到了有用的第一步。它们能够访问基于论文的智能体必须重新发现的失败轨迹和启发式方法。
在两项使用更强大模型的任务中,早期优势并未带来最佳的最终结果。基于论文的智能体在既有流程之外继续探索。ARA 智能体则始终受制于工件中记录的策略。
这一结果削弱了最简单的推销说辞。更结构化的上下文并不总能带来更好的开放式研究。有时,未知反而保留了更广阔的搜索空间。
关键权衡在于记忆与探索之间。科学系统需要足够的记忆,以避免不必要的重复;同时也需要机制,防止继承而来的结论变成无形的边界。
人类研究者早已面对这一问题。文献综述能帮助他们在既有工作基础上推进,但被广泛接受的框架也可能抑制替代性问题的提出。机器智能体可能会放大这种效应,因为它会持续、一致地遵循明确的结构。
ARA 可以通过为失败分支附加溯源信息、日期、模型能力和适用范围条件来应对这一风险。当硬件、数据或方法发生变化时,智能体可以降低旧结果的权重。它们还可以获得在既有图谱之外进行探索的专门预算。
这些保护措施并非无关紧要的实现细节。它们决定了智能体原生工件会成为地图,还是牢笼。地图标示已知地形,同时为边界之外留出空间。
最理想的结果是同时保留两种表达方式。人类将获得叙事清晰、作者责任明确的内容;智能体将获得可检查的研究对象,其中包含散文无法高效承载的操作细节。
基准提升显著,但尚不足以下定论
报告中的结果足以支持进一步测试,但不足以证明科学论文应被普遍替代。
作者评估了理解、复现、扩展和自动化审查能力。最直接的比较是:为智能体提供 ARA 软件包,或提供附带相关代码的传统论文。测试随后衡量每种表达形式对研究任务的支持程度。
在 PaperBench 和 RE-Bench 的问答任务中,论文报告准确率从 72.4% 提升至 93.7%。这意味着在 450 个问题中相差 21.3 个百分点。结果表明,结构化工件有助于智能体定位精确的技术信息。
在复现方面,报告的成功率从 57.4% 上升至 64.4%。评估涵盖从 15 篇 PaperBench 论文中抽取的 150 个子任务。7 个百分点的提升具有价值,但仍有超过三分之一的任务未能成功。
扩展结果则更为复杂。ARA 在五项开放式任务中的三项取得最高分,并在全部五项中更快找到有效的初始方向。不过,既有的失败记录有时限制了更强智能体的表现。
这些是作者在预印本中报告的结果。该工作发布至 ArXiv 时尚未通过传统期刊审查。独立团队仍需复现这些比较,并检验工件构建过程是否偏向 ARA 条件。
论文披露了若干重要限制。熟悉所选论文和 ARA 格式的评估人员参与构建了人工标注基准。对于陌生主题、非典型方法论或整理程度较低的工件,性能可能有所不同。
编译器也无法恢复原始论文中缺失的信息。如果作者遗漏了某项实验设置,提取系统便无法可靠地重建它。因此,转换而来的旧论文会继承源文档中的许多缺口。
实时捕捉能够保留更多信息,但也带来了另一项依赖。该系统假设研究决策会经过由 AI 介导的工作流。该工作流之外的对话、手动实验、私密消息以及未被记录的判断,仍可能缺失。
安全性是更大的未解问题。论文称,包含沙箱执行、内容级异常检测和细粒度访问控制在内的生产环境要求尚未实现。在智能体执行陌生研究软件包之前,这些控制措施必不可少。
恶意工件可能包含不安全的代码或误导性指令。遭到入侵的依赖项可能篡改结果。敏感记录可能泄露未发表的想法、个人信息、安全发现或机密数据集。
隐私同样与全面捕捉相冲突。保留每个被否决的想法和每段对话,对机器而言听上去很有价值;但如果每条推测性评论都会成为持久工件的一部分,研究人员可能会更少畅所欲言。
选择性访问可以缓解这一担忧,但受限证据会带来验证上的复杂性。审稿人必须知道哪些内容被隐去,以及原因何在。机构还必须防止私密材料通过生成的摘要或派生输出泄露。
自动化审查引入了另一层不确定性。拟议的 ARA Seal 会按递进层级检查结构、严谨性和执行情况。然而,结构完整性并不保证某项主张在科学上重要或在概念上成立。
大型语言模型也可能作出不一致的判断。论文报告称,其基于模型的严谨性审计器存在若干病态表现,包括检测到的问题与分配分数之间不匹配。即使在所提架构内,人类审查仍然不可或缺。
这些限制并未抹去已有提升。它们说明,采用应从计算领域的并行工件开始。会议可以要求提交 ARA 软件包,同时保留人类可读的论文和常规审查流程。
团队随后可以比较写作负担、审稿时间、复现率、安全事件和工件复用情况。这些衡量指标将比仅凭基准表现替代论文提供更有力的证据。
这项提议最好被理解为基础设施研究。它提供了一种可测试的格式和配套工具,但尚未确立科学传播的普遍终局。
三个信号将表明智能体原生研究是否可行
下一阶段应根据采用情况、独立复现和运营安全性来评判,而不是根据挑衅性的标题。
第一个信号是会议、期刊或大型实验室的采用。可信的试点应要求某一类计算型投稿提供结构化工件,同时明确归档规则和审稿人职责。
自愿上传至 GitHub 很有用,但并不能检验机构层面的接受度。研究人员会响应发表要求、引用惯例、资助规则和晋升激励。只有当这些系统认可一种格式时,它才会成为基础设施。
第二个信号是独立复现。外部团队应使用未见过的论文、不同智能体和多个模型家族,重新构建报告中的 ARA 比较。他们还应披露创建和维护每种工件的成本。
一项有价值的研究应区分三种效应:一种来自更好的格式;另一种来自加入论文中没有的信息;第三种来自评估者了解工件的构建方式。
这种区分至关重要,因为任何详尽的研究软件包都可能优于一份简短 PDF。更困难的问题是,ARA 的特定本体是否能跨越项目和机构提供持久收益。独立测试可以确立这种差异。
第三个信号是可信的安全与治理模型。在智能体执行共享工件之前,生态系统需要沙箱机制、依赖项控制、溯源检查、权限管理和持久审计日志。这些保障措施必须能够跨组织运行。
治理还必须界定作者身份。如果智能体记录决策、修改主张、执行实验并生成摘要,读者需要知道哪些贡献来自人类。归属不能在工作完成后变成一个不透明的自动生成字段。
公开的 ARA repository 提供了用于实验的代码和示例。这种开放性可以帮助独立研究者检查所提模式,也让潜在采用者拥有可测试的具体对象,而非纯理论标准。
短期内的采用可能并不均衡。机器学习和计算系统最契合这一模式,因为它们的实验本就涉及代码、配置、日志和可测量输出。其他学科则需要不同的物理控制和伦理控制。
研究人员不应将 IEEE Spectrum 提出的问题理解为要求他们为机器而非人类写作。他们应将其视为一种要求:停止强迫一份文档服务所有受众。
论文可以保留为人类界面。智能体原生软件包可以成为操作记录。在证据表明两种格式各自能有效履行哪些科学功能之前,任何一方都不应悄然取代另一方。
这种分工也为知识工作者提供了实用工作流。团队可以保留结构化源材料,同时为同事产出易读的说明。一套可搜索的知识库遵循相同的总体原则:保留证据,同时让检索更加容易。
困难之处不在于生成更多文件,而在于维护主张、决策、代码和证据之间可信赖的联系。这些联系必须经受软件变更、人员流动以及对解释的分歧。
IEEE Spectrum 在一个刻意戏剧化的标题之下提出了一项严肃的建议。科学出版的未来不太可能是最后一篇由人类撰写的论文,更可能是第一份真正为两类读者设计的研究记录。
研究人员在采用 ARA 之前应提出一个具体问题:这个软件包是否让工作更易验证,同时不削弱人类理解?如果独立复现、机构试点和安全执行给出肯定答案,智能体原生工件就应在论文旁获得正式地位。在此之前,科学家应试验这种格式、保留可读叙事,并抵制将机器效率视为科学传播唯一衡量标准的倾向。


