top of page

Intel 与 MIT 的信号揭示了科学 AI 缺失的关键要素

Intel 与 MIT 发出的信号正在挑战人工智能领域最根深蒂固的假设之一:仅靠更多数据,无法造就一名自主科学家。最新研究显示,AI agents 可以完成结构化分析任务,却未必会检验证据、修正信念,或为结论提供充分论证。

随着科技公司和研究机构从预测模型转向能够规划实验、提出假设的 agents,这一区别变得尤为重要。核心竞争已不再是 AI 与人类科学家之间的较量,而是以数据为中心的规模扩展与围绕科学推理设计的系统之间的竞争。

近期一篇 AI science analysis 将这场争论置于早先“科学即将完成”论断的背景下审视。这类预测一再低估:新的观察结果能够揭示既有理论中的缺陷。

AI 带来了类似的诱惑。模型如今能够吸收海量科学文献、检索相关论文、编写代码,并生成看似合理的解释。这种流畅表现,可能让积累的知识看起来像是真正的理解。

然而,科学并非通过重复数据集中证据最充分的答案而进步。它依靠研究人员识别不确定性、质疑假设、设计具有区分力的检验,并在证据要求时改变结论。

这正是近期 Intel 与 MIT 讨论背后的转向。AI 辅助发现的最大约束未必是无法获得另一份数据集,而在于 AI 系统能否参与将观察转化为可辩护知识的自我纠错过程。

Intel 与 MIT 的研究将焦点从答案转向探究

重要变化在于,研究人员开始评估科学 agents 如何思考,而不只是看它们是否得出可接受的答案。

第一代科学机器学习通常处理的是狭窄的预测问题。模型可能估计蛋白质结构、分类医学图像,或根据标注样本预测材料属性。

这些系统无需管理完整的研究过程,也能提供有用输出。科学家仍然负责选择问题、解读结果、检查物理约束,并决定下一步应开展哪项实验。

AI agents 承诺承担更广泛的角色。agent 将语言模型与工具、记忆、检索和控制循环结合,使其能够规划并执行多个步骤。在科学领域,这些步骤可以包括检索文献、处理观察结果、编写模拟代码和提出实验方案。

这一前景听起来像是数据驱动 AI 的自然延伸。只要向 agent 提供足够多的论文与实验室记录,为其连接合适工具,就能让它以任何单个研究人员无法企及的规模寻找模式。

不过,近期证据表明,完成工作流与进行科学推理是不同的能力。agent 可以通过薄弱的过程得出正确结果,就像学生在不理解题目的情况下猜对答案一样。

一项题为 AI scientists 的 2026 年研究考察了八个科学领域中超过 25,000 次 agent 运行。研究人员同时评估了任务表现,以及 agents 推理的认识论结构。

认识论结构描述的是系统如何对待证据、竞争性解释、不确定性以及可能的证伪。这些并非科学的装饰性附加项,而是决定结论是否值得信赖的关键。

该研究发现,底层语言模型解释了所测量表现与行为方差的 41.4%。agent scaffold,即外围的规划和工具框架,仅解释了 1.5%。

更令人担忧的是,研究人员报告称,在所分析的轨迹中,agents 有 68% 的情况下忽略了证据。由反驳驱动的信念修正仅出现在 26% 的情况下,而多项检验提供的收敛性支持仍不常见。

这些发现并不表明科学 agents 毫无用处。它们表明,agent 可以执行研究的一部分,却无法始终遵循令研究值得信赖的推理实践。

Intel 的认知 AI 工作指向了类似的技术担忧。Intel Labs 认为,未来系统除了神经学习外,还需要结构化知识、常识推理和符号操作。

MIT 研究人员则从另一个方向切入这一问题。他们正在测试 agents 是否能提出有用问题、解读不完整答案,以及在不确定性下进行协作。

这些来自 Intel 与 MIT 的信号共同转移了目标。科学 AI 必须更擅长探究,而不只是更擅长基于既有信息生成润色完善的回答。

更多科学数据无法消解相互竞争的解释

数据能够约束理论,但若不对原因、假设和不确定性进行推理,它很少能自行选出最佳解释。

科学数据集并非中立的事实集合。它们反映了测量什么、使用何种仪器、排除哪些观察结果,以及如何表示不确定性等决策。

在这些记录上训练的模型可能会继承同样的边界,却无法识别这些边界。它也可能学到由测量实践产生的相关性,而非研究人员希望解释的现象本身。

当问题保持稳定且相关类别已知时,更多数据会有所帮助。当研究人员面对异常现象、陌生机制,或多种理论都能解释同一组观察时,数据的决定性便会下降。

以寻找更优电池电解液的材料 agent 为例。它可以根据已发表的测量结果和预测属性对化合物进行排序。这种排序很有用,但并不能证明某种化合物为何会如预测般表现。

隐藏变量、实验室伪影或未建模的相互作用,都可能造成表面上的关系。科学系统必须追问:哪种解释能经受住新实验的检验,而不只是看哪种模式出现得最频繁。

同样的问题也出现在生物学中。agent 可以发现某种分子与疾病结局之间的关联。但从关联走向干预,需要因果推理、对照、重复验证,以及对生物学背景的关注。

因果推理关注的是:当其他相关条件保持受控时,某个特定因素发生变化会带来什么结果。训练数据本身不会自动提供这种反事实检验。

这一局限解释了为何科学进步不能被简化为文献摄取。论文中包含证据、解读、分歧,以及受激励机制影响的结果。AI 系统必须能够将它们区分开来。

它还必须知道,表面上的共识何时建立在共同假设之上。若每项研究都使用同一个代理指标,那么对该指标再增加一百万条观察,可能只会强化错误模型。

检索系统还面临额外问题。它们优先呈现被判断为与当前查询相关的材料。这可能使那些被忽视、却与 agent 初始假设相冲突的结果更难浮现。

一旦 agent 形成貌似合理的解释,确认偏误便可能进入其搜索过程。系统可能检索支持性证据、以有利于自身的方式解读模糊信息,并在形成连贯叙事后停止搜索。

人类科学家同样容易出现这种行为。科学通过对抗性审查、可复现方法、独立实验以及鼓励发现错误的机制来限制这一弱点。

自主 agent 需要在其运行过程中设置可比的检查机制。它应主动搜索反证、记录被舍弃的假设,并揭示每项建议背后的假设。

这些要求使科学 AI 成为一个知识架构问题。研究人员需要能够保留主张、来源、实验与修订之间关系的系统。

这种方法类似于 knowledge blending,即让检索到的信息始终与用户的工作语境保持关联。科学应用则需要更严格的版本,纳入溯源、不确定性和实验谱系。

因此,核心问题并不是数据是否重要。科学 AI 依赖高质量数据、可获取的研究记录和描述完善的实验。

错误在于将数据量视为判断力的替代品。额外观察可以缩小范围,但推理决定了哪种不确定性重要,以及下一步需要什么证据。

当问题开放时,科学 agents 仍然面临困难

当人类已经将发现过程转化为定义明确、终点清晰的任务时,如今的 agents 表现最佳。

基准测试可以让 AI 系统显得很科学,同时移除科学中最困难的部分。如果提示定义了问题、提供了相关工具并规定评分规则,agent 主要只需执行任务。

真实研究往往开始于这些要素尚未确定之前。科学家必须决定哪个问题值得提出、哪项测量具有信息价值,以及什么结果会改变他们的想法。

2026 年的 SciAgentArena benchmark 试图缩小这一差距。它包含约 200 项源自科学研究场景的任务,并在交互式环境中采用逐步验证。

其作者发现,当前 agents 能够有效参与定义明确的数据分析工作流。当任务要求开放式探索、新颖洞见,或在没有预设路径的情况下提供稳健解决方案时,表现就变得不那么稳定。

这一结果指出了谁将受到新证据的压力。通用 agents 的开发者不能再将成功使用工具等同于科学自主性。

研究机构同样面临压力。如果它们基于最终答案基准部署 agents,就有可能将一个能产出貌似合理结论、却无法可靠论证的过程自动化。

实验室需要审查中间决策的评估方式。agent 是否识别出相互冲突的证据?它是否选择了能够区分两种假设的实验?之后是否更新了自身信心?

这一区别也改变了 agent 编排的作用。为文献、编码、统计和审查加入专门 agents 可以扩大覆盖范围,却不能保证这一群体遵循连贯的科学方法。

多个 agents 可能强化同一种错误。若它们共享基础模型、训练分布或检索系统,表面上的一致可能反映的是相关性失败,而非独立确认。

科学团队通过使用不同仪器、方法、样本和理论视角来避免这一问题。agent 系统需要真正有意义的多样性,而非为同一模型赋予不同职位头衔的多个副本。

MIT 关于协作式提问的研究提供了一个具体例子。在一项受控游戏中,agents 必须在通信受限的条件下提出问题,帮助伙伴定位隐藏物体。

这项 questioning study 发现,在该环境中,经过精心训练的较小模型可以胜过规模大得多的模型。改进来自根据预期信息价值选择问题。

这对科学至关重要,因为发现依赖于选择能够减少不确定性的观察结果。大型模型或许掌握更多事实,却仍可能提出一个质量不佳的问题。

这一结果也挑战了“参数数量本身决定智能体质量”的观点。高效的科学智能体需要一套策略,用于判断自己不知道什么,以及哪项行动能够消除这种不确定性。

Intel 在结构化与符号推理方面的工作契合这一机制。符号方法会明确表示实体、规则和关系,使系统能够在既定约束下对其进行操作。

神经模型仍然很有价值,因为它们能够理解非结构化语言,并从大型数据集中识别模式。更强大的科学架构很可能会将这些优势与明确的假设、因果模型和验证工具结合起来。

这种混合设计带来了不同的工程目标。系统必须保留不确定性,而不是立即将其压缩为一个看似自信的答案。

它还必须将检索与评估分开。找到一篇论文,并不等于判断其方法是否支持所提出的主张。

因此,近期内智能体最可信的角色是有限边界内的协作。它们可以搜索、计算、模拟,并起草候选解释,而科学家仍应对问题框定和验证负责。

这种安排不如完全自主的 AI 科学家那样戏剧化,但也更符合现有证据。

真正的对手是缺乏科学推理的数据扩展

核心冲突在于:一类系统经过优化以复现成功输出,另一类系统则被训练以开展经得起辩护的探究过程。

数据扩展改变了现代 AI,因为许多任务会随着模型接触到更多示例而提升。语言建模、图像识别和代码补全都受益于对模式的广泛接触。

科学包含模式识别,但发现同样具有规范性层面。研究人员必须决定什么可以算作证据、不确定性应如何影响一项主张,以及何时应认定某种解释已经失败。

这些决定不能只靠与已知答案匹配来评判。前沿问题没有标准答案,而最有价值的结果可能会与现有文献相矛盾。

基于结果的奖励会带来一种特殊风险。如果开发者只要智能体的最终答案类似于已被接受的结论就予以奖励,模型便可能学会模仿共识,却没有学会为何这种共识是合理的。

通过虚假关系得出的正确预测,在科学上仍然很薄弱。它可能在新条件下失效,而系统或许无法可靠地指出这种失效何时会发生。

过程监督提供了一种应对方式。它评估中间步骤,例如智能体是否正确使用证据、是否测试了替代方案,以及是否校准了自己的置信度。

不过,科学过程比算术更难评分。数学证明有时可以逐行检查,而科学论证可能依赖不完整的证据和特定领域的判断。

研究人员提出了科学对齐的概念,即 AI 系统应遵循使科学结论可用的认识论价值。这些价值包括可追溯性、一致性、可验证性、校准性和可理解性。

一篇关于科学对齐的 2026 年论文认为,常规性能指标无法捕捉这些价值。该论文呼吁围绕科学实践设计基准和奖励系统。

这一提议并不要求模型照搬每一项人类研究惯例。科学机构本身存在偏见、发表激励和获取资源不平等的问题,不应被盲目编码进系统。

相反,目标是保留那些有助于纠错的特征。主张应与证据相连,假设应保持可见,而相互矛盾的观察结果应触发复核。

经过对齐的科学智能体会同时维持多个仍待检验的假设,而不是立刻选择一种叙事。它会识别最能区分这些假设的实验。

它还应区分“没有证据”与“证据表明不存在”。语言模型常常模糊这条界线,因为两者都可能出现在相似的语言语境中。

置信度校准是另一项要求。经过校准的系统会在证据稀少、相互冲突,或远超其训练分布时给出较低置信度。

这听起来很基础,但流畅的语言可能掩盖糟糕的校准。一个自信的段落并不会揭示,其底层推断究竟依赖单一间接来源,还是多个独立实验。

Intel 与 MIT 的讨论之所以有用,是因为它将架构与行为联系在一起。Intel 的结构化推理方向涉及如何表示知识和规则。MIT 的智能体研究则考察系统如何收集信息并在不确定性下行动。

这两种方向都不意味着要放弃大型模型或大规模数据集。它们都表明,应将这些资源置于一套为质询和纠错而构建的流程之中。

这一机制也决定了 AI 能否推动概念变革。经过训练以最小化意外的模型,往往会偏好接近其训练分布中心的解释。

科学智能体有时必须保留意外。异常可能只是噪声,但也可能指出一个被接受的模型从何处开始失效。

系统不应把每一次矛盾都当作发现来庆祝。它应根据可信度、可复现性,以及区分不同解释的能力,对异常进行排序。

这要求跨越数据、仪器和理论进行推理。与生成又一段可能的词序列相比,这是一项目标高得多的任务。

更快的假设生成会造成验证瓶颈

如果智能体生成想法的速度快于研究人员检验它们的速度,科学产出会上升,而每项结果的可信度可能下降。

AI 科学家带来的最直接风险,并不是它们停止生成答案,而是它们会生成过多看似合理的答案,令现有机构无法评估。

智能体可以检索数千篇论文、组合遥远的概念,并全天候提出候选实验。实验室能力、同行评审和专家注意力却无法以同样速度扩展。

Google DeepMind 研究人员将其称为验证瓶颈。随着假设产出加速,科学需要更好的基础设施来核查来源、复现结果并为实验排序。

这一瓶颈削弱了“更多 AI 输出必然意味着更快发现”的简单论断。有用的速度并非每小时生成多少假设,而是有多少可信假设得到检验并纳入共享知识。

自动化审稿人或许能帮助筛选投稿,但也会引入相关风险问题。基于同一模型家族构建的审稿系统,可能会忽略与生成智能体相同的无依据假设。

独立验证不能只是询问另一个聊天机器人某个答案看起来是否正确。它可能需要独立数据、不同模型、形式化检查、模拟或实体实验。

实体验证尤其重要,因为科学模型会与现实世界互动。化学合成可能因杂质、温度敏感性,或文献中未记载的操作细节而失败。

AI 智能体可能推荐一项理论上富有信息量、但不切实际或不安全的实验。领域专家必须评估那些从未在其训练数据中被完整表示的约束。

数据来源又构成另一种脆弱性。智能体经常合并来自不同证据标准来源的陈述。一项同行评审结果、一篇预印本和一条未经验证的数据库条目,可能会成为同一段自信回答中相邻的句子。

可信的系统应展示每项主张来自何处,以及它在推理过程中如何变化。它不应以流畅的总结掩盖分歧。

这种怀疑也应延伸到基准结果。在大约 200 项交互式任务上表现强劲,并不能证明智能体能够应对每一个研究领域。

基准测试必然简化现实,而模型也可能针对其重复出现的结构进行优化。在计算生物学中表现良好的系统,仍可能在实体实验室或田野研究中失败。

对超过 25,000 次智能体运行的研究,截至发表时仍是一篇预印本。其庞大的实验基础使之具有价值,但独立复现和同行评审依然重要。

其中的百分比不应被视为适用于所有科学智能体的普适常数。它们描述的是接受评估的系统、任务和评分方法。

即便如此,核心警示仍难以忽视。在受控评估中忽视证据的智能体,不应被赋予对高成本或安全敏感研究不受约束的权力。

组织应将辅助与自主分开。智能体可以准备文献图谱,但不应自行断定某种治疗有效。它可以建议实验,但不应控制危险设备。

团队还需要记录失败的推理,而不只是成功输出。隐藏的失败会妨碍研究人员了解哪些任务超出了系统的能力范围。

这正是 Intel 与 MIT 的论点变得具有操作意义之处。在机构扩大智能体部署之前,科学推理必须被设计进工作流、评估和审查关卡之中。

否则,结果将是更快的内容生产,却附带更慢、更昂贵的验证。这是对科学表象的自动化,而不是科学进步。

三个信号将表明 AI 智能体是否正在成为科学家

下一阶段应以信念修正、现实世界验证和独立复现来评判,而不是以愈发精致的演示来衡量。

第一个信号是过程层面的科学基准出现。这些测试应评估智能体是否寻找反证、是否区分相关性与因果关系,以及是否会在预测失败后修正立场。

当推理轨迹可审计、且任务在评估前保持隐藏时,基准结果会更具说服力。在这些条件下取得成功,将增强“科学推理可以成为一种可训练能力”的论据。

失败则会强化当前结论:通用智能体主要是在执行结构化工作流。它也将表明,增加工具和记忆并不能解决底层的推理缺口。

第二个信号是端到端实验验证。研究团队应报告有多少由智能体生成的假设经受住了实验室测试,而不只是报告智能体提出了多少想法。

最有力的证据将来自这样的案例:智能体选择了一项富有信息量的实验,得到意外结果后,又改变了其工作理论。这个序列检验了完整的科学循环。

一次成功的发现会吸引关注,但重复表现更重要。研究人员需要知道,该过程是否能跨越新任务发挥作用,以及失败是否仍然可被发现。

第三个信号是由使用不同模型、工具和数据集的团队进行独立复现。复现能够揭示某项结果是否依赖于一个智能体的隐藏假设,或某项基准的设计。

同一底层模型的多个副本之间达成一致,不应被视为独立确认。有意义的复现需要足够的方法学分离,以暴露相关错误。

这些信号也厘清了科学智能体在近期市场中的定位。能够记录不确定性并融入人工审查的系统,应当比那些仅凭规模承诺自主发现的产品赢得更多信任。

对开发者而言,务实的优先事项是构建能够暴露其工作状态的智能体。每一个假设都应关联到来源、前提、计划中的测试、观察结果以及后续修订。

对企业研究负责人而言,评估应从范围明确的任务开始。团队可以将智能体的建议与专家决策进行比较,并追踪两者出现分歧的地方。

知识工作者也应关注这一点,因为同样的区别并不止于实验室。一名审查合同、产品研究或客户证据的智能体,也可能在未验证其底层假设的情况下给出看似可信的答案。

这正是 Intel 与 MIT 之争具有更广泛重要性的原因。它提出了一个问题:AI 系统究竟会只是加速产出熟悉的结果,还是会提升产生这些结果的推理质量。

更多数据仍将不可或缺。更好的模型同样重要,专业工具也会拓展智能体的能力边界。

但这些投入都无法消除对自我纠错流程的需求。科学知识之所以获得其地位,是因为一项主张能够被质疑、追溯、检验和修正。

下一代可信的 AI 科学家,不会由它读过多少论文来定义,而会由它在证据表明其最初答案错误时如何应对来定义。

研究人员、开发者和技术采购者如今应当向每一个科学智能体提出一个更难的问题:系统能否说明,哪些证据会使它改变看法?

如果这个答案仍不明确,那么该智能体依然只是能力出色的研究助手,而非自主科学家。这个区别应当指导组织如何评估下一轮 Intel MIT 研究主张,以及此后每一场科学 AI 演示。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page