top of page

卡内基梅隆的脑模型迎来现实检验

卡内基梅隆大学凭借一项明确的 NeuroAI 主张登上 Google News:机器学习模型能够预测人类视觉皮层部分区域对图像的反应。这项工作让脑科学研究从记录神经活动迈向预测神经活动。然而,能够预测神经信号的模型,并不必然解释了生物视觉的工作机制。

这一区别构成了核心张力。Maggie Henderson 团队收集功能性磁共振成像数据,即 fMRI;它测量与神经活动相关的血流变化。研究人员随后将这些测量结果与深度神经网络内部生成的表征进行比较。

这种方法建立在神经科学与人工智能长期相互影响的基础上。早期神经网络借鉴了生物学思想。如今,神经科学家正将计算机视觉系统作为可检验的感知模型。

这种角色转换带来了新机遇,也提出了一个艰难的科学问题。一个模型可以匹配记录到的脑活动,却依赖于不同于大脑自身过程的计算方式。因此,预测只是起点,而非最终解释。

Google News 标题实际揭示了什么

卡内基梅隆正将 AI 视为神经科学的预测工具,而不是读心机器,也不是重现人类所见一切的系统。

该报道于 2026 年 8 月 24 日卡内基梅隆介绍其更广泛的 NeuroAI 项目后,通过 Google News 浮现。公开介绍汇集了若干相关项目,而非宣布某一项已完成的产品。

心理学助理教授 Henderson 研究大脑如何将视觉输入转化为物体和场景的表征。她的团队在人们观看图像时记录 fMRI 数据,随后构建计算模型,以预测不同视觉区域的反应。

这些模型使用深度神经网络学习到的内部特征。特征是一种帮助网络区分形状、纹理、颜色或物体身份等信息的模式。研究人员可以检验这些特征是否能够预测人脑数据中的模式。

这之所以重要,是因为传统脑成像往往只能得出相关性,却无法提供完整的计算解释。某个区域可能在任务期间更为活跃,但这一观察并不能说明其正在执行何种计算。

可由刺激计算的模型迈出了更强的一步。它接收图像或声音等物理输入,并生成预测的神经反应。科学家可以将这一预测与人类或动物测得的反应进行比较。

另一位卡内基梅隆研究人员 Jenelle Feather 将这些模型描述为直接从刺激输入到神经预测的系统。她的工作包括检验人工网络保留和舍弃信息的方式,是否类似于生物感觉系统。

最新报道不应被解读为卡内基梅隆重建了某人的私人视觉体验。所引用的工作聚焦于预测对受控输入的反应。这与仅根据脑活动解码未知图像不同。

这一区别也将该研究与临床读脑新闻标题区分开来。Henderson 的项目研究的是参与感知的表征,并未建立一种可从 fMRI 扫描中提取信念、记忆或意图的通用方法。

尽管如此,卡内基梅隆的项目确实标志着方法论上的具体变化。研究人员可以从询问活动出现在哪里,转向检验计算模型是否能预先预测这种活动。

该校的 NeuroAI program 还将这项视觉研究与听觉、脑机接口、自适应 AI 和神经回路绘图联系起来。这些项目有着共同目标:将描述性测量转化为能够生成可证伪预测的模型。

Google News 的表述将这一议程压缩为关于大脑“图像感知”的简单标题。其背后的故事更为审慎:AI 提供候选解释,而实验决定这些解释能否经受检验。

为什么现在预测视觉皮层如此重要

机遇来自于将更好的神经测量方法,与能够处理研究参与者所见同样复杂刺激的计算机模型结合起来。

较早期的视觉神经科学实验经常使用简单刺激,包括条纹、光点和受控图案。这些实验揭示了基本原理,例如对特定边缘方向作出反应的神经元。

自然场景引入了更多变量。一张街景照片可能包含人脸、车辆、阴影、文字、深度线索和相互重叠的物体。要分离每一种特征的贡献变得困难。

计算机视觉网络提供了一种实用的中间表征。其各层将像素逐步转换为更抽象的特征。研究人员可以询问,这些转换是否类似于视觉皮层中测得的变化。

这种比较并不要求研究人员声称人工网络是大脑的字面复制品。相反,网络成为多个候选模型之一,其预测可以与记录数据进行检验。

由于机器学习模型能够大规模处理未经编辑的图像,这种方法变得更有用。它们还可以为模型拟合过程中未纳入的图像生成预测反应。

对未见刺激的泛化至关重要。只会复现训练观察结果的模型,可能只是记住了统计模式。能够预测新反应的模型,则提供了更有力的证据,表明其捕捉到了某些可复用的东西。

研究人员仍需要的不只是整体准确率。两个系统可以达到相近的预测分数,却使用不同的内部机制。一个模型可能利用纹理,而人类则更多依赖形状或语境。

这一问题给该领域最熟悉的基准文化带来压力。AI 研究常奖励在固定数据集上的表现。神经科学需要能够区分竞争机制的实验,即使这些机制在普通图像上获得相似分数也是如此。

卡内基梅隆的工作处于更广泛的努力之中:构建具有更丰富测量数据的数据集。MICrONS 项目将神经活动记录与对小鼠视觉皮层物理连接的详细重建结合起来。

该项目绘制了 1 立方毫米组织,其中包含约 20 万个细胞和超过 5 亿个连接。研究人员先记录其对视觉刺激的反应,再以极高分辨率重建同一块组织。

这种配对很重要,因为活动和解剖结构通常来自不同实验。MICrONS 让研究人员能够在同一块组织中考察布线、神经反应和计算行为之间的关系。

卡内基梅隆教授 Xaq Pitkow 参与开发了连接这些层面的模型。研究人员可以向模型输入视觉场景,预测神经反应,并将这些预测与记录到的活动进行比较。

MICrONS brain map 也支持其最初研究人员未曾预料到的问题。公开数据集让其他团队无需重复完整测量过程,便可检验替代模型。

这些基础设施解释了为何 NeuroAI 如今受到关注。该领域拥有更强大的模型、更大的数据集、更精细的测量,以及用于设计针对性实验的工具。这些要素可以将关于智能的哲学争论转化为实证比较。

预测与解释才是真正的对手

主要竞争并非神经科学与 AI 之间的竞争,而是预测准确性与对生物计算的忠实解释之间的竞争。

模型可能因错误的原因预测出神经反应。这种可能性在机器学习中并不陌生:分类器可能利用背景模式,而非预期识别的物体。

同样的危险也适用于脑模型。一个网络可能因其特征追踪了有用的图像统计规律而与脑活动相关。这种相关性并不能证明大脑以相同方式计算这些特征。

因此,研究人员需要通过干预来区分那些表面上同样成功的模型。普通照片往往无法完成这项工作,因为许多性能合格的模型会以类似方式对其进行分类。

Nikolaus Kriegeskorte 及其合作者提出使用合成的“争议性刺激”。这些图像被设计为让竞争模型产生不同预测,研究人员随后将同样的图像展示给人类或动物。

一张模糊图像可能对某个模型而言更像数字三,对另一个模型而言更像数字七。人类判断可以表明哪个模型更贴近生物感知。两个模型也都可能失败,从而显示需要另一种理论。

这一策略将分歧转化为实验资产。科学家不再只是庆祝较高的平均相关性,而是寻找竞争解释出现分歧的情形。

哥伦比亚大学 Zuckerman Institute 在 2026 年的一次讨论强调,执行相同任务的模型可能采用不同计算方式。其 model disagreement 方法,为有关类脑 AI 的宽泛主张提供了重要的制衡。

可解释性带来了第二项挑战。大型神经网络可能包含数百万乃至数十亿个可调参数。即便它们能准确预测神经活动,其复杂性也会使分析变得困难。

卡内基梅隆于 2026 年 2 月发布的一份报告介绍了另一支团队将视觉皮层模型压缩为更小形式的尝试。所得模型的复杂度降低了数千倍,同时仍保持较高的预测准确性。

这些紧凑模型帮助研究人员检查与单个神经反应相关的特征,例如对人脸中眼睛以及视觉图案中光点的敏感性。

重点并不只是计算效率。更小的模型能够揭示研究人员可转化为实验室假设的关系。

参与该工作的卡内基梅隆教授 Matt Smith 认为,科学家无需借助庞大网络来理解单个神经元。compact vision models 的设计目标是在保留预测能力的同时,提高科学上的可理解性。

压缩并不能解决所有解释性问题。简化后的模型仍可能不符合生物学实际,也可能隐藏原始网络中重要的机制。

不过,压缩为实验创造了更清晰的检验目标。研究人员可以测试某个假定特征是否会在不同图像、语境和受试者中稳定地驱动一个神经元。

因此,最强的 NeuroAI 工作流程包含若干阶段:大型模型首先识别可预测的结构,研究人员随后简化或解释该结构,最后通过针对性实验尝试证伪它。

这一顺序将科学建模与模式匹配区分开来。它也解释了为什么当前这则 Google News 报道不应止步于预测得分。真正有意义的结果,来自预测经受住了专门设计来让它失败的实验。

脑图谱并未消除测量鸿沟

NeuroAI 模型仍受限于研究人员能够测量什么、研究哪些物种,以及受控实验与自然感知之间的差异。

Henderson 的人类研究依赖 fMRI,它能提供广泛的空间覆盖,但无法直接记录单个神经元的电脉冲。其信号反映了与神经活动相关的血氧水平变化。

这种间接信号比支撑感知的神经事件来得更慢。一个模型或许能够预测 fMRI 模式,却未必捕捉到产生该模式的一连串快速计算过程。

人类 fMRI 还会对大量神经元的活动进行平均。两种不同的细胞机制可能产生相似的大尺度测量结果。研究人员不应将某个脑区的匹配视为完整的神经解释。

MICrONS 提供了精细得多的解剖和细胞层面细节,但其主要视觉数据集来自小鼠皮层。小鼠视觉支持有价值的研究,但在解剖结构、行为和生态需求上与人类视觉存在差异。

这些项目彼此互补,而非构成一个统一的人脑模型。人类成像与人类感知更直接相关;动物记录和组织重建则提供了在活体人类中通常无法获得的分辨率。

自然行为带来了另一层鸿沟。受试者在扫描仪内观看固定图像,并不等同于在日常条件下感知世界。日常视觉涉及眼球运动、运动、行动、记忆以及不断变化的目标。

SCENE,即 Simons Collaboration on Ecological Neuroscience,正着手解决这一限制的一部分。这项为期十年的计划获得了 8000 万美元支持,研究大脑如何在真实环境中将感知转化为行动。

其研究人员考察“可供性”,即环境为行动提供的意义与机会。一把椅子可供人坐下,而一条开放的路径可供人移动。

这一重点将目标从识别物体转向判断什么对行为重要。它也带来了更严苛的建模要求。一个有用的系统必须将感官输入与情境、不确定性和行动联系起来。

SCENE 的规模表明研究界对这一方向抱有长期信心。但这并不保证当前神经网络已经具备相关机制。

Carnegie Mellon 的 SCENE initiative 将机器学习与神经记录及行为实验相结合。其较长周期让团队有时间发展理论、收集数据,并在失败后修订模型。

另一个不确定性涉及个体之间的差异。大脑解剖结构、经验、注意力和扫描条件都会改变测得的反应。一个针对某一群体拟合的模型,未必能顺畅地泛化到另一个群体。

研究人员还必须防范循环式评估。如果模型选择和测试依赖于高度相关的图像或测量数据,性能看起来可能强于其真实世界泛化能力所应有的水平。

独立数据集提供了更好的检验。跨实验室复现将进一步增强信心,尤其是在设备、参与者和分析选择均不相同的情况下。

有关未来临床应用的主张需要格外谨慎。对健康感官活动的预测模型,并不会自动成为治疗模型。医学转化需要安全性证据、针对患者的验证,以及可衡量的获益。

Feather 曾描述过一条可能的路径,涉及助听器和人工耳蜗。研究人员可以对健康听觉系统建模,模拟损伤,并设计旨在恢复更健康神经编码的处理方式。

这是一项研究方向,而非已确立的临床成果。模型的假设必须在不同设备、患者、环境和不断变化的神经系统之间依然成立。

同样的谨慎也适用于脑机接口和视觉恢复。更好的模型可以提出研究目标和实验思路,但不能替代临床试验或对患者结局的直接测量。

这些限制并未否定 NeuroAI。它们界定了这项工作从有趣的相关性迈向可靠感知解释所需完成的任务。

脑模型如何重塑人工智能

NeuroAI 的双向价值取决于能否发现改善机器性能的生物学原理,而不只是让 AI 系统听起来更像人类。

计算机视觉早已借用了神经科学的语言和结构。人工神经元、分层处理和感受野都体现了生物学启发,尽管现代系统与真实大脑存在显著差异。

这轮重新展开的交流提出了一个问题:当前 AI 仍缺少什么?动物能够持续学习,在变化条件下行动,并在无需为每项任务接收数百万个标注样本的情况下适应环境。

Aran Nayebi 在 Carnegie Mellon 的研究将动物学习视为工程目标的来源。他的团队考察生物智能体如何探索并调整行为,而不依赖每一步都经过精心设定的目标。

这一方向之所以重要,是因为高基准测试表现可能掩盖脆弱性。一个计算机视觉系统或许能准确分类熟悉图像,却可能在纹理、光照或视角发生细微变化后失效。

生物视觉兼具速度与灵活性。它利用情境、既有经验、运动和不确定性。NeuroAI 研究人员希望识别这些特性中哪些源自具体计算过程,而非停留在笼统类比。

Pitkow 与 MICrONS 的研究提供了一个例子。他的分析发现,一些神经元似乎既对一致的视觉模式敏感,也会对周围场景作出反应。

这类神经元可能有助于表征物体边界,同时不忽略情境。这种平衡与在杂乱或陌生环境中运行的人工系统相关。

研究人员还观察到,神经元对简单人工图像和自然化场景的反应不同。图像的自然程度改变了神经选择性和对情境的依赖性。

这一结果提醒人们,不应假定受控刺激能够揭示现实世界视觉的一切。它也表明,AI 评估应包含多样化环境,而非单一精心策划的基准。

紧凑型脑模型提供了另一条可能的工程路径。如果一个小型、可解释的模型保留了更大网络的有用行为,开发者便可研究哪些计算过程是关键。

这一过程类似机器学习中的知识蒸馏,即较小系统从较大系统中学习有用行为。神经科学加入了另一项目标:蒸馏后的表征应能生成关于生物处理过程的假设。

这些假设最终或许会影响机器人、适应性界面、感觉假体或高效感知系统。然而,生物相似性不应自动成为产品宣传主张。

一个系统可以在不类似大脑的情况下依然有效。反过来,一个模型也可能复现某一项神经测量,却并不会因此变得更安全、更可靠或更智能。

因此,开发者应追问生物约束究竟带来了什么。它是否提升了样本效率、适应能力、能源利用、不确定性处理能力,或对分布偏移的抵抗力?

同样的严谨性也适用于通过 Google News 跟踪这项工作的人。一个有用的研究工作流应保留原始论文、机构背景、相互竞争的解读以及尚未解决的问题。

个人知识库 可帮助研究人员长期关联这些材料。目标不是收集更多标题,而是保留将主张与后续结果进行比较所需的证据。

当 NeuroAI 的原理经受住实验室之外的检验时,它才会对产品构建者具有重要意义。在此之前,它仍是富有成效的假设来源,而非通往通用智能的现成蓝图。

Google News 周期之后值得关注的三个信号

下一阶段应通过具有区分力的实验、跨受试者验证以及更自然行为环境中的结果来评判。

第一个信号是,研究人员是否会发布专门设计来让领先模型产生分歧的测试。平均预测得分很有用,但它们很少能够揭示两个系统是否使用相同机制。

存在争议性的刺激提供了更尖锐的检验。如果 Carnegie Mellon 的模型能够预测人类对模糊图像或对抗性图像的反应,其生物学解释将更具说服力。

失败同样具有信息价值。如果每个候选模型都错误预测了相同反应,研究人员便获得了重要计算过程缺失的证据。

第二个信号是跨个体、数据集和实验室的泛化能力。一个模型应能预测超出其开发过程中所用参与者和扫描条件之外的测量结果。

独立复现可降低结果依赖特定预处理流程或图像集合的可能性。它也会揭示每位新参与者需要多少校准。

对于临床研究而言,这一信号变得至关重要。个性化设备需要针对个人进行适配,但也需要能跨用户迁移的可靠基础。

第三个信号是从孤立图像向序列和主动行为的进展。Carnegie Mellon 的研究人员已将视频和时间依赖性知觉视为重要的下一步。

视频迫使模型跟踪运动、变化的情境和时间连续性。主动任务则加入了决策、眼球运动和后果。

SCENE 对生态环境的关注提供了这一测试的长期版本。模型最终必须解释感知如何在不确定性下引导行动,而不仅仅是静止大脑如何对选定图片作出反应。

这些信号应塑造读者解读下一条 Google News 标题的方式。更高的预测得分会增强其工程层面的论据,但除非测试能够区分相互竞争的机制,否则并不能解决科学问题。

当前工作之所以重要,是因为它为神经科学提供了能够以精确方式失败的模型。这比“AI 已解码视觉”的宽泛说法更有价值。

Carnegie Mellon 围绕一项可信的 NeuroAI 计划汇集了研究人员、数据集和合作项目。Henderson 的人类成像研究将图像与预测的皮层反应联系起来。MICrONS 将活动与微观连接结构相联系,而 SCENE 则推动研究走向自然环境中的行为。

该计划最强的前景在于方法论。AI 能够足够迅速地提出计算解释,供神经科学家检验、否定、压缩并完善。

其最大风险在于解释上的夸大。预测可能被误认为解释,生物相似性也可能被误认为智能。

读者应关注那些揭示这些差距的实验。留意能让模型产生分歧的图像、可在人群之间迁移的结果,以及经受住真实世界运动考验的预测。

这些测试将决定 Carnegie Mellon 找到的是更好的视觉模型,还是仅仅更贴合当前测量结果的模型。什么样的结果会让你相信下一项 NeuroAI 主张?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page