top of page

AI 能否成为研究人类学习的模式生物?

Benjamin Riley 于 8 月 4 日在 Google News 上提出了一个颇具挑衅性的观点:人工智能或许能成为研究人类学习的模式生物。这一表述标志着 AI 讨论的真正转变。研究者不再只是追问机器是否像人一样思考,而可以探究受控的机器能否揭示有价值的学习机制。

这一区别至关重要。模式生物之所以有价值,是因为研究者能够操控它、重复实验,并在受控条件下观察变化。它并不需要复现科学家最终关注的系统的每一项特征。

AI 模型以异乎寻常的速度提供了这些实验优势。研究者无需等待生物发育,就能调整训练数据、架构、目标与学习进程,随后再将模型行为与人类实验结果进行比较。

当有用的实验类比演变为等同性主张时,冲突便出现了。人工神经网络可以复现人类的某种反应模式,却未必共享产生这一模式的生物过程。仅凭相似的输出,无法证明存在相似的心智。

因此,Riley 的论点介于两种对立立场之间。一方认为,由于机器与人类存在根本差异,AI 行为与认知科学无关;另一方则将日益接近人类的表现视为机器与人类通过相近机制学习的证据。

更有力的立场比任何一种极端观点都更为审慎。AI 可以作为可控的模型系统,用于检验学习理论。然而,每一项结果都需要在人类、生命科学证据以及模型训练分布之外的条件下得到验证。

这使其不只是哲学争论。它会影响研究者如何设计实验、教育工作者如何解读 AI 研究,以及产品团队如何描述那些看似会学习的系统。

Google News 文章究竟改变了什么

Riley 的核心转向在于方法论:将 AI 作为实验对象研究,而非视作合成人类。

这则 Google News 条目 引导读者关注的是一项正在发展的研究计划,而非某个新商业产品。其基本主张是,人工模型可以帮助科学家研究学习如何产生。

这一主张改变了惯常的比较方向。许多 AI 研究从人类能力出发,探讨工程师如何在软件中复现它。模式生物方法则反转了这一流程,利用软件实验为人类学习生成假设。

生物学家长期依赖能够清晰揭示特定机制的生物体。被选中的生物体并不被视为缩小版的人类;它的价值来自可操作性、可重复性,以及与目标现象之间已知的关联。

AI 系统提供了这种优势的计算版本。研究者可以在不同条件下训练多个模型,保存每个版本,并在实验后检查各个模型。他们也能隔离在人类发展过程中始终纠缠在一起的变量。

以学习顺序为例。研究者可以让一个模型接触结构化课程,让另一个模型接触随机混合的例子。如果二者之后的行为不同,这项实验便能识别经验与泛化之间一种可能的关系。

对儿童进行同样的操控会很困难。研究者无法抹去既有知识、重建童年,或从零开始分配多年的经验。伦理限制也排除了许多软件实验所允许的干预。

但人工系统并不能提供完整答案。它只是在特定条件下,对某项假定机制是否足够有效进行受控检验。人类研究仍须判定该机制是否也在人身上发挥作用。

这是第一条重要边界。模型在特定训练序列后形成某种行为,表明该序列能够产生这种行为;但这并不表明人脑采用相同的序列或表征。

Riley 的框架之所以有价值,是因为它支持更小、更可检验的问题。例如,反复接触相关任务后,灵活推理是否会出现?忘记具体例子是否会改善泛化?课程结构会如何影响后续适应?

这些问题比追问语言模型是否真正理解更有成效。它们用具有明确输入、可观察行为和可证伪预测的实验,替代了一个不稳定的标签。

这一观点也出现在一个恰当的时点。认知科学家已经使用神经网络建模记忆、语言、决策与感知。变化之处在于,可用系统的规模和行为覆盖范围正在扩大。

如今,一个语言模型可以完成许多过去需要不同实验模型处理的任务。这种广度带来了更多比较机会,但也增加了从流畅输出中解读出人类特质的风险。

因此,这篇文章真正的贡献是一条解释规则:将 AI 行为视为能够完善理论的证据,而非关于人类心智的直接证据。

为什么 AI 模型如今看起来像有用的模式生物

现代 AI 为认知科学家提供了一种实验环境,能够以罕见的精确度控制学习历史。

Max Planck Institute for Software Systems 的 Mariya Toneva 最近提出了密切相关的观点。她认为,研究者应将模型视作可以扰动和演化的系统,而不是已经完成的大脑复制品。

她的模式生物提案聚焦于让模型内部表征与在人脑中观察到的计算过程对齐。目标不只是获得更好的预测,而是构建一个支持干预与比较的系统。

这一区别将预测模型与解释模型区分开来。预测模型估计接下来会发生什么;解释模型则让研究者改变一个疑似机制,并检验预期结果是否随之出现。

人工神经网络尤其适合这一过程。研究人员可以移除组件、改变目标、调整数据顺序,或重新训练完全相同的架构,然后测量究竟哪项干预改变了观察到的行为。

这种控制对于研究学习尤为有用。人类学习者带着多年未被记录的经验、个人动机、社会关系和生物学差异进入每项实验。即使研究者进行了谨慎设计,这些因素也会影响结果。

AI 模型也有自身隐藏的复杂性,包括未被记录的数据和优化选择。然而,研究者可以构建训练历史完全已知的较小系统。这类模型往往能提供比商业聊天机器人更清晰的实验。

Brown University 的近期研究展示了这一方法。研究者考察了灵活的上下文学习与较慢的渐进式学习之间的关系。上下文学习指的是根据当前任务中呈现的例子进行适应,而不改变模型已存储的参数。

团队让一个模型在 12,000 个相关任务中训练。在获得这些经验后,它能够组合此前不熟悉的配对,例如已知的颜色与已知的动物。结果表明,快速灵活性可以从更长期的渐进式学习历史中涌现。

Brown 的学习研究还复现了与人类认知相关的一种权衡。困难任务促进了更强的保留,而较容易取得成功的基于上下文的学习则支持灵活性,却不会带来同样的长期更新。

这一发现并不能证明大脑与模型共享同一种实现方式。它表明,计算系统能够在受控训练下产生彼此关联的行为模式。研究者可以利用这一结果设计更精确的人类实验。

这种方法形成了一个富有成效的循环。人类行为启发模型,模型揭示可能的机制,新的行为实验再检验模型的预测。任何一方都不只是另一方的点缀。

这一循环也让失败具有信息价值。如果一个模型在某项任务上与人类一致,却在轻微变化后出现偏离,这种不匹配便揭示了某些缺失因素。这些因素可能涉及记忆、具身性、先验知识、动机或社会互动。

AI 的速度放大了这一益处。研究者可以在招募参与者开展成本更高的人类研究之前,运行许多受控变体。因此,模型能够帮助缩小合理假设的范围。

但速度也可能造成误导。大量计算实验并不能弥补与人类行为对应关系的薄弱。规模提升的是探索能力,而非有效性。

最好的模式生物总是为明确目的而选择。果蝇能够阐明特定的遗传机制,却无法解释人类生活的每一项特征。AI 模型也应接受同样的标准。

研究者必须说明模型代表什么属性、哪种干预具有关键意义,以及哪些人类证据会挑战这种类比。没有这些承诺,“模式生物”就会沦为又一个讨喜的隐喻。

核心冲突在于模式生物与人类替代物之争

当研究者不再要求 AI 与人类等同,而是明确他们正在检验哪种学习机制时,AI 才会具备科学价值。

模式生物与人类替代物承担着不同角色。替代物代替人类,并应能在相关条件下预测人类反应;模式生物则隔离机制,而不宣称具有如此广泛的可互换性。

混淆这两种角色造成了本文的核心张力。一个系统可以模仿人类的错误模式,却依赖于没有任何人会采用的捷径;它也可能因实验给予了错误的经验而无法完成一项人类任务。

第一种错误会导致拟人化。研究者看到类人的输出,便推断存在类人的内部过程。第二种错误则导致简单否定,因为任何差异都被当作人工系统无法帮助理解认知的证据。

这两种结论都下得过快。行为相似性只是研究的起点;当它揭示训练历史、架构或具身性如何改变学习时,行为差异同样具有价值。

一项 2023 年发表在 Nature 的研究展示了机遇与边界。Brenden Lake 和 Marco Baroni 在组合性学习任务中比较了人类与七种计算方法。组合性是指将已知部分组合成新的结构化表达的能力。

他们的方法称为组合性元学习,在不断变化的任务中训练一个标准神经网络。该模型学会推断新词含义,并依据不熟悉的规则将它们组合起来。

这项组合性学习结果显示,经过训练的网络同时捕捉到了人类的系统性和部分人类偏差。竞争方法往往要么更僵化,要么缺乏足够的系统性。

这为神经网络的实验价值提供了有力证据。研究人员并非只拟合平均准确率,而是比较了人类与机器在行为和错误模式上的差异。

其局限性同样重要。该模型未能通过一些涉及更长序列和更复杂结构的测试,也难以处理超出元训练任务分布范围的案例。

这些失败界定了模型的解释范围。该实验支持这样一种主张:特定训练条件能够产生组合性行为。它并未建立关于人类语言学习的普遍解释。

将其解读为人类替身会忽视这一差别。人们可能会因为网络与人类都能完成某些选定任务,就声称该网络像人一样学习语言。将模型视为模型生物体的解读则会追问:是什么机制产生了这种匹配,以及它在哪些地方失效。

这一差别具有实际影响。教育公司可能援引类人 AI 学习来为自动化辅导或评估辩护。产品团队也可能误以为,聊天机器人的流畅解释反映了稳定的理解能力。

这些结论需要认知建模之外的证据。一个经训练以复现实验反应的模型,并不会因此自动在课堂、工作场所或临床环境中可靠。

同样的谨慎也适用于消费者交互。人们常将连贯的对话理解为一个不断适应自己的持续学习者。大多数已部署的语言模型实际上使用的是临时上下文、存储的账户特征或外部记忆系统。

这些机制可以制造连续性,却不同于人们所经历的开放式学习。设计良好的 AI knowledge base 能够保留有用的上下文,但存储并不等同于生物记忆的形成。

当 Riley 的模型生物体理念能够防止这类类别错误时,它便发挥了作用。该系统不是学生、教师或人,而是一个可操控的计算对象,其行为可用于检验有限的假设。

AI 实验已揭示的人类学习规律

最有力的结果并不能证明 AI 像人类一样学习;它们揭示的是,哪些条件足以产生某些选定的类人行为。

一项颇具启发性的研究路线考察了有限经验能否支持早期词汇学习。纽约大学研究人员利用从一名儿童视角拍摄的视频及其转录语音,训练了一个多模态神经网络。

该数据集涵盖了儿童在六个月至25个月大期间录制的61小时内容。研究人员将视觉画面与儿童周围听到的语言配对,随后测试模型能否将词语与物体联系起来。

该系统学习了若干词语—物体映射,并将部分词语泛化到新图像中。这项 儿童学习实验 表明,从相对有限且自然的数据中进行联想学习,能够支持早期词汇习得的一部分。

这项实验之所以重要,是因为它检验了一场长期存在的争论。一些理论认为,与语言相关的先天知识发挥关键作用;另一些理论则强调从儿童环境中进行统计学习。

一个并不具备完整人类语言系统的神经网络,从记录的经验中获得了选定的关联。这一结果表明,简单的跨模态联想足以解释所观察到行为中的一部分。

但这并不表明儿童只依靠联想。录像本身已反映了儿童的主动选择和照料者的回应。模型接收到的是由具身且具有社会性的学习者所产生的一条经筛选的轨迹。

这一局限说明了为何将模型视为模型生物体的框架具有价值。该系统隔离出一种潜在机制,同时也让缺失的要素更容易被看见。

研究人员如今可以改变这些要素。他们可以移除时间顺序、减少照料者语言、改变视觉连续性,或比较不同儿童的经历。每一种干预都能为后续的人类研究产生可检验的预测。

Brown 的实验提出了另一种候选机制。从当前示例中快速学习,可能依赖于一段更缓慢的学习历程;这段历程培养了识别任务结构的能力。

这一原则在教育中并不陌生。经验丰富的音乐家比初学者更快看出陌生乐曲中的模式。表面上的速度建立在累积的结构之上,而非没有先前学习。

AI 实验使这种关系可以被衡量。研究人员可以保持架构不变,改变学习历史,并观察灵活行为何时出现。随后,人类研究可以检验专业能力是否会带来可比的转变。

Nature 的组合性研究带来了第三项发现。系统性行为未必完全来自人工编码的符号规则。当训练奖励恰当形式的泛化时,神经网络能够获得一定程度的系统性。

同样,审慎的主张关乎充分性。某种训练程序在某个明确系统中产生了某种明确行为。该结果缩小了理论争论的范围,却未解决人脑如何实现组合性思维的问题。

这些研究共同支持 Riley 的提议。人工模型可以检验某种学习机制是否会生成研究人员在人类身上观察到的模式。它们也说明了为何广泛的主张仍缺乏依据。

每一项成功实验都包含一条隐含边界。模型接触的是选定数据、优化的是选定目标、面对的是选定评估;而人类学习则持续跨越不断变化的目标、环境和社会关系。

其价值在于让这些选择变得明确。研究人员可以追问,当条件变化时,结果中的哪一部分依然成立。脆弱的匹配表明理论捕捉到的只是表层模式;持久的匹配则支持更深入的研究。

这也是 AI 能够提升认知科学标准的地方。模型构建者必须把口头理论转化为足够精确、能够运行的程序。当无人能够实现某种模糊解释时,其含混性便会暴露出来。

然而,形式上的精确并不等于生物学真相。一个清晰的计算理论仍可能遗漏最重要的过程。模型能够磨砺假设,而人类研究与神经科学证据决定这些假设是否真正描述了人。

AI 学习类比失效之处

当前 AI 缺少若干组织人类学习的特征,包括自主目标、物理行动,以及对后果的持续适应。

最大的风险并非这种类比毫无启发,而是局部成功被误当作完整解释。

人类并非被动吸收固定数据集。他们会移动、选择、关注、提问、犯错,并改变环境。他们的学习与身体需求、情绪反应、社会线索和后果相连。

大多数语言模型在工程化训练过程中获得其核心能力。团队收集并筛选数据、定义目标、借助反馈调优系统,并决定何时停止训练。部署后的模型通常无法自由地重构自身学习过程。

Emmanuel Dupoux、Yann LeCun 和 Jitendra Malik 在2026年的一篇论文中明确指出了这一局限。作者认为,当前系统并不像动物那样以广泛的方式自主学习。

他们的 自主学习框架 区分了从观察中学习与通过主动行为学习。它加入一个元控制系统,用于决定学习者应在何时及如何在两者之间切换。

这一提议突出了标准模型比较遗漏的内容。人类学习不仅是一种更新表征的方法,还包括对注意力、探索、记忆和行动的控制。

一个不理解某个词的儿童可以望向说话者、指向物体、重复声音,或试探某件物体。这些行动会改变儿童接下来获得的信息。

一个在儿童录像上训练的模型会接收这一循环的结果,却不会生成这个循环。它受益于儿童和照料者创造的结构。这使模型具有参考价值,但并不意味着二者等同。

目标构成了另一道鸿沟。机器学习系统优化的是由设计者选定的数学损失函数。人类学习者追求的则是受好奇心、身份认同、关系、不适感与未来计划影响的动态目标。

研究人员可以用奖励或训练计划近似模拟其中的部分力量。但这种近似本身必须成为假设的一部分。否则,工程化目标可能会悄然预先决定实验声称要解释的行为。

规模带来了进一步的复杂性。大型商业模型已吸收大量数据,而这些数据与各项基准之间的重叠情况并不确定。它们表面上的灵活性可能源于记忆模式、广泛的先前训练,或真正的任务推断。

这种不确定性削弱了它们作为模型生物体的价值。与训练过程有据可查的小型研究模型相比,一个完整发展历史难以获取的系统更难解释。

商业优化带来了额外压力。当用户将产品描述为学习者、协作者或推理伙伴时,公司会从中受益。这类语言使界面更直观,却可能模糊功能性行为与认知解释之间的界线。

Google News 的分发机制可能会放大这种影响,将评论文章、研究报告和产品主张置于同一信息流中。读者可能先接触到一个引人入胜的隐喻,之后才看到其背后的实验限定。

因此,研究人员需要对抗性测试。模型应面对措辞变化、不熟悉的任务结构、相互冲突的证据,以及超出其训练设计范围的环境。在可能的情况下,人类参与者也应面对相应条件。

内部分析同样重要。两个系统可能通过不同的表征得出同一答案。当对内部机制的干预能够预测两个系统中的变化时,行为一致性便成为更有力的证据。

即便如此,仍有必要保持克制。某一计算层面的相似性,并不意味着共享意识、理解或体验。这些是更广泛的主张,需要不同的证据。

审慎的结论并非 AI 无法为人类学习提供信息,而是这种类比必须一次通过一个机制来赢得可信度。

三个信号将表明该隐喻能否成为一种方法

下一阶段需要预注册的预测、受控的学习历史,以及在人工学习者和人类学习者中均成功的测试。

第一个信号,是一项利用 AI 结果预测人类此前未知模式的研究。研究人员应在收集验证数据之前,明确预期的人类行为。

这将强化模型生物体的主张,因为预测比事后匹配更难。模型往往可以被不断调整,直至看起来类似现有数据集;预测新结果则会让理论面临失败的可能。

Brown 的工作为这类测试创造了机会。如果扩展后的模型实验能够预测课程顺序何时会改变人类的灵活性,研究人员就可以设计相应的行为研究。成功的预测将把人工机制与人类证据联系起来。

第二个信号,是跨越不同架构和学习历史的复现。在某个专用网络中发现的结果,可能反映了偶然的实现选择,而非普遍原则。

研究人员应测试,相同关系是否会在 transformers、循环系统和更简单的网络中出现。他们还应改变数据规模、课程顺序和优化目标。

如果这些变化后结果依然存在,模型生物体的论点就会更有力。如果结果消失,解释就必须收窄到原始系统。无论哪种结果,都会推动科学进步。

第三个信号是在机制层面进行干预。研究人员需要识别出能够产生行为效应的组件,改变该组件,并预测由此带来的变化。

Toneva 的提议正朝着这个方向推进,强调科学家能够施加扰动的系统。仅仅将模型活动与大脑活动建立相关性,只能提供一张地图。干预则可以检验被映射的特征是否发挥了因果作用。

一个可信的研究计划应当连接三个阶段。对模型内部进行干预会改变人工行为。计算层面的解释预测人类会呈现某种模式。随后,通过行为学或神经科学实验来检验这一预测。

这一标准也能保护读者免受夸大表述的误导。一个表达流畅的聊天机器人在某项基准测试中成功,并不满足这一标准。模型激活与脑部扫描结果在视觉上相似,同样不满足。

对开发者而言,这项研究将厘清上下文适应能够提供什么、不能提供什么。系统或许会更擅长利用临时示例,但并不因此获得持久、自主的学习能力。

企业采购方应密切关注有关个性化的说法。一个产品可以检索已存储的信息、调整提示词,并表现得仿佛熟悉某位用户。但这些功能并不必然意味着底层模型正在持续学习。

知识工作者也面临类似的判断。AI 可以帮助比较来源、提出假设,并揭示论证中的缺口。它不应成为判断其自身解释是否准确的唯一裁决者。

Riley 的想法值得关注,因为它用一项研究计划取代了地位之争。重要的问题并不是 AI 是否应被归入人类智能这一类别。

更有价值的问题是,受控的人工系统能否揭示某些机制,从而对人类学习产生可检验的预测。一些近期实验表明,它们或许能够做到这一点。

验证缺口依然很大。人类行为源于身体、社会关系、主动探索,以及漫长的发展历程。当前模型只复现了这一过程中的部分要素。

未来当 Google News 报道类人 AI 学习的相关主张时,读者应关注三个细节:明确界定的机制、超出训练条件的测试,以及直接的人类验证。

缺少这些要素,“模型生物体”仍只是一种颇具吸引力的隐喻。有了它们,它便成为一种严谨的方法,可将 AI 与人类之间的差异转化为科学证据。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page