top of page

Alexander Rakhlin 出任 MIT 统计与数据科学中心主任

8月12日
讀畢需時 16 分鐘

MIT 任命 Alexander Rakhlin 为统计与数据科学中心主任后,他登上了 google news,但这项任命背后存在更深层的矛盾。AI 系统的进步速度,已超过研究人员解释其行为、衡量其可靠性,以及判断其表面能力能否超越基准测试而迁移的速度。

Rakhlin 的研究背景使这一问题成为其新职位的核心。他的工作连接了机器学习、统计学、优化、在线预测和强化学习。这些领域探究系统如何从证据中学习,尤其是在信息按序到来或取决于先前决策时。

这项任命并非产品发布,也没有推出新模型。相反,在 AI 评估问题日益棘手之际,它让一位学习理论研究者领导一个覆盖全 MIT 的中心。其中的张力在于:经验性进展迅猛,而能够让这些进展变得可靠的数学解释,构建速度却较为缓慢。

这一差异很重要,因为统计研究中心如今正与围绕算力、数据和快速实验建立的大型 AI 实验室争夺关注。MIT 的选择表明,面对能力不断增强、成本高昂且难以评估的模型,理论仍将是该校机构层面回应的重要组成部分。

Rakhlin 的任命为 MIT 带来了什么变化

MIT 已让一位专注于学习基础研究的学者,领导一个旨在连接全校统计学研究的中心。

MIT 统计与数据科学中心,即 SDSC,是连接各院系研究与教育的枢纽。MIT 表示,该中心于 2015 年设立,旨在整合并正式确立统计学和数据科学领域的工作。

这一架构很关键。MIT 的统计学并不归属于一个传统的单一统计系。SDSC 则连接数学、经济学、计算机科学、工程、管理学、政治学以及脑与认知科学领域的研究人员。

Rakhlin 已深度融入这一跨学科模式。他的 MIT 研究主页列出了他与 SDSC、数据、系统与社会研究所、脑与认知科学系,以及信息与决策系统实验室的关联。

他的团队研究学习如何发生,以及算法如何表现。其当前关注方向包括强化学习、序列决策、神经网络、过参数化模型、扩散模型和大语言模型。

这些主题让 Rakhlin 接近多个尚未解决的 AI 问题。研究人员仍在讨论,为何超大型神经网络具有良好的泛化能力,交互式系统需要多少证据,以及模型的表现能否在条件变化后依然维持。

因此,这项任命改变的不只是领导页面上的姓名。它赋予 Rakhlin 协调一个横跨理论、应用和教育的学术共同体的责任。

该中心的教育职能又增加了一个维度。SDSC 支持本科辅修项目和跨学科博士培养路径,使参与院系的学生能够接受正式的统计学训练。

Rakhlin 在这项使命上拥有直接经验。2019 年,SDSC 表彰了他协助领导跨学科博士项目、并开发一门数理统计课程的工作。该中心称,这门课程首次试行时共有 78 名学生选课。

他的学术经历也横跨了如今需要协调的多个学术社群。Rakhlin 于 2000 年在 Cornell University 获得计算机科学和数学学士学位。他于 2006 年在计算学习研究者 Tomaso Poggio 的指导下完成 MIT 博士学位。

在 University of California, Berkeley 完成博士后研究后,Rakhlin 加入 University of Pennsylvania。之后,他回到 MIT,先担任访问教授,随后成为终身教职成员。

这段经历使这项任命成为一则内部延续的故事,而非一位外部高管携新组织手册上任。Rakhlin 已在该中心授课、主持跨学科教育、指导研究人员,并在 MIT 各单位之间开展工作。

眼下的变化是领导层更替。战略问题则是,Rakhlin 将如何在这一异常广泛的职责范围内确定优先事项。

为什么这项领导层变动在当下如此重要

AI 的核心研究问题正从让模型运行,转向解释何时可以信任其行为。

机器学习的发展常常奖励规模化。更大的训练集、更多算力、更广泛的模型和快速实验,催生了能够完成一度被视为遥远目标的任务的系统。

这些进步并未消除统计学问题,反而让其中许多问题更加紧迫。

一个模型可能取得很高的平均分,却在特定人群、环境或异常输入上失效。它可能高度拟合训练数据,却在用户改变任务时表现得难以预测。智能体还可能影响自己接收到的信息,使有关独立数据的传统假设不再那么现实。

Rakhlin 的研究从基础层面触及这些断层。在线学习研究的是信息以序列方式到来时的预测。不同于固定数据集,每一条新观测都可能来自变化的环境,或由先前行动所引发。

强化学习带来了额外难题。系统选择行动、接收有限反馈,并通过这些选择改变未来将观察到的信息。评估必须考虑探索、不确定性和犯错成本。

这些已不再是孤立的学术场景。推荐系统从用户反馈中学习,而此前的推荐本身也参与塑造了这些反馈。AI 智能体在软件环境中采取行动,再解读由此产生的状态。部署在组织内部的模型则面对新文档、变化的政策,以及受其自身输出影响的反馈。

MIT 研究人员此前曾记录,汇总式评估如何掩盖失败。一项 2026 年的模型评估研究发现,在新的环境中,平均表现最好的模型可能会成为部分数据上的最差模型。

这一结果说明了 SDSC 面临的更广泛问题。提升一个醒目的指标,并不必然说明谁会受益、系统会在哪里失效,或结果在部署后是否仍能持续。

公众或许会先通过 google news 了解到这项任命,但其实际意义在于这一评估缺口。AI 用户日益需要能够区分可重复能力与仅限于特定基准表现的方法。

统计学提供了描述不确定性、选择模型、设计实验,以及判断现有证据能够支持何种结论的工具。现代 AI 让这一过程的每一个环节都变得更加复杂。

训练数据可能是专有的,或记录并不完整。模型可能包含数十亿个相互作用的参数。评估提示词可能泄漏进训练语料。人类判断也可能因标注者、文化和语境而异。

由此产生了可见表现与科学理解之间的不匹配。开发者可以观察到系统能回答问题、编写代码或控制界面,却不知道它面对下一种任务分布时会有多可靠。

一个统计与数据科学中心无法独自解决这种不匹配。不过,它可以连接研究其不同组成部分的人。

理论研究人员可以界定学习的边界。应用研究人员可以识别医学、政策、科学或商业中的失效。领域专家可以质疑不恰当的假设。教育工作者可以训练学生识别何时看似精致的输出建立在薄弱证据之上。

Rakhlin 本人的研究组合跨越这些边界。他关于统计学习的研究考察基于独立数据训练的系统,而其在线学习研究处理变化的序列。他的决策研究则关注数据收集依赖行动的交互式环境。

与对静态预测的狭窄关注相比,这种组合更契合 AI 的当前阶段。AI 产品正转向能够规划、调用工具、修正决策,并在更长时间内运行的系统。

每增加一次行动,错误累积的方式就更多。这也使评估成本更高,因为研究人员必须衡量一条轨迹,而非单个答案。

MIT 的领导层选择并未确立新的行业标准。但它显示了该校正将哪些智识问题置于统计学共同体的核心位置附近。

google news 抓住了标题,却没有呈现制度层面的角力

这项任命凸显了以规模优先的 AI 开发与要求解释、保证和审慎测量的研究之间的角力。

这并非大学与科技公司之间的简单竞争。MIT 研究人员与产业界合作,企业实验室也产出大量理论研究成果。

分歧关乎激励机制和时间跨度。产品团队通常需要在一个发布周期内取得可衡量的改进。学术中心则可以投入更长时间,探究某项指标是否衡量了正确的属性,或一项结果能否在更弱的假设下成立。

大型模型开发者还拥有多数大学难以匹敌的资源。前沿训练需要专用芯片、工程团队、大规模数据集以及成本高昂的评估基础设施。

大学保有不同的优势。它们可以研究答案不会立即支持某一产品的问题;可以发表负面结果、挑战评估惯例,并将技术性能与社会后果联系起来。

SDSC 的跨校架构正是为这种协调而设计。其中心使命描述了覆盖全 MIT 的研究与学术项目职能,而非聚焦于单一应用领域。

该中心的历史也支持这一解读。在 2017 年首届年度会议上,研究人员讨论了涉及基因编辑、气候、经济学、推荐系统和公共政策的应用。

时任主任 Devavrat Shah 将 SDSC 描述为全校相关工作的共同框架。他还认为,计算应与经典统计学一道成为基础性关注点。

这一早期定位预示了当前的挑战。现代统计学无法忽视生成预测的计算系统。机器学习也无法忽视其证据背后的统计假设。

Rakhlin 如今接手这一问题时,这些领域已变得更难分割。他对过参数化模型的研究,涉及可调参数数量超过传统直觉建议范围的系统。

这类模型可以几乎完美地拟合训练数据,同时仍在新样本上表现良好。这种行为有时被称为良性过拟合,即插值并不会自动破坏泛化能力。

这一术语并不意味着过拟合已不再危险。它描述的是特定条件:在这些条件下,模型可以紧密拟合已观测数据,而不会承受预期的测试性能损失。

理解这些条件至关重要,因为深度学习常常违背较早期统计分析所采用的简化模型。研究人员需要能够解释优化方法、数据结构、模型架构与规模的分析框架。

Rakhlin 曾合著一篇关于深度学习的统计学视角,探讨了优化与泛化中的一些难题。这项工作说明了,尽管目标函数非凸、模型参数高度冗余,简单的梯度方法为何仍能找到有用的解。

这类分析与宣布更高的基准分数服务于不同目的。它试图解释哪些机制使该分数成为可能,以及解释在哪些方面仍不完整。

这种差异也会影响教育。进入 AI 岗位的学生需要实用技能,但也需要质疑数据集、假设和评估结论的能力。

只关注当前工具的课程体系可能很快过时。完全围绕经典理论构建的课程体系,则可能错过当代系统的实际行为。

SDSC 必须兼顾两者。它既要支持数学基础,也要让这些基础始终与不断变化的计算实践相连。

Rakhlin 的任命为这种平衡提供了一个明确的研究方向。他的工作属于理论研究,却持续聚焦于当前机器学习中可观察到的机制。

这并不意味着 MIT 正在背离应用或实证研究。它意味着,该中心的领导层可以将统计解释视为这些活动的基础设施。

最理想的结果将是形成更紧密的反馈循环。真实部署会暴露理论的薄弱环节,而理论发现将改进实验、基准测试和系统设计。

较弱的结果则可能只是组织层面的象征意义。一位受人尊敬的研究者可以担任主任,却没有获得改变跨院系工作方式所需的资源、激励或协调能力。

这种智识契合度与实际职权之间的落差,是此次任命面临的首个重大不确定性。

最棘手的问题是将理论转化为共同实践

Rakhlin 的资历契合当下,但其领导成效将取决于项目、激励机制与可衡量的协作。

学术中心很少能控制与其使命相关的全部教师、资金、课程或实验室。它们负责协调那些主要归属仍在其他机构单元的人。

这种设计有助于跨学科工作,但也可能使执行变得困难。教师向院系负责。学生遵循不同的学位要求。研究团队则追求由不同学术共同体塑造的经费与发表目标。

中心主任必须为这些群体创造共同工作的理由。研讨会和会议有所帮助,但持久的协调通常需要共享项目、资金、任命或研究基础设施。

SDSC 已经拥有跨院系的教育机制。其跨学科博士项目允许学生将统计学与脑与认知科学等领域结合。

Rakhlin 早先在这些项目中的角色为他提供了相关经验。在获得主任职位之前,他曾帮助建立统计教育与参与院系之间的联系。

不过,下一阶段面临更广泛的挑战。如今,AI 吸引了 MIT 几乎所有技术和社会学科的研究人员。

一套共享的统计学课程体系必须服务于从事神经数据、语言模型、经济学、机器人、气候系统和公共政策研究的学生。这些领域使用的数据、面对的风险和证据标准并不相同。

该中心必须避免将跨学科性简化为一套通用 AI 课程。同时,它也必须防止专业项目成为彼此脱节的孤岛。

Rakhlin 的研究提出了一种可能的桥梁:不确定性下的决策。这一主题适用于科学实验、自适应系统、公共政策和 AI 智能体,同时并不假定这些应用彼此相同。

序贯决策也会暴露静态分析可能掩盖的假设。研究人员必须明确数据如何到来、可获得何种反馈、哪些行动会影响未来观测,以及错误如何累积。

这些问题为不同应用建立了共同语言,但并不会带来轻易的通用答案。

此次任命也正值理论保证与实际模型行为之间关系备受讨论之际。定理可以在既定假设下提供清晰认识,但这些假设未必适用于已部署的系统。

反过来,一项成功实验可以证明某个场景中的表现,却无法解释它为何奏效。它对下一个环境可能几乎没有指导意义。

将任一方法视为充分条件,都会削弱该中心。真正有价值的工作在于设计检验理论的实验,以及反映真实系统的理论。

Rakhlin 的团队明确表示,其目标是在监督学习与决策之间搭建桥梁。监督学习将样本映射为输出,而决策则考虑会影响后续信息与回报的行动。

这座桥梁与 AI 智能体直接相关。一个编写代码、浏览网站或管理工作流的智能体,不只是预测文本。它会改变环境,并必须对后果作出反应。

因此,可靠的评估需要考察任务成功、错误恢复、不确定性处理和长周期行为。单一的答案质量分数无法涵盖整个系统。

同样的问题也出现在工作场所的知识任务中。助手可能检索到正确文档,却将其与过时笔记结合。它可能生成看似合理的综合内容,却丢失审查所需的来源脉络。

为应对这一问题,组织日益需要可检索的证据、清晰的来源链路以及能够保留上下文的系统。结构化的 AI 知识库可以支持这一过程,尽管它无法替代统计验证。

值得怀疑的问题是,SDSC 能否将基础研究转化为其他共同体会采用的方法。仅靠发表论文,并不能保证医学研究人员、政策分析师或 AI 工程师会改变其评估实践。

采用需要易用的软件、共享数据集、可复现实验和培训。它也需要激励机制,使人们报告失败,而不只是积极结果。

仅从新闻标题来看,Rakhlin 尚未公开提供详细的运营议程。因此,读者应将其研究的契合度与对未来项目的假设区分开来。

这项任命支持了一个合理的发展方向,但并未确认哪些举措将获得资金、人员或优先支持。

当人事公告通过 google news 传播时,这一区别尤其重要。聚合标题将机构选择压缩为一个姓名和职位,而真正关键的工作则会在之后的预算、课程、资助和合作中显现。

Rakhlin 的研究对 AI 评估释放了什么信号

最具影响力的信号,是转向将学习系统评估为自适应过程,而非孤立的输出。

许多常见基准向模型提供固定问题,并对所得答案评分。这种形式很有用,因为它允许跨系统比较。

但它只捕捉了部署场景中狭窄的一部分。真实用户会追问、提供纠正、改变目标,并将模型输出与外部工具结合。

交互式系统可能从这种交流中学习,也可能因此受到扭曲。用户的行为同样会因模型而改变。

Rakhlin 的在线学习研究提供了思考这些序列的框架。该领域研究反复进行预测并随着新信息到来而更新的算法。

其表现通常通过遗憾值来衡量,即将算法的累计结果与适当参照策略的结果进行比较。这一概念使随时间发生的错误成为评估核心。

强化学习将这一推理扩展到行动和延迟反馈。学习者必须在收集有用信息的同时避免代价高昂的探索。

Rakhlin 的团队研究这些问题的样本复杂度。样本复杂度指达到指定性能水平所需的经验量。

这对 AI 系统很重要,因为交互可能代价高昂或不安全。医疗辅助工具不能通过有害建议自由学习。软件智能体也不应需要反复发生生产环境故障,才能发现有效策略。

Rakhlin 的研究页面提到一种称为决策估计系数(DEC)的理论量。该团队利用它研究交互式决策问题的难度,以及高效学习所需的数据量。

由研究这些问题的人领导的研究中心,有条件推动评估超越静态排行榜。它可以鼓励衡量适应、探索、恢复和不确定性的评估方式。

这种转变将给学术界和商业 AI 开发者带来压力。交互式评估更难标准化、运行成本更高,也更不可能产生一个简洁的排名。

它也可能暴露在平均结果中消失的弱点。一个系统可能在许多短任务中成功,却在早期犯错后持续失败。

更长周期的评估会带来可复现性挑战。不同的行动会导向不同状态,使两次运行难以比较。人类用户也可能以不同方式介入。

统计学因此变得不可或缺,因为研究人员必须区分有意义的性能差异与由环境、提示词或评估者造成的波动。

该中心的跨学科覆盖范围可以在此发挥作用。经济学家研究激励下的决策。认知科学家考察学习与行为。计算机科学家构建算法。统计学家量化不确定性和实验性证据。

结合这些视角不会自动产生通用测试,但可以更好地界定一项测试应当揭示什么。

Rakhlin 的在线预测研究还强调了数据并非独立或平稳的场景。平稳性意味着底层数据生成过程会随时间保持稳定。

已部署的 AI 很少得到这种保证。用户会变化,政策会调整,文档会更新,对手会适应。在较早分布上训练的系统可能悄然失去准确性。

这个问题通常被称为分布偏移。它描述了用于构建或评估模型的数据,与模型之后实际遇到的数据之间的差异。

领导层无法通过政策措辞解决分布偏移。SDSC 可以推进数学工具、实证协议和教育,使这一风险更难被忽视。

该中心还可以鼓励研究何时自适应会带来帮助,何时又会引入新的脆弱性。从用户反馈中更新的模型或许能改善个性化,但也可能吸收错误或操纵。

这种权衡说明,统计严谨性并不只是 AI 发展的刹车。它可以识别哪些形式的自适应值得信赖,哪些需要控制措施。

Rakhlin 的任命并不能证明这些主题将定义每一项 SDSC 举措。然而,他已公开的研究议程仍为读者提供了比许多领导层公告周边泛泛表述更强的信号。

这一信号是:应将 AI 研究为一个通过时间、反馈和变化环境运行的学习过程。

三个信号将表明此次任命是否改变 MIT 的 AI 议程

接下来的证据将来自机构层面的决策,而不是又一则领导层人事新闻。

第一个信号将是 Rakhlin 为 SDSC 制定的项目议程。读者应关注围绕交互式学习和 AI 评估的新研究计划、研讨会主题、种子基金或教师合作项目。

一项协调推进的计划将强化这样一种解读:MIT 希望统计学基础塑造其更广泛的 AI 工作。若只是对现有项目的常规延续,则意味着更强的连续性。

这种差异无需通过戏剧性的重组来体现。即便是一项聚焦的资助征集或共享评估项目,也可能揭示 Rakhlin 打算如何利用该中心跨校园的定位。

第二个信号是该中心的教育发展。新开或修订的课程可以显示,学生是否获得了关于不确定性、序贯决策、模型评估和现代神经网络的更深入训练。

SDSC 的学术使命使课程设置成为衡量领导力的直接指标。Rakhlin 此前已展现出建设统计学课程和跨学科博士培养路径的兴趣。

关键问题在于,这些项目是否会随 agentic 和生成式 AI 一同演进。学生需要足够的理论基础,才能评估不断变化的系统,而不是将最新的模型架构视为永恒不变。

将经典推断与交互式系统相连接的课程体系,会进一步印证这项任命在战略上的契合度。与实际部署脱节的课程体系,则会削弱这一判断。

第三个信号是 SDSC 以外的合作。Rakhlin 在 IDSS、脑与认知科学以及 LIDS 等领域均有任职关联,但正式职位并不保证积极开展联合工作。

读者应关注将统计学研究人员与研究语言模型、机器人、科学、健康、经济学或政策的实验室联系起来的项目。共享数据集和评估平台将尤其具有意义。

此类合作将表明,SDSC 能够影响 MIT 各领域 AI 实验的设计方式。没有持续项目支撑的孤立研讨会,只能提供较弱的证据。

这些信号也比期待立刻出现技术成果提供了更公平的检验标准。新的研究项目需要时间招募学生、建立方法并发表研究成果。

因此,这项任命的影响可能首先体现在组织层面的选择上。资助重点、课程供给和合作基础设施,将先于广受引用的定理或系统出现。

同样值得关注的还有没有发生的事情。如果 AI 评估仍然分散在各个院系之间,那么该中心覆盖全 MIT 的使命将更难在实践中显现。

由于人事公告的公众生命周期很短,google news 的新闻周期很快就会转向别处。围绕此事的科学问题则会持续存在。

开发者需要知道,智能体的一次成功何时能够泛化。企业采购方需要证据证明,平均准确率反映的是他们自身的工作负载。研究人员需要能够经受数据变化和交互式反馈考验的评估方法。

知识工作者在依赖 AI 生成的答案时,也面临类似挑战。他们必须保留来源,区分不确定性与信心,并认识到新信息何时会推翻先前的结论。

Rakhlin 的研究成果并未提供一个简单的解决方案。它提供的是用于精确定义学习问题、并分析解决这些问题所需证据的工具。

这正是值得关注这项任命的更深层原因。MIT 将一位学习理论研究者置于一个能够连接统计教育与研究的位置,而该机构正大力投资 AI。

这一决定既不应被赋予夸大的期待,也不应被当作行政新闻而轻易忽略。它的价值将取决于 SDSC 是否能将基础性问题转化为共享的研究实践。

关注该中心的项目、课程体系和跨校园项目。这些选择将揭示,这项任命是否只是出现在 google news 上,还是改变了 MIT 衡量下一代 AI 系统的方式。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page