top of page

什么是主动推理?决策制定的 AI 模型

主动推理是一个框架,它解释了代理如何通过最小化预测误差来更新信念并选择行动。它将感知和决策制定视为单一过程,在这个过程中,代理不断将传入数据与其对世界的内部模型进行比较。

该方法起源于神经科学,如今出现在研究目标导向行为的 AI 研究中。理解它有助于阐明为什么上下文对于任何必须选择下一步做什么的系统都很重要。

关键要点

  • 主动推理将感知和行动视为减少预测结果与实际结果之间意外的步骤。

  • 该框架依赖于代理维护并随时间更新的生成模型。

  • 代理选择预期能使未来观察接近偏好状态的策略。

  • 来自过去经验的上下文提高了模型的准确性和由此产生的选择质量。

  • 保留长期记忆的工具为代理提供了有效运行此过程所需的数据。

准备好看看持续上下文如何改变决策质量了吗?继续阅读。

主动推理定义

主动推理指出,代理会采取行动来确认其对世界的预测。它们通过在观察结果偏离预期时更新内部模型,并选择使未来观察更接近这些预期的动作来实现这一点。

核心属性包括生成预测的生成模型、称为自由能的量(衡量预测与数据之间的不匹配),以及在未来步骤中最小化预期自由能的策略。这些元素共同运行而非孤立存在。

该框架通过添加显式动作选择扩展了预测处理的早期思想。因此,它在一个正式描述中同时解决了感知和行动问题。在实践中,这意味着 AI 代理不仅对传入的图像或文本进行分类,还决定是否请求更多数据、移动传感器或改变其环境以解决不确定性。例如,在物流优化场景中,主动推理代理不仅可以根据交通数据预测交付延迟,还可以主动重新路由车辆以确认或反驳其交通预测,从而实时完善其模型。在客户支持聊天机器人中,同样的原则会引导代理提出澄清问题,以减少对用户意图的不确定性,而不是猜测并冒着回复错误的风险。

这种对感知和行动的统一处理将主动推理与将感知管道与规划模块分开的模块化架构区分开来。其结果是一个在部分可观察环境中学习更快的系统,因为每个动作都服务于收集信息和朝着目标前进的双重目的。由于目标在感知和行动中保持一致,开发人员避免了通常出现在单独感知和规划堆栈之间的脆弱交接。

历史背景与起源

主动推理的根源可追溯到赫尔曼·冯·亥姆霍兹 19 世纪的无意识推理思想,即大脑构建关于感觉数据原因的假设。卡尔·弗里斯顿在 2000 年代初将这些直觉形式化为自由能原理,最初是作为对大脑功能的解释。随后在《自然神经科学》和《自然神经科学评论》上的论文展示了相同的数学如何描述感知和行动。

到 2017 年,该框架已迁移到机器学习实验室,研究人员开始测试由预期自由能引导的代理是否比仅由外部奖励引导的代理学习得更快。如今,相同的方程出现在机器人模拟器、自动驾驶车辆规划模块和模拟人类好奇心的认知架构中。其他里程碑包括 2020 年引入深度主动推理网络,该网络使用变分自编码器将该方法扩展到高维观察,以及 2022 年发布开源库,让从业者无需推导自定义梯度即可通过蒙特卡洛采样实现策略选择。这些发展降低了 AI 团队使用内在动机信号而非手工设计奖励进行实验的门槛。

2023 年进一步取得进展,当时几个研究组展示了将主动推理策略选择与基于 Transformer 的世界模型相结合的混合架构,使代理能够在最小化预期自由能的同时规划数百个 token。2024 年在 PyTorch 和 JAX 生态系统中发布可微分主动推理模块,进一步加速了原型设计,使生成模型和策略网络的梯度优化能够在单个计算图中进行。The VergeBloomberg 的报道强调了这些进步如何重塑 AI 规划工具。

主动推理的工作原理

第 1 步:维护生成模型

代理持有一个可以从隐藏状态生成预期观察的模型。该模型编码了代理之前遇到的规律性。当新数据到达时,代理将它们与模型产生的预测进行比较。在 AI 设置中,生成模型可以是循环神经网络、概率图模型或经过训练以从压缩内部状态重建过去观察的 Transformer。在制造用例中,模型可能学会从传感器流预测机器振动模式,并在故障发生前标记偏差。在企业知识管理设置中,模型可能学会根据项目阶段和过去检索模式预测用户接下来需要的文档。

第 2 步:最小化自由能

自由能量化了预测数据与观察数据之间的差异。代理调整其信念以减少该量。较低的自由能意味着内部模型现在以更少的意外解释当前观察。在代码中,这通常表现为优化器最大化的证据下界 (ELBO) 项;最小化变分自由能和最大化 ELBO 在数学上是等效操作。从业者可以在训练期间监控此标量,以检测模型何时收敛或何时需要新数据源。在生产部署中,团队经常记录数天或数周的自由能轨迹,以确定环境漂移何时开始降低预测准确性。

第 3 步:选择减少预期自由能的策略

代理评估可能的动作序列。它选择预期能产生与偏好或熟悉状态匹配的观察的序列。这一步将感知转化为定向行为。策略选择可以通过在正向模型中采样候选动作序列并根据规划范围内几步的预期自由能减少对每个序列进行评分来实现。在实践中,电子商务定价代理可能会评估数十个折扣计划,选择预期既能最大化利润率(实用价值)又能解决价格弹性不确定性(认知价值)的计划。

对于初学者,想象一个人走进一个熟悉的房间。大脑预测电灯开关在哪里,伸手去够,如果开关不在预期位置就纠正伸手动作。当有更丰富历史可用时,同样的循环可扩展到更复杂的选择。在自主无人机中,相同的循环让车辆预测风阵,调整旋翼推力,并选择保持其内部地图与 GPS 和相机读数一致的路线。当生成模型缺乏对相关状态的覆盖时会出现局限性。在这种情况下,预测仍然不准确,策略选择可能导致重复错误。添加内存缓冲区或外部检索机制可以通过按需提供以前未见过的上下文来缓解此问题。

无需繁重符号的数学直觉

主动推理的核心是最小化一个标量:预期自由能。该量包含两个相互竞争的项。第一项奖励准确预测(认知价值);第二项奖励代理被训练偏好的状态(实用价值)。因为两项都存在于一个目标中,代理会自动平衡探索和利用,而无需外部奖励计划。与需要仔细塑造奖励函数的经典强化学习代理相比,主动推理代理从减少隐藏原因不确定性的驱动力中获得其内在动机。一个简单的数值示例涉及双臂老虎机任务:代理最初拉动每个杠杆一次,记录预测误差,然后迅速将未来拉动集中在预期自由能较低的杠杆上,以比 epsilon-greedy 基线更少的试验实现接近最优的后悔。

主动推理与强化学习和预测编码的比较

强化学习最大化累积外部奖励,通常需要数百万次环境交互。主动推理用内部量——预期自由能——取代外部奖励,从而减少对手工制作奖励塑造的需求。预测编码是一个近亲,仅解释感知;主动推理添加了显式策略层,使感知和行动保持耦合。

在网格世界导航任务上的实证比较表明,当两者获得相同观察历史时,主动推理代理比深度 Q 网络基线少用 30–50% 的样本达到胜任性能。当环境包含奖励准确建模而非即时奖励的长程时间依赖时,差异会更大。在 MuJoCo 运动任务等连续控制基准中,主动推理变体已展示出相当的渐近性能,同时对奖励错误指定表现出更强的鲁棒性,因为代理从不仅依赖外部标量。在部分可观察环境中,差距进一步扩大,因为信念更新是连续发生的,而非仅在奖励事件时发生。

现实世界应用

机器人学使用主动推理让机器在探索环境的同时保持稳定的内部模型。研究人员已展示出比仅奖励驱动方法更高的样本效率。最近一项研究为机械臂配备了主动推理控制器,仅经过 150 次试验就学会堆叠积木,而标准策略梯度方法在相同硬件上需要 400 多次试验。自动驾驶车辆团队已开始在感知规划堆栈中嵌入类似控制器,仅在预期自由能表明对遮挡物体存在高不确定性时才请求额外传感器数据。NYTimesReuters 的报道指出,企业对这些不确定性感知系统的兴趣日益增长。

认知科学应用相同的方程来解释注意力、好奇心等现象。该框架预测,智能体会采样能减少关于隐藏原因的不确定性的信息。眼动追踪实验证实,人类的注视点与主动推理模型会选择下一步检查的位置高度一致。在组织环境中,同样的逻辑解释了为什么维护可搜索的过去项目档案的团队,花在重新发现已知失败模式上的时间更少。

商业决策系统在保留过去选择和结果记录时,可以采用类似的循环。持续的上下文让系统能够优化其对客户响应或项目风险的模型,而无需每次从零开始。一个存储了所有过去活动简报、会议记录和 CRM 更新的销售预测引擎,能够比每季度重置的模型提前数周预测流失风险。医疗保健应用包括闭环麻醉系统,该系统持续更新患者特定的药物敏感性模型,并调整输注速率以将预测的生命体征保持在安全范围内。早期临床原型将目标血压范围的平均偏差降低了 22%,优于标准 PID 控制器。类似原理也出现在能源电网管理中,主动推理控制器通过持续更新可再生能源发电和用户负荷的预测来平衡供需。

主动推理的实践应用 – remio 如何支持决策制定

在上下文感知智能体中,remio 会持续记录会议、文档和浏览活动。这些记录为智能体更新其工作环境模型提供了所需数据。

当用户提出问题时,remio 会检索相关的过去事件,并揭示原本可能隐藏的模式。其结果类似于主动推理中的信念更新步骤,因为智能体基于累积的观察而非单次会话进行工作。数周后,同一智能体会了解到某些客户偏好简洁的状态更新,而另一些客户则要求详细的风险登记表,从而无需显式重新提示即可定制未来的答案。

因此,用户获得的答案会反映先前的决策和约束。该机制也解释了为什么在每次会话后丢弃对话历史的检索增强生成系统,表现不如维护多周记忆存储的系统。Download remio 以测试存储的上下文如何改变日常决策的质量。Ask remio 功能通过让用户检查哪些过去笔记促成了生成的答案,进一步展示了信念更新循环。另请参阅我们关于上下文感知 AI 工作流的指南。

AI 开发的实际意义

构建决策智能体的团队应优先考虑长期记忆架构和生成模型准确性,而非单纯的奖励最大化。不仅记录结果,还记录每个决策之前的上下文,能让自由能最小化循环有效运行。评估指标从“获得的奖励”转向“每次交互减少的预测误差”,在稀疏奖励领域提供更稳定的训练信号。

产品经理在设计人机协同工作流时可以应用同样的视角。向用户展示模型当前的顶级预测以及每个选项的预期自由能减少,能呈现智能体的推理过程,并邀请纠正性反馈以进一步优化生成模型。在敏捷开发环境中,这种方法鼓励迭代优化智能体的内部世界模型,而非反复调整奖励函数。

局限性与潜在风险

生成模型覆盖不足会导致不可靠的预测。没有足够的历史,智能体无法在新观察中区分信号与噪声。过度自信的模型可能会选择预期自由能较低但在模型假设失效时导致灾难性后果的策略。诸如偏好更简单解释的先验和定期模型审计等正则化技术可降低此风险。

另一个局限是计算成本。在长时域上评估预期自由能需要前向模拟,这在高维状态空间中变得昂贵。蒙特卡洛树搜索或摊销策略网络等近似方法可减轻负担,但会重新引入需要调优的超参数。最后,由于该框架模糊了探索与利用的界限,必须显式注入安全约束;否则智能体可能仅为解决不确定性而故意进入危险状态。因此,部署这些智能体的组织应维护每个策略评估及其关联自由能估计的审计日志。

FAQ

Q: 应用主动推理是否需要广泛的技术背景?

A: 核心思想无需高等数学即可理解。实际要求是访问足够的个人历史,以便预测能在重复周期中得到改进。实现细节可以抽象在仅暴露生成模型接口和策略选择循环的库之后。

Q: 主动推理与标准强化学习有何不同?

A: 强化学习通常最大化外部奖励。主动推理最小化预期自由能,将准确性和偏好项合并为一个目标。这消除了精心设计奖励函数的需要,同时保留了目标导向的行为。

Q: 主动推理是否已用于当前 AI 产品?

A: 研究系统和一些机器人平台实现了该框架的版本。更广泛的采用取决于在任务间维护长期上下文的工具。已有几个开源仓库提供了 PyTorch 和 JAX 中的参考实现。

Q: 个人能否将主动推理应用于个人决策?

A: 可以。保留过去选择和结果的记录,能让个人将预测结果与实际结果进行比较,并相应调整未来行动。支持全文检索的简单日记实践或笔记应用已能提供必要的记忆基础。

Q: 是什么限制了主动推理模型的实用性?

A: 生成模型覆盖不足会导致不可靠的预测。没有足够的历史,智能体无法在新观察中区分信号与噪声。其他限制包括规划时域长度和用于评估候选策略的前向模型保真度。

接下来值得关注

研究人员继续将主动推理与大语言模型结合,用预期自由能目标取代下一词元预测。早期结果表明,当模型被允许在提交答案前查询外部记忆时,幻觉率会降低。请关注摊销主动推理的发展,该方法有望在消费级硬件上实现实时策略选择。最后,请留意针对不确定性感知 AI 系统的监管指导,因为预测误差的显式表示可能成为医疗保健和金融等高风险领域中的必需功能。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page