top of page

什么是主动推理?我们如何做出决策的计算模型

主动推理是一个计算框架,描述了包括人类和某些AI系统在内的主体如何通过主动减少预测与传入感官数据之间的惊奇来做出决策。该模型将感知和行动视为同一过程的两个方面,旨在维持对世界的稳定内部模型。

该框架受到关注的原因在于,它为感知和行为提供了一个单一原则,并指向能够预测上下文而非等待明确命令的AI助手。

关键要点

  • 主动推理指出,主体通过实现其预测来行动,而非仅仅对奖励做出反应。

  • 关键量是期望自由能,它同时包含准确性和信息价值。

  • 这种观点导致AI设计选择偏好持久上下文而非无状态查询处理。

  • 该方法无需单独的奖励奖励即可解释好奇心和探索行为等现象。

主动推理定义

主动推理起源于理论神经科学,将大脑视为预测机器。主体维护一个生成模型来预测感觉。当预测失败时,主体可以更新其模型或改变行动,使感觉与预测重新一致。

该方法有三个区别性属性。首先,它将感知、学习和行动统一在一个目标下:最小化惊奇,或更正式地说,变分自由能。其次,它将行动视为主体用来检验或实现自身假设的干预。第三,它赋予信息增益内在价值,因此不确定性减少本身成为一种驱动力。

主动推理如何工作

第1步:从内部模型生成预测

主体携带一个关于隐藏状态如何生成观测的概率模型。每时每刻,它都会产生关于预期感觉的自上而下预测。这些预测与实际感官输入进行比较,产生预测误差。

第2步:通过感知或行动最小化预测误差

预测误差可以通过两种方式解决。感知推理调整信念以更好地匹配传入数据。相比之下,主动推理选择预期会产生当前信念所预测的感觉的行动。换句话说,主体行动使世界符合其模型。

第3步:用期望自由能评估策略

为了在可能的行动方案中做出选择,主体用期望自由能对每个策略进行评分。该量平衡了未来观测的预期准确性与这些观测将提供的信息。既能确认模型又能解决不确定性的策略得分较低,因此更受偏好。

一个简单的类比是人在熟悉的建筑中导航。内部模型预测下一条走廊的布局。当预测匹配时,几乎不需要调整。当不匹配时,人要么修正心理地图,要么转向恢复预期视图的方向。

因此,主动推理为目标导向行为和探索驱动力提供了正式解释,而无需每一步都需要外部奖励信号。

主动推理与强化学习

目标

  • 强化学习最大化从环境中获得的累积奖励。

  • 主动推理最小化期望自由能,该量已包含类似奖励的项加上信息增益。

探索

  • 强化学习通常添加单独的机制,如epsilon-greedy或熵奖励。

  • 主动推理将信息寻求视为驱动目标实现的同一目标的一部分。

模型使用

  • 许多强化学习主体在没有明确的观测生成模型的情况下学习价值函数。

  • 主动推理主体维护并更新一个前向模型,可重复用于规划和感知。

当设计必须在变化的上下文中运行的助手时,这种区别很重要,因为显式的生成模型即使在奖励信号稀疏时也能继续支持预测。

现实应用

机器人研究人员应用主动推理,让机器人在传感器噪声下通过持续最小化预测误差进行小幅修正运动来维持稳定行为。认知科学家使用该框架来建模人类在视觉搜索中如何分配注意力,表明眼动既用于收集任务相关信息,也用于确认内部预期。

在人机交互中,同一原则建议界面根据最近上下文显示预期的下一步操作来减少惊奇,而不是呈现长长的选项列表。

主动推理的实践

同一原则指导了保持先前交互持久记忆的主体设计。当助手维护用户偏好和项目状态的运行模型时,每个新输入都可以根据从该模型得出的预测进行评估。会增加不匹配的行动会被降级,而会确认或有效扩展模型的行动会被优先考虑。

这种方法偏好持续累积上下文的系统,而不是每次会话都重置。一种这样的实现在 https://www.remio.ai 可用。

关于主动推理的常见问题

Q: 主动推理是否需要整个世界的显式模型?

A: 不需要。主体只需要一个足以对其关心的变量生成预测的模型。世界的其余部分保持隐式。

Q: 主动推理与预测加工有何不同?

A: 预测加工提供大脑最小化预测误差的一般想法。主动推理补充了行动本身是实现这些预测的一种手段这一主张。

Q: 当前的大语言模型可以被描述为主动推理主体吗?

A: 不能直接。大多数模型没有持续的感官反馈循环或持久的内部状态来随时间跟踪预期观测。

Q: 将主动推理扩展到复杂任务时会出现什么实际限制?

A: 在长视野上计算期望自由能仍然昂贵。因此,实用系统将该原则与近似规划方法和缓存策略相结合。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page