top of page

アクティブ推論とは何か? 意思決定の仕方を説明する計算モデル

アクティブ推論は、エージェント(人間や特定のAIシステムを含む)が予測と入力される感覚データの間のサプライズを積極的に低減することで意思決定を行う方法を説明する計算フレームワークです。このモデルでは、知覚と行動を、世界の安定した内部モデルを維持することを目的とした同一プロセスの両面として扱います。

このフレームワークが注目を集めているのは、知覚と行動の両方に単一の原理を提供し、明示的なコマンドを待つのではなく文脈を予測するAIアシスタントへの道筋を示すためです。

Key Takeaways

  • アクティブ推論は、エージェントが報酬に単に反応するのではなく、自身の予測を実現するために行動すると述べています。

  • 重要な量は期待自由エネルギーであり、正確性と情報の価値の両方を含みます。

  • この見方は、ステートレスなクエリ処理ではなく永続的な文脈を優先するAI設計の選択につながります。

  • このアプローチは、別個の報酬ボーナスなしに好奇心や探索的行動などの現象を説明します。

Active Inference Definition

アクティブ推論は理論神経科学に起源を持ち、脳を予測機械として位置づけます。エージェントは感覚を予測する生成モデルを維持します。予測が失敗すると、エージェントはモデルを更新するか、感覚を予測に一致させるために行動を変更できます。

このアプローチを区別する3つの特性があります。第一に、知覚、学習、行動をサプライズ(より形式的には変分自由エネルギー)の最小化という単一の目的の下に統一します。第二に、行動を、エージェントが自身の仮説を検証または実現するために用いる介入として扱います。第三に、情報利得に内在的な価値を割り当て、不確実性の低減自体を駆動要因とします。

How Active Inference Works

Step 1: Generate predictions from an internal model

エージェントは、隠れ状態が観測を生成する方法に関する確率モデルを保持しています。各瞬間に、感覚として何を期待するかのトップダウン予測を生成します。これらの予測は実際の感覚入力と比較され、予測誤差を生み出します。

Step 2: Minimize prediction error through perception or action

予測誤差は2つの方法で解消できます。知覚的推論は、入力データにより適合するよう信念を調整します。一方、アクティブ推論は、現在の信念が予測する感覚を生み出すと期待される行動を選択します。つまり、エージェントは世界が自身のモデルに適合するように行動します。

Step 3: Evaluate policies with expected free energy

可能な行動方針の中から選択するため、エージェントは各ポリシーを期待自由エネルギーで評価します。この量は、将来の観測の期待される正確性と、それらの観測が提供する情報の価値のバランスを取ります。モデルを確認しつつ不確実性を解消するポリシーはスコアが低くなり、したがって優先されます。

簡単な例えとして、馴染みのある建物内を移動する人を挙げます。内部モデルは次の通路のレイアウトを予測します。予測が一致すればほとんど調整は必要ありません。一致しない場合、その人は精神的な地図を修正するか、期待される景色を取り戻す方向に曲がります。

したがってアクティブ推論は、外部からの報酬信号を各ステップで必要とせずに、目標指向の行動と探索的駆動の両方を形式的に説明します。

Active Inference vs Reinforcement Learning

Objective

  • 強化学習は環境から受け取る累積報酬を最大化します。

  • アクティブ推論は期待自由エネルギーを最小化します。この量にはすでに報酬的な項と情報利得が含まれています。

Exploration

  • 強化学習ではしばしばε-greedyやエントロピーボーナスなどの別個のメカニズムを追加します。

  • アクティブ推論では、情報探索を目標達成を駆動する同一の目的の一部として扱います。

Model use

  • 多くの強化学習エージェントは、観測の明示的な生成モデルなしに価値関数を学習します。

  • アクティブ推論エージェントは、計画と知覚に再利用可能な前方モデルを維持・更新します。

この区別は、変化する文脈で動作しなければならないアシスタントを設計する際に重要です。なぜなら、明示的な生成モデルは報酬信号がまばらな場合でも予測を継続してサポートできるからです。

Real-World Applications

ロボット工学の研究者は、センサーノイズ下でロボットが小さな修正動作を通じて予測誤差を継続的に最小化することで安定した行動を維持できるように、アクティブ推論を適用しています。認知科学者は、視覚探索中の人間の注意配分をモデル化するためにこのフレームワークを用い、眼球運動がタスク関連情報の収集と内部期待の確認の両方に役立つことを示しています。

ヒューマンコンピュータインタラクションでは、同じ原理から、長い選択肢リストを提示するのではなく最近の文脈に基づいて予測される次の行動を表示することでサプライズを低減するインターフェースが示唆されます。

Active Inference in Practice

同じ原理は、過去のインタラクションの永続的な記憶を保持するエージェントの設計に役立ちます。アシスタントがユーザーの好みやプロジェクト状態の実行中のモデルを維持する場合、新しい入力はそのモデルから導かれる予測に対して評価できます。不一致を増大させる行動は格下げされ、モデルを確認または有用に拡張する行動が優先されます。

このアプローチは、セッションごとにリセットするのではなく文脈を継続的に蓄積するシステムを好みます。そのような実装の一つは https://www.remio.ai で利用可能です。

Common Questions About Active Inference

Q: アクティブ推論は世界全体の明示的なモデルを必要としますか?

A: いいえ。エージェントが必要とするのは、自身が関心を持つ変数についての予測を生成するのに十分なモデルだけです。世界の残りは暗黙のままです。

Q: アクティブ推論は予測処理とどう違いますか?

A: 予測処理は、脳が予測誤差を最小化するという一般的な考え方を提供します。アクティブ推論は、行動自体がそれらの予測を実現する手段であるという主張を加えます。

Q: 現在の大規模言語モデルはアクティブ推論エージェントとして記述できますか?

A: 直接的にはできません。ほとんどのモデルは、時間の経過とともに期待される観測を追跡する継続的な感覚フィードバックループや永続的な内部状態なしに動作します。

Q: アクティブ推論を複雑なタスクにスケールする際に生じる実用的な限界は何ですか?

A: 長い地平線にわたって期待自由エネルギーを計算することは依然として高コストです。実用的なシステムはしたがって、この原理を近似計画手法やキャッシュされたポリシーと組み合わせます。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page