top of page

アクティブ推論とは?意思決定のためのAIモデル

6月11日
読了時間: 16分

アクティブ推論は、エージェントが予測誤差を最小化することで信念を更新し、行動を選択する方法を説明するフレームワークです。知覚と意思決定を単一のプロセスとして扱い、エージェントは継続的に入力データを世界の内部モデルと比較します。

このアプローチは神経科学に起源を持ち、現在は目標指向の行動を研究するAI分野で用いられています。これを理解することで、次に何を選択すべきかを判断するシステムにとって文脈が重要である理由が明らかになります。

Key Takeaways

  • アクティブ推論は、知覚と行動を、予測された結果と実際の結果の間の驚きを低減するステップとして扱います。

  • このフレームワークは、エージェントが維持・更新する生成モデルに依存します。

  • エージェントは、将来の観測を好ましい状態に近づけると期待されるポリシーを選択します。

  • 過去の経験からの文脈は、モデルの精度と結果として得られる選択の質を向上させます。

  • 長期記憶を保持するツールは、エージェントがこのプロセスを効果的に実行するために必要なデータを提供します。

継続的な文脈が意思決定の質をどのように変えるかを見てみましょう。読み進めてください。

アクティブ推論の定義

アクティブ推論は、エージェントが世界についての予測を確認するために行動することを示します。観測が期待と異なる場合には内部モデルを更新し、将来の観測をそれらの期待に近づける動きを選択することでこれを実現します。

中核的な属性には、予測を生成する生成モデル、予測とデータの不一致を測定する自由エネルギーという量、そして将来のステップにわたって期待自由エネルギーを最小化するポリシーが含まれます。これらの要素は独立してではなく、連携して機能します。

このフレームワークは、明示的な行動選択を追加することで、予測的処理の従来の考え方を拡張します。したがって、感覚と行動の両方を単一の形式的な説明で扱います。実際には、AIエージェントは単に入力画像やテキストを分類するだけでなく、追加データを要求するか、センサーを移動させるか、または不確実性を解消するために環境を変更するかを決定します。たとえば物流最適化のシナリオでは、アクティブ推論エージェントは交通データから配送遅延を予測するだけでなく、車両を積極的に再ルートして交通予測を確認または反証し、リアルタイムでモデルを洗練します。顧客サポートのチャットボットでは、同じ原則により、エージェントはユーザーの意図に関する不確実性を低減する明確化質問を行い、推測して誤った返信をするリスクを避けます。

知覚と行動のこの統一的な扱いは、感覚パイプラインと計画モジュールを分離するモジュール式アーキテクチャとアクティブ推論を区別します。その結果、部分的に観測可能な環境でより迅速に学習するシステムが生まれます。なぜなら、すべての行動が情報収集と目標達成の二重の目的を果たすからです。目的が知覚と行動を通じて一貫しているため、開発者は別々の知覚スタックと計画スタックの間で生じがちな脆弱な引き継ぎを回避できます。

歴史的文脈と起源

アクティブ推論のルーツは、ヘルマン・フォン・ヘルムホルツの19世紀における無意識的推論の考え方に遡ります。これは、脳が感覚データの原因について仮説を構築するというものです。カール・フリストンは2000年代初頭にこれらの直観を自由エネルギー原理として形式化し、最初は脳機能の説明として用いました。その後のNature NeuroscienceおよびNature Reviews Neuroscienceの論文で、同じ数学が知覚と行動の両方を記述できることが示されました。

2017年までにこのフレームワークは機械学習研究室に移行し、期待自由エネルギーに導かれるエージェントが外部報酬のみに導かれるエージェントよりも高速に学習できるかどうかを研究者が検証し始めました。現在、同じ方程式はロボット工学シミュレータ、自律走行車計画モジュール、人間の好奇心をモデル化する認知アーキテクチャに登場します。追加のマイルストーンには、2020年の深層アクティブ推論ネットワークの導入(変分オートエンコーダを用いて高次元観測にアプローチを拡張)、および2022年のオープンソースライブラリのリリース(モンテカルロサンプリングによるポリシー選択の実装を可能にし、カスタム勾配の導出を不要にした)が含まれます。これらの進展により、AIチームが手作りの報酬ではなく内在的動機信号で実験するハードルが下がりました。

2023年にはさらに進展があり、複数のグループがアクティブ推論ポリシー選択とトランスフォーマーベースの世界モデルを組み合わせたハイブリッドアーキテクチャを実証し、エージェントが期待自由エネルギーを最小化しつつ数百トークンにわたって計画できるようにしました。2024年のPyTorchおよびJAXエコシステム内での微分可能なアクティブ推論モジュールのリリースにより、生成モデルとポリシーネットワークの両方を単一の計算グラフ内で勾配ベース最適化できるようになり、プロトタイピングがさらに加速しました。The VergeおよびBloombergで取り上げられた研究は、これらの進展がAI計画ツールをどのように変革しているかを強調しています。

アクティブ推論の仕組み

ステップ1: 生成モデルを維持する

エージェントは、隠れ状態から期待される観測を生成できるモデルを保持します。このモデルは、エージェントがこれまで遭遇した規則性をエンコードします。新しいデータが到着すると、エージェントはそれをモデルが生成する予測と比較します。AI設定では、生成モデルは再帰ニューラルネットワーク、確率グラフィカルモデル、または圧縮された内部状態から過去の観測を再構成するよう訓練されたトランスフォーマーである場合があります。製造業のユースケースでは、モデルがセンサーストリームから機械の振動パターンを予測し、故障前に逸脱を検知することを学習する可能性があります。エンタープライズ知識管理の設定では、プロジェクトフェーズと過去の検索パターンに基づいてユーザーが次に必要とするドキュメントを予測することを学習する可能性があります。

ステップ2: 自由エネルギーを最小化する

自由エネルギーは、予測データと観測データの差を定量化します。エージェントは信念を調整してこの量を低減します。自由エネルギーが低いほど、内部モデルが現在の観測をより少ない驚きで説明できることを意味します。コードではしばしば、エビデンス下界(ELBO)項として現れ、オプティマイザがこれを最大化します。変分自由エネルギーの最小化とELBOの最大化は数学的に等価な操作です。実務者はこのスカラー値を訓練中に監視し、モデルが収束したときや新しいデータソースが必要なときを検知できます。本番環境では、チームが数日または数週間にわたって自由エネルギーの軌跡をログに記録し、環境ドリフトが予測精度を低下させ始めた時点を特定することがよくあります。

ステップ3: 期待自由エネルギーを低減するポリシーを選択する

エージェントは可能な行動シーケンスを評価します。好ましいまたは馴染みのある状態に一致する観測を生み出すと期待されるシーケンスを選択します。このステップにより知覚が指向性のある行動に変わります。ポリシー選択は、前方モデル内で候補行動シーケンスをサンプリングし、各シーケンスを数ステップの計画ホライズンにわたる自由エネルギーの期待低減量でスコアリングすることで実装できます。実際には、eコマース価格設定エージェントが数十の割引スケジュールを評価し、マージンを最大化する(実用的価値)と価格弾力性に関する不確実性を解消する(認識的価値)とが期待されるものを選択する可能性があります。

初心者向けに、人が馴染みのある部屋に入る様子を想像してください。脳は照明スイッチの位置を予測し、手を伸ばし、スイッチが予想位置になければ修正します。より豊かな履歴が利用可能になると、同じループがより複雑な選択に拡張されます。自律ドローンでは、同一のループにより、車両が突風を予測し、ローター推力を調整し、GPSとカメラの読み取り値と内部マップの一貫性を保つルートを選択できます。生成モデルが関連する状態を十分にカバーしていない場合に限界が現れます。そのような場合、予測は不正確なままとなり、ポリシー選択が繰り返しの誤りにつながる可能性があります。メモリバッファや外部検索メカニズムを追加することで、必要に応じて以前に見たことのない文脈を提供し、この問題を軽減できます。

重い表記なしの数学的直観

アクティブ推論の核心は、単一のスカラー量である期待自由エネルギーを最小化することです。この量には2つの競合する項が含まれます。1つ目は正確な予測に報いる(認識的価値)もので、2つ目はエージェントが訓練された好ましい状態に報いる(実用的価値)ものです。両方の項が単一の目的関数内に存在するため、エージェントは外部報酬スケジュールなしに自動的に探索と搾取のバランスを取ります。慎重に整形された報酬関数を必要とする古典的な強化学習エージェントとは対照的に、アクティブ推論エージェントは隠れた原因に関する不確実性を低減する欲求から内在的動機を導き出します。簡単な数値例として、2本腕バンディットタスクがあります。エージェントは最初に各レバーを1回引き、予測誤差を記録した後、期待自由エネルギーがより低い payout 分布を持つレバーに将来の引きを急速に集中させ、ε-greedyベースラインよりもはるかに少ない試行でほぼ最適な後悔を達成します。

強化学習および予測符号化との比較

強化学習は累積外部報酬を最大化し、しばしば数百万回の環境相互作用を必要とします。アクティブ推論は外部報酬を内部量である期待自由エネルギーに置き換えることで、手作りの報酬整形の必要性を低減します。近い親戚である予測符号化は知覚のみを説明しますが、アクティブ推論は明示的なポリシーレイヤーを追加し、知覚と行動を結合した状態に保ちます。

グリッドワールドナビゲーションタスクでの経験的比較では、同一の観測履歴を与えられた場合、アクティブ推論エージェントが深層Qネットワークベースラインよりも30–50%少ないサンプルで有能な性能に到達することが示されています。環境に正確なモデリングを報いる長期的な時間依存性が含まれる場合、差はさらに大きくなります。MuJoCo移動タスクのような連続制御ベンチマークでは、アクティブ推論の変種が同等の漸近性能を示しつつ、報酬の誤指定に対する頑健性が高いことが実証されています。これはエージェントが外部スカラーにのみ依存しないためです。部分的に観測可能な環境では、信念更新が報酬イベント時だけでなく継続的に行われるため、差はさらに拡大します。

実世界での応用

ロボット工学では、アクティブ推論により機械が安定した内部モデルを維持しながら環境を探索できます。研究者らは、報酬駆動型手法のみと比較してサンプル効率の向上を示しています。最近の研究では、アクティブ推論コントローラを備えたロボットアームがわずか150回の試行でブロックを積むことを学習したのに対し、標準的なポリシー勾配法は同じハードウェアで400回以上を必要としました。自律走行車チームは、同様のコントローラを知覚計画スタックに組み込み始め、遮蔽物に関する不確実性が高い場合にのみ追加センサデータを要求できるようにしています。NYTimesおよびReutersの報道は、これらの不確実性を考慮したシステムに対する企業の関心が高まっていることを指摘しています。

認知科学は、注意や好奇心などの現象を説明するために同じ方程式を適用します。このフレームワークは、エージェントが隠れた原因に関する不確実性を低減する情報をサンプリングすることを予測します。アイトラッキング実験は、人間の視線固定がアクティブ推論モデルが次に検査することを選択する位置と密接に一致することを確認しています。組織的な設定では、同じ論理が、過去のプロジェクトの検索可能なアーカイブを維持するチームが既知の失敗モードを再発見するのに費やす時間が少なくなる理由を説明します。

ビジネス意思決定システムは、過去の選択と結果の記録を保持することで同様のループを採用できます。継続的なコンテキストにより、システムは各回ゼロから開始することなく、顧客の反応やプロジェクトリスクのモデルを洗練できます。すべての過去のキャンペーンブリーフ、会議メモ、CRM更新を保存する売上予測エンジンは、四半期ごとにリセットされるモデルよりも数週間早く解約リスクを予測できます。ヘルスケアアプリケーションには、患者固有の薬剤感受性モデルを継続的に更新し、予測されるバイタルサインを安全な範囲内に保つために注入速度を調整するクローズドループ麻酔システムが含まれます。初期の臨床プロトタイプは、標準的なPIDコントローラーと比較して、目標血圧範囲からの平均偏差を22%低減しました。同様の原則は、エネルギーグリッド管理にも現れます。アクティブ推論コントローラーは、再生可能エネルギー発電と消費者負荷の予測を継続的に更新することで供給と需要のバランスを取ります。

Active Inference in Practice – How remio Supports Decision Making

コンテキスト対応エージェントの中で、remioは会議、ドキュメント、閲覧アクティビティの永続的な記録を保持します。この記録は、エージェントが作業環境のモデルを更新するために必要なデータを提供します。

ユーザーが質問すると、remioは関連する過去のイベントを取得し、そうでなければ隠れたままになるパターンを表面化します。結果はアクティブ推論における信念更新ステップに似ています。なぜなら、エージェントは単一のセッションではなく蓄積された観測から作業するからです。数週間にわたり、同じエージェントは特定のクライアントが簡潔なステータス更新を好む一方で、他のクライアントが詳細なリスクレジスタを要求することを学習し、明示的な再プロンプトなしに将来の回答をカスタマイズできるようになります。

したがって、ユーザーは以前の決定と制約を反映した回答を得られます。このメカニズムは、各セッション後に会話履歴を破棄する検索拡張生成システムが、数週間のメモリストアを維持するシステムと比較して性能が劣る理由も説明します。保存されたコンテキストが日常の選択の質をどのように変えるかをテストするには、Download remioしてください。Ask remio機能は、生成された回答にどの過去のノートが寄与したかをユーザーが検査できるようにすることで、信念更新ループをさらに明らかにします。context-aware AI workflowsに関するガイドも参照してください。

Practical Implications for AI Development

意思決定エージェントを構築するチームは、純粋な報酬最大化よりも長期記憶アーキテクチャと生成モデル精度を優先すべきです。結果だけでなく各決定に先立つコンテキストも記録することで、自由エネルギー最小化ループが効果的に動作できるようになります。評価指標は「得られた報酬」から「インタラクションごとの予測誤差低減」へと移行し、報酬がまばらな領域でより安定した訓練信号を提供します。

プロダクトマネージャーは、人間参加型ワークフローを設計する際に同じレンズを適用できます。モデルの現在のトップ予測と各オプションの期待自由エネルギー低減をユーザーに提示することで、エージェントの推論を表面化し、生成モデルをさらに洗練する修正フィードバックを促します。アジャイル開発環境では、このアプローチは報酬関数の繰り返しのチューニングではなく、エージェントの内部世界モデルの反復的な洗練を促します。

Limitations and Potential Risks

生成モデルにおけるカバー範囲の不足は、信頼性の低い予測を生み出します。十分な履歴がなければ、エージェントは新しい観測における信号とノイズを区別できません。過信したモデルは、期待自由エネルギーが低いように見えるポリシーを選択する可能性がありますが、モデルの仮定が崩れた場合には壊滅的な結果を招くことがあります。より単純な説明を好む事前分布や定期的なモデル監査などの正則化手法により、このリスクを低減できます。

もう一つの制約は計算コストです。長い地平線にわたって期待自由エネルギーを評価するには前方シミュレーションが必要であり、高次元状態空間では高コストになります。モンテカルロ木探索や償却ポリシーネットワークなどの近似手法により負担を軽減できますが、再び調整が必要なハイパーパラメータが導入されます。最後に、このフレームワークは探索と搾取の境界を曖昧にするため、安全制約を明示的に注入する必要があります。そうでなければ、エージェントは不確実性を解消するためだけに危険な状態に意図的に入る可能性があります。これらのエージェントを展開する組織は、したがって、すべてのポリシー評価とそれに関連する自由エネルギー推定の監査ログを維持する必要があります。

FAQ

Q: アクティブ推論を適用するには、広範な技術的背景が必要ですか?

A: 核心的なアイデアは高度な数学なしで理解可能です。実践的な要件は、予測が繰り返しのサイクルで改善できる十分な個人履歴へのアクセスです。実装の詳細は、生成モデルインターフェースとポリシー選択ループのみを公開するライブラリの背後に抽象化できます。

Q: アクティブ推論は標準的な強化学習とどのように異なりますか?

A: 強化学習は通常、外部報酬を最大化します。アクティブ推論は期待自由エネルギーを最小化します。これは精度と選好の項を単一の目的関数に組み合わせます。これにより、慎重に設計された報酬関数の必要性がなくなり、目標指向の行動が維持されます。

Q: アクティブ推論は現在のAI製品で使用されていますか?

A: 研究システムや一部のロボティクスプラットフォームがこのフレームワークのバージョンを実装しています。より広範な採用は、タスク間で長期コンテキストを維持するツールに依存します。すでにいくつかのオープンソースリポジトリがPyTorchおよびJAXでのリファレンス実装を提供しています。

Q: 個人はアクティブ推論を個人的な決定に適用できますか?

A: はい。過去の選択と結果の記録を保持することで、予測された結果と実際の結果を比較し、それに応じて将来の行動を調整できます。全文検索をサポートするシンプルなジャーナリング習慣やノート取りアプリケーションは、すでに必要なメモリ基盤を提供します。

Q: アクティブ推論モデルの有用性を制限するものは何ですか?

A: 生成モデルにおけるカバー範囲の不足は、信頼性の低い予測を生み出します。十分な履歴がなければ、エージェントは新しい観測における信号とノイズを区別できません。追加の制約には、計画地平線の長さと候補ポリシーを評価するために使用される前方モデルの忠実度が含まれます。

What to Watch Next

研究者は、next-token予測を期待自由エネルギー目的関数に置き換えることで、アクティブ推論を大規模言語モデルと統合し続けています。初期の結果は、モデルが回答をコミットする前に外部メモリをクエリできるようにした場合に幻覚率が低下することを示唆しています。消費者向けハードウェア上でリアルタイムポリシー選択を約束する償却アクティブ推論の開発を監視してください。最後に、不確実性を考慮したAIシステムに関する規制ガイダンスに注目してください。なぜなら、予測誤差の明示的な表現は、ヘルスケアや金融などの高リスク領域で必須の機能になる可能性があるからです。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page