論文の概要: Belief-Based Maximum Occupancy Principle and Active Inference
- arxiv url: http://arxiv.org/abs/2609.39342v1
- Date: Wed, 30 Sep 2026 09:08:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.484951
- Title: Belief-Based Maximum Occupancy Principle and Active Inference
- Title(参考訳): 信念に基づく最大就業原理とアクティブ推論
- Abstract要約: 本質的なモチベーションは適応性とゴール指向の行動において中心的な役割を果たす。
Active Inferenceは、部分的に観測可能な環境での動作の問題に対処する。
我々は,活動推論のための期待自由エネルギーのベルマン改定を導入する。
- 参考スコア(独自算出の注目度): 3.007949058551534
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Intrinsic motivation plays a central role in adaptive and goal-directed behavior by conferring agents reward-independent objectives and biases useful to act in noisy and uncertain environments. Active Inference addresses the problem of acting in a partially observable environment through a principled framework for belief updating and action selection. A key component of Active Inference is the specification of prior preferences, which shapes behavior by encoding desirable future outcomes. An intrinsic motivation approach called the Maximum Occupancy Principle (MOP) proposes that agents act so as to maximize occupancy over future paths of states and actions, with no preferences or epistemic targets. Despite its simple formulation, MOP gives rise to rich and adaptive behaviors that combine exploratory variability with goal-directed dynamics. In this work, we extend MOP to partially observable environments and introduce a Bellman reformulation of the Expected Free Energy for Active Inference, both incorporating belief-based inference over hidden states as part of the agent state. The Bellman formulation enables tractable offline computation via value iteration over the full belief-state space. We compare the resulting behaviors in a set of minimal experimental settings with uncertain food sources. We find that MOP agents switch between goal-directed (food seeking) behavior and exploration between different food sources, depending on their energy available and their belief state. In contrast, Active Inference agents mostly inhabit regions around a single food source, a strategy having both high pragmatic and epistemic value. We finally compare with Empowerment, which is shown to be qualitatively similar to Active Inference.
- Abstract(参考訳): 内在的モチベーションは、ノイズや不確実な環境で行動するのに有用なエージェント非依存の目的やバイアスを提示することによって、適応的で目標指向の行動において中心的な役割を果たす。
アクティブ推論は、信念の更新と行動選択のための原則化されたフレームワークを通じて、部分的に観測可能な環境で行動することの問題に対処する。
Active Inferenceの重要なコンポーネントは、望ましい将来の結果をエンコードすることで振る舞いを形作る、事前の選好の仕様である。
最大占領原則(MOP)と呼ばれる本質的なモチベーションアプローチでは、エージェントは国家や行動の将来の経路に対する占有を最大化するために行動し、嗜好やてんかんの標的を含まないことを提案している。
単純な定式化にもかかわらず、MOPは探索変数とゴール指向力学を組み合わせたリッチで適応的な振る舞いをもたらす。
本研究では, MOPを部分的に観測可能な環境に拡張し, エージェント状態の一部として, 隠蔽状態に対する信念に基づく推論を取り入れた, 期待自由エネルギーのベルマン再編成を導入する。
ベルマンの定式化は、全信念状態空間上の値反復による抽出可能なオフライン計算を可能にする。
実験条件を最小限に設定した場合と,不確実な食料源とで比較した。
我々は,MOPエージェントが目標指向(食物探索)行動と異なる食物源間の探索を切り替えていることを見出した。
対照的に、Active Inferenceエージェントは、1つの食品源の周辺に多く居住しており、高い実用性と疫学的な価値を持つ戦略である。
最終的に、Active Inferenceと質的に類似していることが示されるEmpowermentと比較した。
関連論文リスト
- Sophisticated Policies from Epistemic Priors [1.430924337853801]
計画の地平線内では、ソフィケーテッド推論は将来の行動が将来の状態や観測に依存することを許し、アクティブな推論をクローズループにする。
そこで本研究では, 閉ループ推論と共振器駆動を併用することにより, ソフシケート推論とフルジョイント・プライオリティ・推論が環境を解決できることを述べる。
論文 参考訳(メタデータ) (2026-07-21T19:05:52Z) - Prior preferences in active inference agents: soft, hard, and goal shaping [3.2776596620344285]
アクティブ推論は、学習エージェントにおける搾取的および爆発的駆動のバランスをとる目的として、期待される自由エネルギーを提案する。
我々は、エージェントにハードまたはソフトな目標を与える、選好分布を定義するための4つの方法を検討する。
ゴールシェイピングは、環境の遷移ダイナミクスについて学習を犠牲にして、全体的なパフォーマンス(すなわち、搾取を促進すること)を最大限に発揮できることを示します。
論文 参考訳(メタデータ) (2025-12-02T23:07:24Z) - DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios [57.327907850766785]
現実的な現実のシナリオにまたがる騙しのキャラクタリゼーションは未解明のままである。
DeceptionBenchは、さまざまなドメインにまたがる認知傾向を体系的に評価する最初のベンチマークです。
本研究は,本質的な側面から,ユーザ満足度を優先する自己関心のエゴスティックな傾向を示すモデルや,サイコファンティックな行動を示すモデルについて検討する。
実世界のフィードバックダイナミクスのより現実的なシミュレーションを構築するために,持続的マルチターン相互作用ループを組み込んだ。
論文 参考訳(メタデータ) (2025-10-17T10:14:26Z) - Goal Discovery with Causal Capacity for Efficient Reinforcement Learning [85.28685202281918]
因果推論は人間が世界を探検するのに不可欠である。
本稿では,効率的な環境探索のための新たなゴールディスカバリーと因果容量フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-13T08:54:56Z) - Inference of Affordances and Active Motor Control in Simulated Agents [0.5161531917413706]
本稿では,出力確率,時間的予測,モジュール型人工ニューラルネットワークアーキテクチャを提案する。
我々のアーキテクチャは、割当マップと解釈できる潜在状態が発達していることを示す。
アクティブな推論と組み合わせることで、フレキシブルでゴール指向の動作が実行可能であることを示す。
論文 参考訳(メタデータ) (2022-02-23T14:13:04Z) - Information is Power: Intrinsic Control via Information Capture [110.3143711650806]
我々は,潜時状態空間モデルを用いて推定したエージェントの状態訪問のエントロピーを最小化する,コンパクトで汎用的な学習目的を論じる。
この目的は、不確実性の低減に対応する環境情報収集と、将来の世界状態の予測不可能性の低減に対応する環境制御の両方をエージェントに誘導する。
論文 参考訳(メタデータ) (2021-12-07T18:50:42Z) - Contrastive Active Inference [12.361539023886161]
本稿では,エージェントの生成モデル学習における計算負担を低減し,今後の行動計画を行うための,アクティブ推論のための対照的な目的を提案する。
提案手法は,画像に基づくタスクにおいて,確率に基づく能動推論よりも特に優れているが,計算処理が安価で,訓練も容易である。
論文 参考訳(メタデータ) (2021-10-19T16:20:49Z) - Modulation of viability signals for self-regulatory control [1.370633147306388]
適応行動のドライバとしてのインストゥルメンタルバリューの役割を再考する。
強化学習タスクでは、好みの分布が報酬の概念に取って代わる。
論文 参考訳(メタデータ) (2020-07-18T01:11:51Z) - Learning "What-if" Explanations for Sequential Decision-Making [92.8311073739295]
実世界の意思決定の解釈可能なパラメータ化を実証行動に基づいて構築することが不可欠である。
そこで我々は,「何」の結果に対する嗜好の観点から,報酬関数をモデル化し,専門家による意思決定の学習的説明を提案する。
本研究は,行動の正確かつ解釈可能な記述を回復する上で,実効的逆強化学習手法であるバッチの有効性を強調した。
論文 参考訳(メタデータ) (2020-07-02T14:24:17Z) - Maximizing Information Gain in Partially Observable Environments via
Prediction Reward [64.24528565312463]
本稿では,深いRLエージェントに対する信念に基づく報酬の活用という課題に取り組む。
負のエントロピーと予測される予測報酬の正確な誤差を導出する。
この洞察は、予測報酬を用いたいくつかの分野の理論的動機を与える。
論文 参考訳(メタデータ) (2020-05-11T08:13:49Z) - Intrinsic Motivation for Encouraging Synergistic Behavior [55.10275467562764]
スパース・リワード・シナジスティック・タスクにおける強化学習の探索バイアスとしての本質的モチベーションの役割について検討した。
私たちのキーとなる考え方は、シナジスティックなタスクにおける本質的なモチベーションのための優れた指針は、エージェントが自分自身で行動している場合、達成できない方法で世界に影響を与える行動を取ることである。
論文 参考訳(メタデータ) (2020-02-12T19:34:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。