論文の概要: Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators
- arxiv url: http://arxiv.org/abs/2607.16858v1
- Date: Sat, 18 Jul 2026 15:44:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.273952
- Title: Principled Direction-Free Intrinsic Motivation through Model-Free Epistemic Free-Energy Estimators
- Title(参考訳): モデルフリーなフリーエネルギ推定器による原理的方向無本質的動機づけ
- Abstract要約: 教師なし強化学習は、特定の驚きの方向を前提としない本質的な動機を必要とする。
予測エラーの好奇心は、予測不可能なノイズを含む、予想される総サプライズを報いる。
そこで我々は,選好自由エネルギー目標の新規貢献から,各窓に静止した1つの本質的な報酬を提案する。
- 参考スコア(独自算出の注目度): 7.280207127853575
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Across environments with mixed sources of uncertainty, unsupervised reinforcement learning requires intrinsic motivation that does not precommit to a particular direction of surprise. Surprise minimization is scoped by design to ``unstable'' environments. Prediction-error curiosity rewards total expected surprise, including irreducible noise. Bandit or mixture switching between surprise-minimizing and surprise-maximizing rewards reintroduces non-stationarity by construction. We propose a single intrinsic reward, stationary within each window, derived from the novelty contribution of a preference-free Expected Free Energy objective, expressed in reward-maximization form. Our claim is that parameter information gain, the expected surprise of the next state minus its irreducible part, is the appropriate intrinsic signal in both high-entropy and low-entropy components of the state space. Maximizing it seeks exactly the surprise the model can explain away. In regions of unresolved dynamics, this epistemic term drives exploration. As dynamics become resolved, the epistemic term vanishes, while an aleatoric penalty favors lower-variance transitions, all without fitting an explicit next-state predictor. A pseudocount supplies epistemic value, a probe-based penalty captures aleatoric variance, and a short-horizon gate protects informative successors. A window-based freeze of all reward-defining objects yields a stationary Bellman operator, explicit bounds on learning targets, and a conditional uniform-concentration result for the nonparametric estimators under mixing, smoothness, bandwidth, and capacity assumptions. In active-inference terms, the agent is preference-free where novelty is retained, standard likelihood ambiguity vanishes under full observability, a nonstandard transition-entropy penalty is added, and surprise minimization emerges in resolved regions of the state space.
- Abstract(参考訳): 不確実性の混在した環境全体において、教師なしの強化学習は、特定の驚きの方向を前提としない本質的なモチベーションを必要とする。
サプライズ最小化は、設計によって ``unstable'' 環境にスコープされる。
予測エラーの好奇心は、予測不可能なノイズを含む、予想される総サプライズを報いる。
驚きの最小化と驚きの最大化を切り替えるバンドやミックスは、建設によって非定常性を再導入する。
提案手法は,各ウィンドウ内に存在する1つの本質的な報酬を,最大化形式で表現された選好自由エネルギー目標の新規な貢献から導いたものである。
我々の主張は、パラメータ情報ゲインは、次の状態が既約部分を減らして予想される驚きであり、状態空間の高エントロピー成分と低エントロピー成分の両方において適切な固有信号であるということである。
モデルを最大化することは、モデルが説明できる驚きを正確に求めます。
未解決のダイナミクスの領域では、この疫学用語は探索を促進する。
ダイナミクスが解決されると、疫学用語は消滅し、アレラトリックペナルティは低分散遷移を好んでおり、すべてが明示的な次の状態予測器に適合しない。
疑似カウントは、てんかんの値を提供し、プローブベースのペナルティはアレタリックな分散を捕捉し、ショートホライゾンゲートは情報的後継者を保護する。
すべての報酬定義対象のウィンドウベースの凍結は、定常ベルマン演算子、学習目標の明示的な境界、および混合、滑らか性、帯域幅、容量仮定の下での非パラメトリック推定子に対する条件一様集中結果をもたらす。
アクティブ推論用語では、新規性が保たれた場合、エージェントは選好自由であり、完全な可観測性の下で標準可能性曖昧性が消滅し、非標準遷移エントロピーペナルティが加算され、状態空間の解決された領域にサプライズ最小化が出現する。
関連論文リスト
- Expected free energy as an information constraint on the Bethe Lagrangian [2.360534864805446]
アクティブ推論は、予測される未来よりも期待される自由エネルギー関数を最小化することによって行動を選択する。
本稿では、メッセージパッシングによる推論を完全にサポートするBethe自由エネルギー関数に基づく代替の定式化を提案する。
情報需要が変化するにつれて、解決された乗算器はその不活性、内部、飽和状態を通過する。
論文 参考訳(メタデータ) (2026-08-17T22:10:54Z) - High-dimensional ridgeless least squares interpolation under spiked covariance structures [3.656751299156262]
本稿では,高次元のリッジレス最小二乗推定器において,特徴量$p$とサンプルサイズ$n$が比例的に大きくなる場合のサンプル外予測リスクについて検討する。
遅延スパイク方向に沿って分布する信号エネルギーは、過適合が良性、誘惑的、破滅的な過適合につながるか否かを決定する。
論文 参考訳(メタデータ) (2026-08-07T14:40:44Z) - Analytic Planning under Uncertainty with Moment Closure [32.403961716203455]
フルステートを解析的に伝播させることは、これを行うための原則的な方法を提供するが、伝統的に、トラクタブルな状態を維持するために制限的な政策や報酬構造を必要としてきた。
このような制約を伴わずに分散対応計画が可能であるかを検討する。
提案手法は, 連続制御における観測下での予測不確実性を良好に評価し, 目標分散を低減させる。
論文 参考訳(メタデータ) (2026-08-03T17:17:00Z) - Persistent Gaussian Perturbations Prevent Oversmoothing in Recurrent Graph Neural Networks [2.8427946758947304]
伝搬ステップ毎に独立なガウスノイズを注入するグラフニューラルネットワークについて検討する。
隠れ表現が幾何学的にエルゴード的なマルコフ連鎖を形成し、一意な不変確率測度を持つことを証明する。
以上の結果から,過密症と闘うメカニズムとして,持続的摂動が根本的に異なることが明らかとなった。
論文 参考訳(メタデータ) (2026-07-30T13:21:18Z) - Predictable GRPO: A Closed-Form Model of Training Dynamics [1.0537323885285492]
我々はこれらの力学の第一原理還元次モデルを開発する。
グループサイズは、ノイズ温度として、先行順に入力される。
3つのモデルと2つのグループサイズで、クローズドフォームの軌道はトレーニング報酬をR2 geq 0.91$に適合させる。
論文 参考訳(メタデータ) (2026-06-29T18:19:09Z) - Gradient-Free Noise Optimization for Reward Alignment in Generative Models [52.42087778653147]
ZeNOは、経路積分制御問題としてノイズ最適化を定式化する、勾配のないフレームワークである。
効果的な推論時間スケーリングを可能にし、多様なジェネレータと報酬関数間で強力なパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-05-12T00:05:36Z) - CURVE: Learning Causality-Inspired Invariant Representations for Robust Scene Understanding via Uncertainty-Guided Regularization [30.613712415224473]
CURVEは、変動不確実性モデリングと不確実性誘導構造正規化を統合し、高分散関係を抑制するフレームワークである。
具体的には,環境依存的変動から不変な相互作用力学を解離させ,スパースかつ領域安定なトポロジを促進させる。
実験により,CURVEをゼロショット転送と低データのsim-to-real適応で評価し,領域安定なスパーストポロジの学習能力を検証するとともに,分布シフト下でのリスク予測を支援するための信頼性の高い不確実性推定を行う。
論文 参考訳(メタデータ) (2026-01-28T08:15:56Z) - Random-Matrix-Induced Simplicity Bias in Over-parameterized Variational Quantum Circuits [72.0643009153473]
本稿では,観測可能な期待値とパラメータ勾配の両方がシステムサイズに指数関数的に集中するHaar型普遍性クラスに,表現的変分アンサーゼが入ることを示す。
その結果、そのような回路によって誘導される仮説クラスは、近点関数の狭い族に高い確率で崩壊する。
テンソル-ネットワークベースおよびテンソル-ハイパーネットワークパラメータ化を含むテンソル構造VQCは、ハール型普遍性クラスの外にある。
論文 参考訳(メタデータ) (2026-01-05T08:04:33Z) - Equilibrium Propagation Without Limits [0.0]
我々は,nudged と free phase のヘルムホルツ自由エネルギーの差の勾配が,まさに期待される局所エネルギー微分の差であることを示した。
これは、古典的なContrastive Hebbian Learning Updateを、任意の有限ヌーディングのための正確な勾配推定器として検証する。
論文 参考訳(メタデータ) (2025-11-27T01:55:26Z) - Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction [51.50282796099369]
本稿では,多次元命令の不確実性低減フレームワークを開発し,意味論的に制約された逆の例を生成する。
言語誘導サンプリングプロセスの予測により、設計したResAdv-DDIMサンプルにより最適化プロセスが安定化される。
セマンティック制約付き3次元逆数例の参照フリー生成を初めて実現した。
論文 参考訳(メタデータ) (2025-10-27T04:02:52Z) - Discretization-Induced Dirichlet Posterior for Robust Uncertainty
Quantification on Regression [17.49026509916207]
不確実性定量化は、現実世界のアプリケーションにディープニューラルネットワーク(DNN)をデプロイするために重要である。
視覚回帰タスクでは、現在のAuxUE設計は、主にアレタリック不確実性推定に採用されている。
回帰タスクにおけるより堅牢な不確実性定量化のための一般化されたAuxUEスキームを提案する。
論文 参考訳(メタデータ) (2023-08-17T15:54:11Z) - Model-Based Uncertainty in Value Functions [89.31922008981735]
MDP上の分布によって引き起こされる値の分散を特徴付けることに重点を置いている。
従来の作業は、いわゆる不確実性ベルマン方程式を解くことで、値よりも後方の分散を境界にしている。
我々は、解が値の真後分散に収束する新しい不確実性ベルマン方程式を提案する。
論文 参考訳(メタデータ) (2023-02-24T09:18:27Z) - Neuro-Symbolic Entropy Regularization [78.16196949641079]
構造化予測では、目的は構造化されたオブジェクトをエンコードする多くの出力変数を共同で予測することである。
エントロピー正則化(Entropy regularization)という1つのアプローチは、決定境界が低確率領域にあるべきであることを示唆している。
我々は、モデルが有効対象を確実に予測することを奨励する損失、ニューロシンボリックエントロピー正規化を提案する。
論文 参考訳(メタデータ) (2022-01-25T06:23:10Z) - The Hidden Uncertainty in a Neural Networks Activations [105.4223982696279]
ニューラルネットワークの潜在表現の分布は、アウト・オブ・ディストリビューション(OOD)データの検出に成功している。
本研究は、この分布が、モデルの不確実性と相関しているかどうかを考察し、新しい入力に一般化する能力を示す。
論文 参考訳(メタデータ) (2020-12-05T17:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。