論文の概要: Full Bayesian Reinforcement Learning via LF-IBIS
- arxiv url: http://arxiv.org/abs/2607.01741v1
- Date: Thu, 02 Jul 2026 05:54:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.688972
- Title: Full Bayesian Reinforcement Learning via LF-IBIS
- Title(参考訳): LF-IBISによる完全ベイズ強化学習
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、エージェントが環境との相互作用を通じて最適なポリシーを学習するシーケンシャルな意思決定フレームワークである。
BRLアプローチは明示的な可能性関数を必要としており、現実世界の設定ではしばしばアクセスできないか難解である。
BRLの新たなアルゴリズムであるLF-IBIS(Likelihood-Free Iterated Batch Importance Smpling)を提案する。
- 参考スコア(独自算出の注目度): 0.2039123720459736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning (RL) is a sequential decision-making framework in which an agent learns optimal policies through interaction with an environment by maximizing cumulative rewards. Among RL methods, Bayesian Reinforcement Learning (BRL) addresses common practical challenges related to data scarcity by leveraging prior knowledge about the environment and sequential belief updates. However, most BRL approaches require an explicit likelihood function, which is frequently inaccessible or intractable in real-world settings. We propose Likelihood-Free Iterated Batch Importance Sampling (LF-IBIS), a novel algorithm for BRL that updates the agent's beliefs online as new interactions become available. By combining Approximate Bayesian Computation with Iterated Batch Importance Sampling, LF-IBIS enables full Bayesian inference in settings where the environment dynamics are not described by an explicit or tractable likelihood. The method yields approximate posterior distributions over both environment parameters and optimal policies, providing a quantification of policy uncertainty useful for a Bayesian treatment of the exploration-exploitation trade-off. We test the method on a simulation study in response-adaptive randomization in clinical trials, where closed-form posteriors enable validation. Additional experiments address settings where the posterior has no closed form and illustrate online policy updating based on the posterior distribution of the optimal policy.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)とは、エージェントが累積報酬を最大化し、環境との相互作用を通じて最適な政策を学習する連続的な意思決定フレームワークである。
RL法のうち、ベイズ強化学習(BRL)は、環境に関する事前の知識と逐次的信条更新を活用することにより、データの不足に関連する一般的な実践的課題に対処する。
しかし、ほとんどのBRLアプローチは明示的な可能性関数を必要としており、実世界の設定ではしばしばアクセスできないか難解である。
BRLの新たなアルゴリズムであるLF-IBIS(Likelihood-Free Iterated Batch Importance Smpling)を提案する。
Approximate Bayesian Computation と Iterated Batch Importance Smpling を組み合わせることで、LF-IBIS は環境ダイナミクスが明示的あるいは抽出可能な可能性によって記述されない設定において、完全なベイズ推論を可能にする。
この方法では, 環境パラメータと最適政策の両面に近似した後続分布が得られ, ベイジアンによる探査・探査トレードオフ処理に有用な政策不確実性の定量化が期待できる。
本手法は, クローズドフォーム後部がバリデーションを可能にする臨床試験において, 応答適応型ランダム化のシミュレーション研究で検証した。
追加実験では、後部がクローズドフォームを持たない設定に対処し、最適ポリシーの後部分布に基づいたオンラインポリシー更新を示す。
関連論文リスト
- Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning [88.42566960813438]
CalibRLは、制御可能な探索と専門家のガイダンスをサポートするハイブリッド政治RLVRフレームワークである。
CalibRLは政策エントロピーを誘導的に増加させ、目標分布を明らかにする。
ドメイン内設定とドメイン外設定の両方を含む8つのベンチマークの実験は、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-02-22T07:23:36Z) - General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies [4.098989232625628]
オフラインのRLアルゴリズムは、収集したデータを生成する行動ポリシーを改善することを目的としており、学習したポリシーはデータセットのサポート内にあることを制限している。
本稿では,オフライン学習データセットに基づくアルゴリズムの学習目標に対する適応的制約を組み込むために,$f$-divergenceに対する一般的なフレキシブル関数の定式化を導入する。
MuJoCo、Fetch、AdroitHand環境の実験結果から、提案したLP形式の正しさと、互換性のある制約付き最適化アルゴリズムに適用した場合に、困難なデータセットから学習のパフォーマンスを改善するための柔軟な$f$-divergenceの可能性が示された。
論文 参考訳(メタデータ) (2026-02-11T17:53:49Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior [53.21550098214227]
テキスト内強化学習は、パラメータを更新せずに、目に見えない環境への高速な適応を約束する。
本研究では,ベイズ ICRL 法である SPICE を導入し,その事前値を深層アンサンブルで学習し,テスト時に更新する。
本研究は,SPICEが準最適軌道のみに事前訓練した場合でも,帯域幅と有限水平MDPの両方において,後悔と最適動作を達成できることを証明した。
論文 参考訳(メタデータ) (2026-01-06T13:41:31Z) - Stochastic Path Planning in Correlated Obstacle Fields [1.8184089804625951]
本研究では,不確実な状態の空間的相関障害を有するナビゲーション環境であるSCOS(Correlated Obstacle Scene)問題を紹介する。
我々は,ブロック確率を洗練させるベイズ的信念更新を開発し,その後部を用いて探索空間を効率よく削減する。
このフレームワークは、敵の割り込みやクラスタ化された自然災害のある環境でのナビゲーション上の課題に対処する。
論文 参考訳(メタデータ) (2025-09-23T20:30:35Z) - Preference Elicitation for Offline Reinforcement Learning [59.136381500967744]
オフラインの嗜好に基づく強化学習アルゴリズムであるSim-OPRLを提案する。
本アルゴリズムは,配当外データに対する悲観的アプローチと,最適方針に関する情報的嗜好を得るための楽観的アプローチを用いる。
論文 参考訳(メタデータ) (2024-06-26T15:59:13Z) - ContraBAR: Contrastive Bayes-Adaptive Deep RL [22.649531458557206]
メタ強化学習(メタRL)では、エージェントが未知のタスクに直面するときの最適なポリシーであるベイズ最適ポリシーを求める。
ベイズ最適行動の学習にコントラスト法が有効かどうかを検討する。
本稿では,変分的信念推論の代わりにコントラスト的予測符号化(CPC)を用いる単純なメタRLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-06-04T17:50:20Z) - Offline Reinforcement Learning with Adaptive Behavior Regularization [1.491109220586182]
オフライン強化学習(RL)は、静的で以前に収集されたデータセットからポリシーを学習する、サンプル効率のよい学習パラダイムを定義する。
適応行動正規化(Adaptive Behavior regularization, ABR)と呼ばれる新しい手法を提案する。
ABRは、データセットの生成に使用するポリシーのクローン化と改善の間に、ポリシーの最適化目標を適応的に調整することを可能にする。
論文 参考訳(メタデータ) (2022-11-15T15:59:11Z) - Multi-Objective SPIBB: Seldonian Offline Policy Improvement with Safety
Constraints in Finite MDPs [71.47895794305883]
オフライン強化学習環境における制約下での安全政策改善(SPI)の問題について検討する。
本稿では,異なる報酬信号に対するトレードオフを扱うアルゴリズムのユーザの好みを考慮した,このRL設定のためのSPIを提案する。
論文 参考訳(メタデータ) (2021-05-31T21:04:21Z) - Scalable Bayesian Inverse Reinforcement Learning [93.27920030279586]
我々はAVRIL(Adroximate Variational Reward Imitation Learning)を紹介する。
本手法は,逆強化学習問題の誤った性質に対処する。
本手法を従来の制御シミュレーションと並行して実際の医療データに適用し,現在の手法の範囲を超えた環境におけるベイズ報酬推論を実証する。
論文 参考訳(メタデータ) (2021-02-12T12:32:02Z) - Mixed Reinforcement Learning with Additive Stochastic Uncertainty [19.229447330293546]
強化学習 (Reinforcement Learning, RL) 法は、しばしば最適なポリシーを探索するための大規模な探索データに依存し、サンプリング効率の低下に悩まされる。
本稿では, 環境力学の2つの表現を同時に利用して, 最適ポリシーを探索する混合RLアルゴリズムを提案する。
混合RLの有効性は、非アフィン非線形系の典型的な最適制御問題によって実証される。
論文 参考訳(メタデータ) (2020-02-28T08:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。