論文の概要: Generalization in offline RL: The structure is more important than the amount of pessimism
- arxiv url: http://arxiv.org/abs/2607.02288v2
- Date: Thu, 09 Jul 2026 10:53:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 16:54:55.146962
- Title: Generalization in offline RL: The structure is more important than the amount of pessimism
- Title(参考訳): オフラインRLにおける一般化: 構造は悲観的量よりも重要である
- Authors: Max Weltevrede, Matthijs T. J. Spaan, Wendelin Böhmer,
- Abstract要約: 一般化の成功は悲観論の量に依らず、悲観的構造が最適解の基本的な対称性を尊重するかどうかを論じる。
オフラインRLでは、悲観的構造はデータセットのカバレッジ構造によって決定される。
- 参考スコア(独自算出の注目度): 7.113264621282311
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While pessimism counteracts overestimation bias in offline reinforcement learning (RL), being overly conservative has been associated with hindering certain forms of generalization. However, in this paper we demonstrate that being overly pessimistic does not inherently prevent optimal generalization in contextual MDPs (CMDPs). Instead, we argue successful generalization depends not on the amount of pessimism, but whether the pessimistic structure respects the underlying symmetries of the optimal solution. We prove that a mildly pessimistic, non-symmetric value function can generalize worse than an overly pessimistic, symmetric one. In offline RL, the structure of the pessimism is determined by the structure of the dataset coverage. As such, enforcing a symmetric value function can be non-trivial, and might require techniques such as data augmentation (DA). Inspired by our theoretical results, we argue that DA can best be applied through a consistency loss during policy extraction, rather than the common practice of (regular) offline training on an augmented dataset. This is empirically validated using IQL and CQL on a rotationally symmetric reacher environment.
- Abstract(参考訳): 悲観主義は、オフライン強化学習(RL)における過大評価バイアスに対処するが、過度に保守的であることは、ある種の一般化を妨げることに関係している。
しかし,本稿では,過度に悲観的であることは,文脈的MDP(CMDP)の最適一般化を本質的に防ぐものではないことを実証する。
代わりに、成功した一般化は悲観論の量に依らず、悲観的構造が最適解の根底にある対称性を尊重するかどうかを論じる。
我々は、軽度悲観的で非対称な値関数が過度に悲観的で対称な関数よりもより良く一般化できることを証明した。
オフラインRLでは、悲観的構造はデータセットのカバレッジ構造によって決定される。
したがって、対称値関数の強制は非自明であり、データ拡張(DA)のような技術を必要とする可能性がある。
理論的な結果から着想を得たDAは、拡張データセット上での(正規の)オフライントレーニングの一般的な実践よりも、ポリシー抽出時の一貫性損失を通じて適用できると論じる。
これは、回転対称リーチ環境において、IQLとCQLを使用して実証的に検証される。
関連論文リスト
- Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability [64.97610656176981]
LLMポストトレーニングでは、教師付き微調整(SFT)が記憶し、強化学習(RL)が一般化される。
我々は、長いチェーン・オブ・シークレット(CoT)の監督でSFTを推論するこの主張を再考し、クロスドメインの一般化は欠落ではなく条件付きであることを見出した。
論文 参考訳(メタデータ) (2026-04-08T03:11:16Z) - Statistical-Geometric Degeneracy in UAV Search: A Physics-Aware Asymmetric Filtering Approach [23.49656058107753]
無人航空機 (UAV) を用いた災害後の生存者の移動は、基本的な物理的課題に直面している。
標準ガウスノイズとは異なり、破片からの信号反射は厳密に非負の範囲バイアスをもたらす。
既存のロバストな推定器は一般に対称損失関数で設計され、暗黙的に誤差対称性の仮定に依存する。
我々はNLOSバイアスの非負の物理先行を明示的に組み込んだ物理基底解 AsymmetricHuberEKF を提案する。
論文 参考訳(メタデータ) (2026-02-11T08:33:56Z) - Oracle-Efficient Pessimism: Offline Policy Optimization in Contextual
Bandits [82.28442917447643]
悲観的OPOのための最初の一般オラクル効率アルゴリズムを提案する。
従来の悲観的アプローチと類似した統計的保証を得る。
我々は多種多様な構成の非正規化OPOに対して優位性を示す。
論文 参考訳(メタデータ) (2023-06-13T17:29:50Z) - Policy learning "without" overlap: Pessimism and generalized empirical Bernstein's inequality [94.89246810243053]
本論文は,事前収集した観測値を利用して最適な個別化決定規則を学習するオフライン政策学習について検討する。
既存の政策学習法は、一様重なりの仮定、すなわち、全ての個々の特性に対する全ての作用を探索する正当性は、境界を低くしなければならない。
我々は,点推定の代わりに低信頼度境界(LCB)を最適化する新しいアルゴリズムであるPPLを提案する。
論文 参考訳(メタデータ) (2022-12-19T22:43:08Z) - Optimizing Pessimism in Dynamic Treatment Regimes: A Bayesian Learning
Approach [6.7826352751791985]
本稿では,オフライン環境における最適動的処理系のための,悲観的に基づく新しいベイズ学習法を提案する。
我々は悲観主義の原理をトンプソンサンプリングとベイズ機械学習と統合し、悲観主義の度合いを最適化する。
本研究では,高効率かつスケーラブルな変分推論に基づく計算アルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-10-26T02:14:10Z) - Where is the Grass Greener? Revisiting Generalized Policy Iteration for
Offline Reinforcement Learning [81.15016852963676]
オフラインRL体制における最先端のベースラインを、公正で統一的で高分解能なフレームワークの下で再実装する。
与えられたベースラインが、スペクトルの一方の端で競合する相手よりも優れている場合、他方の端では決してしないことを示す。
論文 参考訳(メタデータ) (2021-07-03T11:00:56Z) - Bellman-consistent Pessimism for Offline Reinforcement Learning [46.97637726255375]
一般関数近似に対するベルマン一貫性悲観論の概念を導入する。
我々の理論的な保証は、探索的な設定において標準としてベルマン閉性を必要とするだけである。
論文 参考訳(メタデータ) (2021-06-13T05:50:36Z) - Is Pessimism Provably Efficient for Offline RL? [104.00628430454479]
優先度を収集したデータセットに基づいて最適なポリシーを学ぶことを目的としたオフライン強化学習(RL)について検討する。
ペナルティ関数として不確かさ量化器を組み込んだ値反復アルゴリズム(pevi)の悲観的変種を提案する。
論文 参考訳(メタデータ) (2020-12-30T09:06:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。