論文の概要: Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation
- arxiv url: http://arxiv.org/abs/2607.19199v1
- Date: Tue, 21 Jul 2026 15:34:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.476418
- Title: Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation
- Title(参考訳): 不確実性推定におけるオフラインRLの保守的クエリと適応正規化
- Abstract要約: アクション優先クエリは、追加の環境インタラクションなしで専門家のフィードバックを活用することで、オフライントレーニング時のポリシー改善を可能にする。
現在のアプローチは、ポリシーアクションとクエリ選択のためのデータセットアクションの間の距離にのみ依存しています。
不確実性推定に基づく保守的クエリと適応正規化を提案する。
- 参考スコア(独自算出の注目度): 30.50829492427299
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline reinforcement learning (RL) aims to learn an effective policy from a static dataset, but its performance is fundamentally limited by dataset coverage. Action preference queries leverage expert feedback without additional environment interaction, enabling policy improvement during offline training. However, existing methods still face two key challenges: selecting informative preference queries and effectively exploiting the collected feedback. Current approaches typically rely only on the distance between policy actions and dataset actions for query selection, while enforcing fixed constraints that keep the policy close to queried preferences. Such strategies often lead to unstable policy updates and integrate poorly with value regularization. To address these limitations, we propose Conservative Query and Adaptive Regularization under Uncertainty Estimation, a lightweight framework that jointly improves preference querying and preference exploitation. Specifically, we employ a Morse network to estimate the uncertainty of policy actions with respect to the offline dataset. Based on this uncertainty, we introduce a conservative query strategy that selectively queries actions near the dataset to preserve Bellman-update stability, together with an uncertainty-aware adaptive regularization scheme that dynamically adjusts data-level constraints during policy optimization. We integrate our framework with CQL and evaluate it extensively on the D4RL benchmark. Experimental results demonstrate superior or competitive performance across a wide range of tasks.
- Abstract(参考訳): オフライン強化学習(RL)は、静的データセットから効果的なポリシを学ぶことを目的としているが、そのパフォーマンスはデータセットカバレッジによって根本的に制限されている。
アクション優先クエリは、追加の環境インタラクションなしで専門家のフィードバックを活用することで、オフライントレーニング時のポリシー改善を可能にする。
しかし、既存の方法は情報的嗜好クエリの選択と、収集したフィードバックを効果的に活用する2つの主要な課題に直面している。
現在のアプローチは一般的に、クエリ選択のためのポリシーアクションとデータセットアクションの間の距離にのみ依存します。
このような戦略はしばしば不安定なポリシー更新をもたらし、価値の正規化と不十分に統合される。
これらの制約に対処するため,不確実性推定に基づく保守的クエリと適応正規化を提案する。
具体的には、オフラインデータセットに対するポリシーアクションの不確実性を推定するために、モースネットワークを用いる。
この不確実性に基づいて、ベルマン更新安定性を維持するためにデータセット近傍のアクションを選択的にクエリする保守的なクエリ戦略と、ポリシー最適化中にデータレベルの制約を動的に調整する不確実性対応型適応正規化スキームを導入する。
当社のフレームワークをCQLに統合し、D4RLベンチマークで広く評価しています。
実験結果は、幅広いタスクにおいて、優れた、または競争的なパフォーマンスを示す。
関連論文リスト
- ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation [20.162114513881118]
オフライン強化学習(RL)は、環境の相互作用を伴わずに行動ポリシーによって生成された固定データセットから最適なポリシーを学ぶことを目的としている。
構築による制約の少ないサポート制約を強制するフローポリシーに基づくオフラインRL手法であるReFORMを提案する。
論文 参考訳(メタデータ) (2026-02-04T21:03:11Z) - Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning [52.03884701766989]
オフライン強化学習(RL)アルゴリズムは、通常、アクション選択に制約を課す。
本稿では,Bellmanターゲットにおける行動選択を,データセットアクションの近傍の結合に制限する新しい地区制約を提案する。
我々は,この制約を満たす目標動作を用いてQ学習を行うための,単純で効果的なアルゴリズムであるAdaptive Neighborhood-Constrained Q Learning(ANQ)を開発した。
論文 参考訳(メタデータ) (2025-11-04T13:42:05Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL [36.65926744075032]
オフライン強化学習のための選択的状態適応正規化法を提案する。
提案手法はオフラインとオフラインの両方で最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-05-26T12:45:54Z) - An Efficient Continuous Control Perspective for Reinforcement-Learning-based Sequential Recommendation [14.506332665769746]
本稿では,UnderlinetextbfEfficient UnderlinetextbfContinuous UnderlinetextbfControl framework (ECoC)を提案する。
まず、統計的に検証された仮定に基づいて、正規化されたユーザとアイテム空間から抽象化された新しい統一されたアクション表現を提案する。
このプロセスでは、統合された行動の観点から戦略的な探索と方向性の制御が慎重に設計され、最終的な勧告決定に不可欠である。
論文 参考訳(メタデータ) (2024-08-15T09:26:26Z) - Offline Imitation Learning with Suboptimal Demonstrations via Relaxed
Distribution Matching [109.5084863685397]
オフライン模倣学習(IL)は、環境と相互作用することなく、事前にコンパイルされたデモからパフォーマンスポリシーを学習する機能を提供する。
非対称な f-分割を明示的なサポート正規化に用いたRelaxDICEを提案する。
提案手法は,6つの標準連続制御環境において,最上位のオフライン手法を著しく上回っている。
論文 参考訳(メタデータ) (2023-03-05T03:35:11Z) - Hallucinated Adversarial Control for Conservative Offline Policy
Evaluation [64.94009515033984]
本研究では,環境相互作用のオフラインデータセットが与えられた場合,政策のパフォーマンスを低く抑えることを目的とした,保守的非政治評価(COPE)の課題について検討する。
本稿では,遷移力学の不確実性を考慮した学習モデルに基づくHAMBOを紹介する。
結果のCOPE推定値が妥当な下界であることを証明し、正則性条件下では、真に期待された戻り値への収束を示す。
論文 参考訳(メタデータ) (2023-03-02T08:57:35Z) - Mutual Information Regularized Offline Reinforcement Learning [76.05299071490913]
我々は、データセットにおける状態と行動間の相互情報の観点から、オフラインRLにアプローチする新しいMISAフレームワークを提案する。
この下位境界の最適化は、オフラインデータセット上での一段階改善されたポリシーの可能性の最大化と等価であることを示す。
MISAの3つの異なる変種を導入し、より厳密な相互情報によりオフラインのRL性能が向上することを示した。
論文 参考訳(メタデータ) (2022-10-14T03:22:43Z) - COptiDICE: Offline Constrained Reinforcement Learning via Stationary
Distribution Correction Estimation [73.17078343706909]
オフラインの制約付き強化学習(RL)問題。エージェントは、所定のコスト制約を満たしながら期待されるリターンを最大化するポリシーを計算し、事前に収集されたデータセットからのみ学習する。
定常分布空間におけるポリシーを最適化するオフライン制約付きRLアルゴリズムを提案する。
我々のアルゴリズムであるCOptiDICEは、コスト上限を制約しながら、利益に対する最適政策の定常分布補正を直接見積もる。
論文 参考訳(メタデータ) (2022-04-19T15:55:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。