論文の概要: Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.08202v1
- Date: Wed, 06 May 2026 01:21:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.459275
- Title: Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
- Title(参考訳): ペナライゼーションを超えて:オフライン強化学習における拡散に基づくアウト・オブ・ディストリビューション検出と選択正規化
- Abstract要約: 我々は,一様ペナル化を超える新しい枠組みであるDOSER(Diffusion-based OOD Detection and Selective Regularization)を提案する。
本稿では,DOSERが従来手法よりも優れた性能を発揮することを示す。
- 参考スコア(独自算出の注目度): 29.019573695533563
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Offline reinforcement learning (RL) faces a critical challenge of overestimating the value of out-of-distribution (OOD) actions. Existing methods mitigate this issue by penalizing unseen samples, yet they fail to accurately identify OOD actions and may suppress beneficial exploration beyond the behavioral support. Although several methods have been proposed to differentiate OOD samples with distinct properties, they typically rely on restrictive assumptions about the data distribution and remain limited in discrimination ability. To address this problem, we propose DOSER (Diffusion-based OOD Detection and Selective Regularization), a novel framework that goes beyond uniform penalization. DOSER trains two diffusion models to capture the behavior policy and state distribution, using single-step denoising reconstruction error as a reliable OOD indicator. During policy optimization, it further distinguishes between beneficial and detrimental OOD actions by evaluating predicted transitions, selectively suppressing risky actions while encouraging exploration of high-potential ones. Theoretically, we prove that DOSER is a $γ$-contraction and therefore admits a unique fixed point with bounded value estimates. We further provide an asymptotic performance guarantee relative to the optimal policy under model approximation and OOD detection errors. Across extensive offline RL benchmarks, DOSER consistently attains superior performance to prior methods, especially on suboptimal datasets.
- Abstract(参考訳): オフライン強化学習(RL)は、アウト・オブ・ディストリビューション(OOD)行動の価値を過大評価する重要な課題に直面している。
既存の方法では、未確認サンプルをペナルティ化することでこの問題を軽減するが、OODのアクションを正確に識別することができず、行動支援以外の有益な探索を抑える可能性がある。
異なる性質を持つOODサンプルを識別するいくつかの方法が提案されているが、データ分布に関する限定的な仮定に依存しており、識別能力に制限がある。
この問題に対処するために,一様ペナル化を超える新しいフレームワークであるDOSER(Diffusion-based OOD Detection and Selective Regularization)を提案する。
DOSERは2つの拡散モデルを訓練し、信頼性の高いOOD指標として単一ステップの復調誤差を用いて行動ポリシーと状態分布をキャプチャする。
政策最適化の過程では、予測された遷移を評価し、リスクのある行動を選択的に抑制し、高ポテンシャルな行動の探索を奨励することで、利益と有害なOOD行動の区別をさらに進める。
理論的には、DOSER が$γ$-contract であることを証明する。
さらに、モデル近似およびOOD検出誤差の下での最適ポリシーに対する漸近的な性能保証を提供する。
大規模なオフラインRLベンチマーク全体において、DOSERは、特に最適なデータセットにおいて、先行メソッドよりも一貫して優れたパフォーマンスを達成している。
関連論文リスト
- Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking [78.69179041551014]
本稿では,インフォメーション・ボトルネックの原理に基づく情報理論報酬モデリングフレームワークを提案する。
InfoRMは、報酬の一般化を緩和するために、嗜好に無関係な情報をフィルタリングする。
IBLは分散レベルの正規化であり、そのような偏差を罰し、最適化の展望を効果的に拡張する。
論文 参考訳(メタデータ) (2025-10-15T15:51:59Z) - Polysemantic Dropout: Conformal OOD Detection for Specialized LLMs [35.326974180503065]
特殊大言語モデル(LLM)のための新しい推定時間外ドメイン検出アルゴリズムを提案する。
LLMの多意味性と冗長性に関する最近の知見により、ドメイン内入力はOOD入力よりも高いドロップアウト耐性を示すと仮定した。
有効なアンサンブルアプローチにより,複数の層にまたがるドロップアウト耐性を集約し,ICADの理論的誤報境界を維持しつつ検出を改善した。
論文 参考訳(メタデータ) (2025-09-04T20:50:51Z) - Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization [23.817251267022847]
本稿では,過度な最適化問題を緩和するために,行動対応型政策最適化(BSPO)手法を提案する。
BSPOは強化学習過程におけるOOD反応の発生を減少させる。
実験の結果,BSPOは報酬過度最適化の防止においてベースラインよりも優れていた。
論文 参考訳(メタデータ) (2025-03-23T16:20:59Z) - Margin-bounded Confidence Scores for Out-of-Distribution Detection [2.373572816573706]
本稿では,非自明なOOD検出問題に対処するため,Margin bounded Confidence Scores (MaCS) と呼ばれる新しい手法を提案する。
MaCS は ID と OOD のスコアの差を拡大し、決定境界をよりコンパクトにする。
画像分類タスクのための様々なベンチマークデータセットの実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2024-09-22T05:40:25Z) - Model-free Test Time Adaptation for Out-Of-Distribution Detection [62.49795078366206]
我々はtextbfDistribution textbfDetection (abbr) のための非パラメトリックテスト時間 textbfAdaptation フレームワークを提案する。
Abbrは、オンラインテストサンプルを使用して、テスト中のモデル適応、データ分散の変更への適応性を向上させる。
複数のOOD検出ベンチマークにおける包括的実験により,abrの有効性を示す。
論文 参考訳(メタデータ) (2023-11-28T02:00:47Z) - LINe: Out-of-Distribution Detection by Leveraging Important Neurons [15.797257361788812]
本稿では,分布内データとOODデータ間のモデル出力の差を解析するための新しい側面を紹介する。
本稿では,分布検出のポストホックアウトのための新しい手法であるLINe( Leveraging Important Neurons)を提案する。
論文 参考訳(メタデータ) (2023-03-24T13:49:05Z) - Anti-Exploration by Random Network Distillation [63.04360288089277]
ランダムネットワーク蒸留 (RND) の条件付けは, 不確実性推定器として用いるのに十分な識別性がないことを示す。
この制限は、FiLM(Feature-wise Linear Modulation)に基づく条件付けによって回避できることを示す。
D4RLベンチマークで評価したところ、アンサンブルベースの手法に匹敵する性能を達成でき、アンサンブルのない手法よりも広いマージンで性能を向上できることがわかった。
論文 参考訳(メタデータ) (2023-01-31T13:18:33Z) - Free Lunch for Generating Effective Outlier Supervision [46.37464572099351]
本稿では, ほぼ現実的な外乱監視を実現するための超効率的な手法を提案する。
提案したtextttBayesAug は,従来の方式に比べて偽陽性率を 12.50% 以上削減する。
論文 参考訳(メタデータ) (2023-01-17T01:46:45Z) - How to Enable Uncertainty Estimation in Proximal Policy Optimization [20.468991996052953]
既存の不確実性推定手法は, 都市深部RLで広く採用されていない。
本稿では,アクタ・クリティカルRLアルゴリズムにおける不確実性とOODの定義を提案する。
本稿では,最近提案されたMasksemblesの手法が,調査手法間で好適なバランスをとることを実験的に示す。
論文 参考訳(メタデータ) (2022-10-07T15:56:59Z) - Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement
Learning [125.8224674893018]
オフライン強化学習(RL)は、環境を探索することなく、以前に収集したデータセットからポリシーを学ぶことを目的としている。
オフポリシーアルゴリズムをオフラインRLに適用することは、通常、オフ・オブ・ディストリビューション(OOD)アクションによって引き起こされる外挿エラーによって失敗する。
本稿では,PBRL(Pepsimistic Bootstrapping for offline RL)を提案する。
論文 参考訳(メタデータ) (2022-02-23T15:27:16Z) - False Correlation Reduction for Offline Reinforcement Learning [115.11954432080749]
本稿では,実効的かつ理論的に証明可能なアルゴリズムであるオフラインRLに対するfalSe Correlation Reduction (SCORE)を提案する。
SCOREは、標準ベンチマーク(D4RL)において、様々なタスクにおいて3.1倍の高速化でSoTA性能を達成することを実証的に示す。
論文 参考訳(メタデータ) (2021-10-24T15:34:03Z) - On the Practicality of Deterministic Epistemic Uncertainty [106.06571981780591]
決定論的不確実性法(DUM)は,分布外データの検出において高い性能を達成する。
DUMが十分に校正されており、現実のアプリケーションにシームレスにスケールできるかどうかは不明だ。
論文 参考訳(メタデータ) (2021-07-01T17:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。