論文の概要: Variance-Averse $n$-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments
- arxiv url: http://arxiv.org/abs/2610.07899v1
- Date: Tue, 06 Oct 2026 07:47:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.87318
- Title: Variance-Averse $n$-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments
- Title(参考訳): 疎長期環境に対する可変逆$n$-Stepオフライン強化学習
- Abstract要約: 生成的アクターは、複雑なアクション分布をモデル化する表現的ポリシークラスを有効にすることで、オフライン強化学習(RL)を変換している。
生成オフラインRLにおける信頼性の高い動作を促進するフレームワークであるVAN-Flowを提案する。
- 参考スコア(独自算出の注目度): 5.199454801210509
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative actors are transforming offline reinforcement learning (RL) by enabling expressive policy classes that model complex action distributions. However, this expressiveness also exposes a key challenge in heterogeneous datasets: generative policies can reproduce unreliable action modes whose return distributions exhibit high variance, occasionally yielding high returns by chance but lacking consistency. Consequently, maximizing the expected $Q$-value alone is insufficient for identifying reliable actions. We propose VAN-Flow (Variance-Averse $n$-step Flow), a framework that promotes reliable actions in generative offline RL. VAN-Flow combines (i) a categorical distributional critic, (ii) a variance-averse expectation operator that smoothly reweights atom probabilities to favor actions with both high returns and low dispersion, and (iii) a flow-matching generative actor guided via rejection sampling. Unlike CVaR or mean-variance objectives, the operator redistributes probability mass over the categorical return distribution without hard truncation or auxiliary penalty terms. Across more than 40 tasks from D4RL and OGBench, VAN-Flow consistently outperforms strong baselines, with the largest gains in long-horizon and high-variance regimes where reliable action selection becomes critical.
- Abstract(参考訳): 生成的アクターは、複雑なアクション分布をモデル化する表現的ポリシークラスを有効にすることで、オフライン強化学習(RL)を変換している。
しかし、この表現性はまた、異種データセットにおいて重要な課題を露呈している: 生成ポリシーは、戻り分布が高いばらつきを示す信頼できないアクションモードを再現することができ、時には偶然に高いリターンをもたらすが、一貫性に欠ける。
その結果、期待される$Q$-valueだけを最大化することは、信頼できるアクションを特定するには不十分である。
本稿では,VAN-Flow(Variance-Averse $n$-step Flow)を提案する。
VAN-Flow Combins
(i)分類的分布論者
二 原子の確率を円滑に重み付けし、高利得と低分散の両方の作用を好む分散逆期待演算子
三 拒絶サンプリングにより誘導されるフローマッチング生成アクター。
CVaRや平均分散の目的とは異なり、演算子はハードトランケーションや補助的なペナルティ項を使わずにカテゴリー的回帰分布上の確率質量を再分配する。
D4RLとOGBenchの40以上のタスクにおいて、VAN-Flowは強いベースラインを一貫して上回り、信頼性の高いアクション選択が重要となる長距離および高分散のレギュレーションにおいて最大の利益を上げている。
関連論文リスト
- Diffusion Reward Models [56.078040107894]
DRMはDiffusion Reward Modelで、$p(mathbfrmid x,y)$以上の条件密度推定として報酬モデルを再キャストする。
単一のアーキテクチャは、多属性回帰とペアワイズ選好データの両方を処理し、$N$サンプルでの推論は、スカラー、分散、量子化に集約できる経験的な報酬分布を形成する。
5つのベンチマークで、DRMは一致したデータとバックボーンの下でベースラインにマッチまたはオーバーし、より大きな差別的、分布的、生成的RMと競争し続け、従来のヘッドを持つマルチモーダル報酬構造を回復する。
論文 参考訳(メタデータ) (2026-09-27T17:57:14Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching [34.44050784146993]
PowerFlowは、教師なしの微調整を分散マッチング問題として再構成する、原則化されたフレームワークである。
$$-powerディストリビューションをターゲットとすることで、PowerFlowは、大規模言語モデルの2つの性質の方向性を引き出すことができる。
論文 参考訳(メタデータ) (2026-03-19T00:00:36Z) - Robust Regularized Policy Iteration under Transition Uncertainty [6.7431287237221085]
我々は、オフラインRLをロバストなポリシー最適化として定式化し、遷移カーネルを不確実性集合内の決定変数として扱う。
本稿では、抽出可能な最大最小二レベル目標を、抽出可能なKL正規化サロゲートに置き換えるロバスト正規化ポリシーイテレーション(RRPI)を提案する。
D4RLベンチマークの実験では、RRPIは高い平均性能を示し、最近のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-10T08:18:27Z) - Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling [49.41422138354821]
非負の因子分析をBradley-Terry選好モデルに統合する原理的報酬モデリングフレームワークを提案する。
BNRMは、スパースで非負の潜在因子生成過程を通じて報酬を表す。
BNRMは報酬の過度な最適化を著しく軽減し、分布シフトによるロバスト性を改善し、強いベースラインよりも解釈可能な報酬分解をもたらすことを示す。
論文 参考訳(メタデータ) (2026-02-11T08:14:11Z) - Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies [4.249024052507976]
本稿では, 直接的対象サンプルを使わずに, 拡散・流動モデルの訓練問題に厳密に対処する, 逆流マッチング (RFM) の統一フレームワークを提案する。
逆推論の観点を採用することで、中間雑音サンプルが与えられた後部平均推定問題としてトレーニング対象を定式化する。
このクラスでは,既存の雑音予測法と勾配探索法が2つの具体例であることを示す。
論文 参考訳(メタデータ) (2026-01-13T01:58:24Z) - Offline Meta-Reinforcement Learning with Flow-Based Task Inference and Adaptive Correction of Feature Overgeneralization [12.107082786676907]
オフラインメタ強化学習(OMRL)は、オフラインRLにおける多様なデータセットからの学習の強みと、メタRLの新しいタスクへの適応性を組み合わせる。
既存の研究では、$Q$ネットワークの一般化がオフラインRLにおける外挿誤差に影響を与えることが示されている。
特徴分布をモデル化し,不確かさを推定することでOODサンプルを同定するFLORAを提案する。
論文 参考訳(メタデータ) (2026-01-12T03:16:07Z) - Unleashing Flow Policies with Distributional Critics [15.149475517073258]
本稿では、状態-動作の戻りの完全な分布を学習する新しい批判的アーキテクチャであるDis Distributional Flow Critic (DFC)を紹介する。
DFCは、より安定的で情報的な学習信号を提供する、豊かで分散的なベルマンターゲットを備えた表現力のあるフローベースのポリシーを提供する。
論文 参考訳(メタデータ) (2025-09-27T03:51:06Z) - Policy Evaluation in Distributional LQR [70.63903506291383]
ランダムリターンの分布を閉形式で表現する。
この分布は有限個の確率変数で近似できることを示す。
近似回帰分布を用いて,リスク・アバースLQRに対するゼロ階ポリシー勾配アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-23T20:27:40Z) - Dual Generator Offline Reinforcement Learning [90.05278061564198]
オフラインのRLでは、学習したポリシーをデータに近づき続けることが不可欠である。
実際には、GANベースのオフラインRL法は代替手法と同様に実行されていない。
2つのジェネレータを持つことにより、有効なGANベースのオフラインRL法が実現されるだけでなく、サポート制約を近似することも示している。
論文 参考訳(メタデータ) (2022-11-02T20:25:18Z) - Distributional Reinforcement Learning for Multi-Dimensional Reward
Functions [91.88969237680669]
多次元分布DQN(MD3QN)を導入し、複数の報酬源からの共振分布をモデル化する。
関節分布モデリングの副産物として、MD3QNは各報酬源に対するリターンのランダム性を捉えることができる。
実験では,リッチな相関型報酬関数を持つ環境下での連立戻り分布を精度良くモデル化した。
論文 参考訳(メタデータ) (2021-10-26T11:24:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。