論文の概要: NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL
- arxiv url: http://arxiv.org/abs/2607.07855v1
- Date: Wed, 08 Jul 2026 18:33:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.321481
- Title: NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL
- Title(参考訳): NFTR: オフラインゴールコンディションRLにおける予測モード平均化から測地的サブゴール選択
- Authors: Erdemt Bao, Xing Lei, Jun Chen,
- Abstract要約: NFTR (Normalizing Flows subgoal Policy with Triangle-Slack Reweighting) を提案する。
条件付き正規化フローはガウスの方針に置き換わり、クローズドフォームのモード改善の結果は、NFをAWRに基づくサブゴール選択の最小生成クラスとして識別する。
トライアングル・スラックは、決定論的MDPにおける測地学において消滅し、動的条件下での可観測性違反に対する保守的な上限のままである。
- 参考スコア(独自算出の注目度): 6.900016632510229
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hierarchical Implicit Q-Learning (HIQL), an offline goal-conditioned RL method, selects subgoals by value-function advantages alone. This rule has two coupled failure modes. Optimistic bias treats lucky stochastic outcomes as skillful choices, and mode collapse reduces a multi-modal subgoal distribution to a single Gaussian mean that often falls in unreachable regions. We propose NFTR (Normalizing Flows subgoal policies with Triangle-slack Reweighting). A conditional Normalizing Flow replaces the Gaussian policy, and a closed-form mode-averaging result identifies NFs as the minimal generative class for AWR-based subgoal selection. A triangle slack score, built on the architectural triangle inequality without relying on distance accuracy, multiplicatively corrects the AWR weight to downweight subgoals whose detour cost exceeds average reachability. Triangle-slack vanishes on geodesics in deterministic MDPs and remains a conservative upper bound on composability violation under stochastic dynamics. The RWDR objective preserves AWR's population-level monotonic improvement and admits a three-term suboptimality decomposition. Together, these two ingredients yield subgoal selection that provably avoids the Gaussian collapse described above and remains stable under stochastic dynamics. GitHub page: https://github.com/erdemtbao/NFTR
- Abstract(参考訳): Hierarchical Implicit Q-Learning (HIQL) はオフラインのゴール条件付きRL法であり、値関数の利点だけでサブゴールを選択する。
このルールには2つの障害モードがある。
最適化バイアスは、運のよい確率的な結果を巧妙な選択として扱い、モード崩壊は、しばしば到達不可能な領域に落ちる単一のガウス平均にマルチモーダルなサブゴール分布を減少させる。
NFTR (Normalizing Flows subgoal Policy with Triangle-Slack Reweighting)を提案する。
条件付き正規化フローはガウスの方針に置き換わり、クローズドフォームのモード改善の結果は、NFをAWRに基づくサブゴール選択の最小生成クラスとして識別する。
三角形のスラックスコアは、設計上の三角形の不等式に基づいて、距離の正確さに頼らず、AWR重量を平均到達度を超える低重量のサブゴールに乗じて補正する。
トライアングル・スラックは、決定論的MDPにおける測地学において消滅し、確率力学の下で構成可能性違反に保守的な上限を保っている。
RWDRの目的は、AWRの集団レベルのモノトニック改善を保存し、3つの長期的準最適分解を認めることである。
これら2つの成分は、上述したガウス崩壊を確実に回避し、確率力学の下で安定なサブゴール選択をもたらす。
GitHubページ:https://github.com/erdemtbao/NFTR
関連論文リスト
- Data-driven sparse identification of governing PDEs via knockoff filters and multi-criteria trade-offs [4.876446735726356]
KO-PDE-IDENTは、擬似偏微分方程式(PDE)を偽発見率(FDR)制御で識別するフレームワークである。
この問題に対処するため、KO-PDE-IDENTは当初、モデル-Xノックオフフィルタによる潜在的な候補項のサポートセットをマイニングする。
重騒音下での5種類の標準PDEに対するKO-PDE-IDENTの有効性を検証した。
論文 参考訳(メタデータ) (2026-05-26T07:07:23Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Direct Bethe Free Energy Minimization for Bayesian Neural Network [0.0]
我々は,変分下界を最大化するのではなく,Bethe自由エネルギーを直接最小化してベイズニューラルネットワークを訓練することを提案する。
木構造因子グラフ上では、Bethe自由エネルギーは正確であり、決定論的層は目的から外れ、標準のバックプロパゲーションによって訓練される。
すべての変種は、アンサンブルやサンプリングベースの手法とは対照的に、MAP等価な推論コストで閉形式予測を許容する。
論文 参考訳(メタデータ) (2026-05-08T20:12:48Z) - Regularized Online RLHF with Generalized Bilinear Preferences [68.44113000390544]
一般的な嗜好を伴う文脈的オンラインRLHFの問題を考える。
一般化された双線形選好モデルを用いて、低ランクなスキュー対称行列による選好を捉える。
グリーディポリシーの双対ギャップは推定誤差の正方形によって有界であることを示す。
論文 参考訳(メタデータ) (2026-02-26T15:27:53Z) - Auto-Encoding Goodness of Fit [9.560668678348579]
We developed a new type of generative autoencoder called the Goodness-of-Fit Autoencoder (GoFAE)。
ミニバッチレベルでは、正規化の目的としてGoFテスト統計を使用する。
よりグローバルなレベルでは、より高い批判に基づいて正規化係数を選択する。
論文 参考訳(メタデータ) (2022-10-12T19:21:57Z) - Fast Batch Nuclear-norm Maximization and Minimization for Robust Domain
Adaptation [154.2195491708548]
ランダムに選択されたデータバッチの分類出力行列の構造について検討し,予測可能性と多様性について検討した。
本稿では,目標出力行列上で核ノルムを行い,目標予測能力を向上するBatch Nuclear-norm Maximization and Minimizationを提案する。
実験により,本手法は3つの典型的なドメイン適応シナリオにおいて適応精度とロバスト性を高めることができることが示された。
論文 参考訳(メタデータ) (2021-07-13T15:08:32Z) - Online and Distribution-Free Robustness: Regression and Contextual
Bandits with Huber Contamination [29.85468294601847]
線形回帰と文脈的帯域幅という2つの古典的高次元オンライン学習問題を再考する。
従来の手法が失敗した場合にアルゴリズムが成功することを示す。
論文 参考訳(メタデータ) (2020-10-08T17:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。