論文の概要: Constrained Flow Policy Updates: A Generalized Schrödinger Bridge View
- arxiv url: http://arxiv.org/abs/2609.32952v1
- Date: Sat, 26 Sep 2026 21:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 11:41:20.994533
- Title: Constrained Flow Policy Updates: A Generalized Schrödinger Bridge View
- Title(参考訳): Constrained Flow Policy Updates: A Generalized Schrödinger Bridge View
- Abstract要約: 逆戻りと安全性は、単一の最適動作分布を誘導することができる。
エネルギーを付加したReGymized Augmented-Lagrangian Flow Actorを提案する。
ノイズとして、最適値は最小エネルギー目標の値に収束する。
- 参考スコア(独自算出の注目度): 2.8912413740517757
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online safe reinforcement learning (RL) seeks policies that maximize reward while satisfying safety constraints. Reward and safety can induce multimodal action distributions, challenging the prevailing primal-dual methods: Gaussian actors may collapse onto a single suboptimal mode, and optimization over the nonconvex Lagrangian landscape can be unstable. Diffusion and flow policies can represent such distributions, but recent work with a diffusion actor relies on estimating and matching the score of an augmented-Lagrangian target policy. Instead, we differentiate the augmented objective directly through the generation path of a flow policy, so no score needs to be estimated. Because a flow policy lacks a readily available action log-density for entropy regularization, we build on the density-free kinetic-energy regularizer of FLAC, a recent reward-only method, and propose Reparameterized Augmented-Lagrangian Flow Actor with Least Energy (RAFALE), an off-policy actor-critic method for safe RL. We formulate its update as a constrained one-ended generalized Schrödinger bridge and show that, for each source draw, this path-space problem is exactly an entropy-regularized problem in action space. At positive noise, its solution reweights the reward-only action distribution only where the estimated cost exceeds a threshold set by the Lagrange multiplier. As the noise vanishes, the optimal value converges to that of a least-energy map objective that the flow policy optimizes directly. Across seven Safety-Gymnasium tasks, RAFALE achieves competitive reward with mean final cost within budget on every task, whereas strong baselines trade one for the other; ablations support the necessity of both its augmented objective and its flow actor.
- Abstract(参考訳): オンライン安全強化学習(RL)は、安全制約を満たしつつ報酬を最大化する政策を模索している。
ガウス的アクターは1つの準最適モードに崩壊し、非凸ラグランジュ的ランドスケープの最適化は不安定である。
拡散と流れのポリシーはそのような分布を表すことができるが、近年の拡散アクターによる研究は、拡張ラグランジュ的ターゲットポリシーのスコアを推定し、一致させることに依存している。
代わりに、フローポリシーの生成経路を介して、拡張目標を直接区別するので、スコアを見積もる必要はありません。
フローポリシにはエントロピー正則化のための容易なアクションログ密度が欠けているため,近年の報酬のみのFLACの密度自由運動エネルギー正則化を基盤として,安全RLのための非政治アクター批判手法であるRAFALE(Reparameterized Augmented-Lagrangian Flow Actor with Least Energy)を提案する。
我々は、その更新を制約付き一方向一般化シュレーディンガーブリッジとして定式化し、各ソースドローに対して、この経路空間問題は、作用空間におけるエントロピー正規化問題であることを示す。
正の雑音では、その解は、推定コストがラグランジュ乗算器によって設定された閾値を超える場合にのみ、報酬のみの作用分布を再重み付けする。
ノイズが消えると、最適値は、フローポリシーが直接最適化する最小エネルギーマップの目的の値に収束する。
RAFALEは7つのセーフティ・ジムナシウム・タスクの中で、全てのタスクにおいて平均的な最終コストで競争的な報酬を得る一方、強いベースラインは他方で1つを取引し、アブレーションはその強化目標とフローアクターの両方の必要性を支持している。
関連論文リスト
- FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning [63.80677039120727]
FlowR2Aは、スコアリングに基づく手法の厳密な監督と、単一の生成モデルによるアンカーベースの手法の提案を統一する。
ソフトプログレッシブ目標に対するハードセーフティ制約のバランスをとるために, 微粒度毎の報奨条件と報奨雑音の増大を導入する。
生成形式は、報酬誘導と固定サンプリングによる制御可能なテスト時間サンプリングをサポートし、高品質な提案を生成する。
論文 参考訳(メタデータ) (2026-06-23T07:21:36Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - Generative Actor-Critic with Soft Bridge Policies [19.121990264725028]
効果的なソフト生成ポリシーの訓練は、しばしば一緒に起こる2つの障害に直面します。
第一に、端的な作用密度はしばしば利用できないので、既存の方法は通常エントロピー境界、プロキシ、近似に依存する。
これらの障害は、単一のサンプル化されたアクターフォワードパスのみをアクション生成に必要としながら、抽出可能なMaxEnt目標を公開する生成ポリシーを求める動機となります。
論文 参考訳(メタデータ) (2026-05-09T06:36:32Z) - Global Optimality for Constrained Exploration via Penalty Regularization [28.060709233558654]
現実世界の探索は、しばしば客観的な制約によって制約された性質によって悪用される。
本稿では,一般凸擬ペナルティ正規化を実施するポリシグラディエント手法を提案する。
論文 参考訳(メタデータ) (2026-04-30T17:31:46Z) - Flow Matching Policy with Entropy Regularization [16.47598359293598]
Flow Matching Policy with Entropy Regularization (FMER)は、通常の微分方程式(ODE)ベースのオンラインRLフレームワークである。
FMERは、フローマッチングを通じてポリシーをパラメータ化し、最適な輸送によって動機付けられたストレートな確率経路に沿ってアクションをサンプリングする。
スパースマルチゴールのFrankaKitchenベンチマークの実験は、FMERが最先端の手法より優れていることを示した。
論文 参考訳(メタデータ) (2026-03-18T13:00:20Z) - Dichotomous Diffusion Policy Optimization [46.51375996317989]
DIPOLEは、安定かつ制御可能な拡散ポリシー最適化のために設計された新しいRLアルゴリズムである。
また、DIPOLEを使用して、エンドツーエンドの自動運転のための大規模なビジョン言語アクションモデルをトレーニングしています。
論文 参考訳(メタデータ) (2025-12-31T16:56:56Z) - Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time
Guarantees [56.848265937921354]
逆強化学習(IRL)は報酬関数と関連する最適ポリシーを回復することを目的としている。
IRLの多くのアルゴリズムは本質的にネスト構造を持つ。
我々は、報酬推定精度を損なわないIRLのための新しいシングルループアルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-10-04T17:13:45Z) - Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds
Globally Optimal Policy [95.98698822755227]
本研究は,リスクに敏感な深層強化学習を,分散リスク基準による平均報酬条件下で研究する試みである。
本稿では,ポリシー,ラグランジュ乗算器,フェンシェル双対変数を反復的かつ効率的に更新するアクタ批判アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-12-28T05:02:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。