論文の概要: Generative Actor-Critic with Soft Bridge Policies
- arxiv url: http://arxiv.org/abs/2605.08733v1
- Date: Sat, 09 May 2026 06:36:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.844286
- Title: Generative Actor-Critic with Soft Bridge Policies
- Title(参考訳): ソフトブリッジによるアクター臨界生成
- Authors: Ke He, Le He, Shunpu Tang, Yafei Wang, Lisheng Fan,
- Abstract要約: 効果的なソフト生成ポリシーの訓練は、しばしば一緒に起こる2つの障害に直面します。
第一に、端的な作用密度はしばしば利用できないので、既存の方法は通常エントロピー境界、プロキシ、近似に依存する。
これらの障害は、単一のサンプル化されたアクターフォワードパスのみをアクション生成に必要としながら、抽出可能なMaxEnt目標を公開する生成ポリシーを求める動機となります。
- 参考スコア(独自算出の注目度): 19.121990264725028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Expressive generative policies such as diffusion and flow models are appealing for MaxEnt online reinforcement learning because of their ability to model multimodal and highly non-Gaussian action distributions. However, training effective soft generative policies faces two obstacles that often arise together. First, marginal action densities are often unavailable, so existing methods typically rely on entropy bounds, heuristic proxies or approximations. Second, iterative shared-parameter samplers raise inference cost and require backpropagation through time over repeated network evaluations, increasing memory cost and destabilizing policy optimization. These obstacles motivate us to seek a generative policy that exposes a tractable MaxEnt objective while requiring only a single sampled actor forward pass for action generation. To this end, we propose soft generative actor-critic (SoftGAC), whose actor defines a stochastic bridge from a fixed base latent to a terminal action latent in pre-tanh space. This structured bridge allows us to lift the MaxEnt objective as an analytically tractable path-wise relative-entropy objective against a high-entropy reference process. In practical finite-step implementation, this relative entropy reduces exactly to sampled transition control energy and thus provides principled soft regularization. Moreover, we keep the single-pass actor lightweight by using small step-specific bridge transitions, each evaluated only once per sampled action, while maintaining a parameter budget comparable to strong actor baselines. Extensive experiments on challenging continuous-control benchmarks show that SoftGAC attains higher or competitive returns than strong generative policy baselines, including diffusion and flow-matching policies, while staying in the low-latency regime of one-pass actors and showing considerable improvements in the compute-return tradeoff.
- Abstract(参考訳): 拡散や流れモデルといった表現豊かな生成ポリシーは、マルチモーダルおよび非ガウス的な行動分布をモデル化する能力から、MaxEntのオンライン強化学習にアピールしている。
しかし、効果的なソフト生成ポリシーの訓練は、しばしば一緒に起こる2つの障害に直面している。
第一に、端的な作用密度はしばしば利用できないので、既存の手法はエントロピー境界、ヒューリスティックなプロキシ、近似に依存している。
第2に、反復型共有パラメータサンプリングは推論コストを上昇させ、繰り返しネットワーク評価よりも時間の経過とともにバックプロパゲーションを必要とし、メモリコストを増大させ、ポリシーの最適化を安定化させる。
これらの障害は、単一のサンプル化されたアクターフォワードパスのみをアクション生成に必要としながら、抽出可能なMaxEnt目標を公開する生成ポリシーを求める動機となります。
そこで本研究では,アクターが固定ベース潜伏から終末アクション潜伏までの確率的ブリッジを定義するソフトジェネレーティブアクター・クリティック(SoftGAC)を提案する。
この構造的ブリッジは、高エントロピー参照プロセスに対して、解析的に抽出可能なパスワイド相対エントロピー目的としてMaxEntの目的を持ち上げることができる。
実際の有限段階実装では、この相対エントロピーはサンプリングされた遷移制御エネルギーに正確に還元され、原理化されたソフト正規化をもたらす。
さらに, シングルパスアクタを小さなステップ固有のブリッジトランジションを用いて軽量に保ち, それぞれがサンプリングされたアクション毎に1回だけ評価し, 強力なアクタベースラインに匹敵するパラメータ予算を維持している。
挑戦的な継続的制御ベンチマークに関する大規模な実験により、SoftGACは、拡散やフローマッチングポリシを含む強力な生成ポリシーベースラインよりも高いあるいは競争的なリターンを達成する一方で、ワンパスアクターの低レイテンシな状態にとどまり、計算-リターントレードオフの大幅な改善を示すことが示されている。
関連論文リスト
- Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling [3.6266846456338695]
最大エントロピー強化学習(MaxEnt RL)がシーケンシャル意思決定の標準フレームワークとなっている。
本稿では,ハイブリッド決定論的確率論的アーキテクチャに基づくフレームワークであるTrncated Rectified Flow Policyを提案する。
論文 参考訳(メタデータ) (2026-04-10T09:44:28Z) - From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation [18.70033095161235]
Indicit Likelihood Estimation (IMLE) を用いて条件付きフローマッチングの専門家を高速な単一ステップの学生に蒸留する枠組みを提案する。
双方向のチャンファー距離は、モードカバレッジと忠実度の両方を促進する設定レベルの目的を提供する。
統合認識エンコーダは、さらに多視点RGB、深度、点雲、プロプレセプションを幾何学的認識表現に統合する。
論文 参考訳(メタデータ) (2026-03-10T09:30:05Z) - Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing [1.0312968200748118]
Rectified Flowモデルは最先端の世代品質を実現するが、正確なタスクのためにそれらを制御することは依然として困難である。
現在のアプローチは「幾何学的ロック」に苦しむ逆法に基づくガイダンスに分岐する
Score-Guided Proximal Projectionは,決定論的最適化と縮尺サンプリングのギャップを埋める統一フレームワークである。
論文 参考訳(メタデータ) (2026-03-05T23:44:45Z) - Primary-Fine Decoupling for Action Generation in Robotic Imitation [91.2899765310853]
ロボット操作動作シーケンスにおけるマルチモーダル分布は、模倣学習にとって重要な課題である。
PF-DAG(プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、プライマリ・フィン・デカップリング・フォー・アクション・ジェネレーション、PF-DAG)を提案する。
PF-DAGは、Adroit、DexArt、MetaWorldベンチマークの56タスクで最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-25T08:36:45Z) - TABES: Trajectory-Aware Backward-on-Entropy Steering for Masked Diffusion Models [35.327100592206115]
Backward-on-Entropy (BoE) Steeringは勾配誘導型推論フレームワークで、無限水平コンテキストを1つの後方パスで近似する。
スケーラビリティを確保するために,マスク対象の構造を利用した疎結合プリミティブであるttexttActiveQueryAttentionを導入し,後方通過の複雑さを低減する。
論文 参考訳(メタデータ) (2026-01-30T19:10:32Z) - Q-learning with Adjoint Matching [58.78551025170267]
本稿では,新しいTD-based reinforcement learning (RL)アルゴリズムであるAdjoint Matching (QAM) を用いたQ-learningを提案する。
QAMは、最近提案された生成モデリング手法であるadjoint matchingを活用することで、2つの課題を回避している。
オフラインとオフラインの両方のRLにおいて、ハードでスパースな報酬タスクに対する従来のアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-20T18:45:34Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - GoRL: An Algorithm-Agnostic Framework for Online Reinforcement Learning with Generative Policies [16.859964356466676]
GoRLは、条件付き生成デコーダを使用してアクションを合成しながら、トラクタブルな遅延ポリシーを最適化するフレームワークである。
GoRLは、ガウス政策と最近の世代政治のベースラインの両方を一貫して上回っている。
論文 参考訳(メタデータ) (2025-12-02T09:49:26Z) - One-Step Flow Policy Mirror Descent [52.31612487608593]
Flow Policy Mirror Descent (FPMD)は、フローポリシー推論中の1ステップのサンプリングを可能にするオンラインRLアルゴリズムである。
本手法は, 直流整合モデルにおける単段サンプリングの分散分散と離散化誤差の理論的関係を利用する。
論文 参考訳(メタデータ) (2025-07-31T15:51:10Z) - Latent State Marginalization as a Low-cost Approach for Improving
Exploration [79.12247903178934]
我々はMaxEntフレームワークにおける潜在変数ポリシーの採用を提案する。
我々は、潜在変数ポリシーが、潜在信念状態を持つ世界モデルの下で自然に現れることを示す。
提案手法を連続制御タスクに対して実験的に検証し, 有効限界化がよりよい探索とより堅牢な訓練につながることを示した。
論文 参考訳(メタデータ) (2022-10-03T15:09:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。