論文の概要: Flowing Faster to Coordinate: One-Step Online Multi-Agent Flow Policies
- arxiv url: http://arxiv.org/abs/2610.01882v1
- Date: Thu, 01 Oct 2026 15:36:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.228828
- Title: Flowing Faster to Coordinate: One-Step Online Multi-Agent Flow Policies
- Title(参考訳): 1ステップのオンラインマルチエージェントフローポリシのコーディネートが高速化
- Abstract要約: マルチエージェント強化学習(MARL)は,環境とのインタラクションを通じて協調行動を学ぶための強力なフレームワークを提供する。
本稿では,一段階フローモデル(OMAF)を用いたオンラインMARLフレームワークを提案する。
OMAFは、ベースライン法に比べて最大3.4倍高いリターンと10.5倍のサンプル効率向上を継続的に達成している。
- 参考スコア(独自算出の注目度): 41.73320924332022
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent reinforcement learning (MARL) provides a powerful framework for learning coordinated behaviors through interactions with the environment. Developing MARL policies requires balancing expressive modeling of complex and multimodal action distributions with efficient training and execution. Generative policies, particularly diffusionbased policies, can faithfully capture complex and multimodal behaviors, but costly iterative sampling hinders their scalability in online multi-agent settings. We propose an Online MARL framework via one-step Flow model (OMAF) that combines expressive generative policies with efficient one-step action generation. OMAF employs a Transformer-based flow policy to capture complex coordination behaviors, while its approximate path score surrogate provides a principled route to synchronized flow policy optimization. To enable stable and sampleefficient learning, we further develop a joint optimization scheme coupling softmax Q-value estimation with a joint flow policy objective for coordinated policy learning. By eliminating iterative sampling, OMAF dramatically reduces training overhead without sacrificing policy expressiveness. Extensive experiments across 10 standard tasks from MPE and MAMuJoCo show that OMAF consistently achieves superior performance, with up to 3.4x higher returns and 10.5x sample efficiency improvement compared with baseline methods. These results validate the effectiveness of OMAF as an expressive and computationally efficient one-step flow policy paradigm for online MARL.
- Abstract(参考訳): マルチエージェント強化学習(MARL)は,環境とのインタラクションを通じて協調行動を学ぶための強力なフレームワークを提供する。
MARLポリシーの開発には、効率的なトレーニングと実行を伴う複雑およびマルチモーダルな行動分布の表現的モデリングのバランスが必要である。
生成ポリシー、特に拡散ベースのポリシーは、複雑でマルチモーダルな振る舞いを忠実に捉えることができるが、コストのかかる反復サンプリングは、オンラインマルチエージェント設定におけるスケーラビリティを妨げる。
本稿では,一段階フローモデル(OMAF)を用いたオンラインMARLフレームワークを提案する。
OMAFはTransformerベースのフローポリシーを使用して複雑な調整動作をキャプチャし、近似経路スコアサロゲートは同期フローポリシー最適化への原則的なルートを提供する。
安定的でサンプル効率のよい学習を実現するために,コーディネートされた政策学習のための共同フロー政策目標とソフトマックスQ値推定を結合した共同最適化スキームを開発した。
反復サンプリングを排除することにより、OMAFはポリシー表現性を犠牲にすることなく、トレーニングオーバーヘッドを劇的に削減する。
MPEとMAMuJoCoの10の標準タスクにわたる大規模な実験により、OMAFはベースライン法に比べて最大3.4倍高いリターンと10.5倍のサンプル効率向上を継続的に達成している。
これらの結果は、オンラインMARLのための表現的で計算効率のよいワンステップフローポリシーパラダイムとしてのOMAFの有効性を検証した。
関連論文リスト
- VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching [2.7429630700600893]
本稿では,フローベースのポリシ内で高密度な値誘導型シェーピングを可能にする,スケーラブルなオフラインRLフレームワークを提案する。
VGFMは、アクション(x-述語)空間における条件付きフローマッチングモデルとしてポリシーをパラメータ化する。
本稿では,厳密な評価プロトコルの下で,VGFMが幅広いタスクに対して高い性能を実現することを示す。
論文 参考訳(メタデータ) (2026-09-13T03:50:52Z) - Aligning Flow Map Policies with Optimal Q-Guidance [50.514994916864275]
フローマップポリシは、任意のサイズのジャンプを学習することで、高速なアクション生成のために設計されている。
FLOW MAP Q-GUIDANCE (FMQ) は, 批判誘導型信頼領域制約の下でオフラインフローマップポリシーを適用するのに最適な, 原則付きクローズドフォーム学習ターゲットである。
FMQは、オフラインからオフラインまでのRLにおける最先端のパフォーマンスを達成し、平均成功率に対して21.3%の相対的な改善により、以前のワンステップポリシーMVPを上回っている。
論文 参考訳(メタデータ) (2026-05-12T17:12:29Z) - Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning [42.476656442284835]
オフラインマルチエージェント強化学習(MARL)は、事前コンパイルされたデータセットから最適なジョイントポリシーを学ぶことを目的としている。
本稿では,シンプルなフローベースのポリシー学習フレームワークであるValue Guidance Multi-agent MeanFlow Policy (VGM$2$P)を提案する。
VGM$2$Pは、グローバルなアドバンテージ値を使用してエージェントの協調をガイドし、最適なポリシー学習を条件付き行動クローンとして扱う。
論文 参考訳(メタデータ) (2026-04-09T12:31:43Z) - Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies [51.24079409973799]
拡散に基づく生成モデルは、オンラインマルチエージェント強化学習(MARL)のニーズを満たすために適切に配置されている
我々は、アンダーライン拡散ポリシーを用いて、最初のアンダーラインオフラインアンダーラインMARLフレームワークを提案する。
私たちのキーとなるイノベーションは、拡張された関節のエントロピーを最大化する、緩和された政策目標です。
論文 参考訳(メタデータ) (2026-02-20T15:38:02Z) - Flow-Based Policy for Online Reinforcement Learning [34.86742824686496]
FlowRLは、フローベースのポリシー表現とWasserstein-2正規化最適化を統合する、オンライン強化学習のためのフレームワークである。
オンライン強化学習ベンチマークにおいて,FlowRLが競争力を発揮することを示す。
論文 参考訳(メタデータ) (2025-06-15T10:53:35Z) - Decision Flow Policy Optimization [53.825268058199825]
生成モデルは、複雑なマルチモーダルな動作分布を効果的にモデル化し、連続的な動作空間において優れたロボット制御を実現することができることを示す。
従来の手法は通常、データセットからの状態条件付きアクション分布に適合する振る舞いモデルとして生成モデルを採用する。
マルチモーダルな行動分布モデリングとポリシー最適化を統合した統合フレームワークDecision Flowを提案する。
論文 参考訳(メタデータ) (2025-05-26T03:42:20Z) - Offline Multi-agent Reinforcement Learning via Score Decomposition [51.23590397383217]
オフライン協調型マルチエージェント強化学習(MARL)は、分散シフトによる固有の課題に直面している。
この作業は、オフラインとオンラインのMARL間の分散ギャップを明示的に解決する最初の作業である。
論文 参考訳(メタデータ) (2025-05-09T11:42:31Z) - Collab: Controlled Decoding using Mixture of Agents for LLM Alignment [90.6117569025754]
人間のフィードバックからの強化学習は、大規模言語モデルを整合させる効果的な手法として現れてきた。
制御された復号化は、再訓練せずに推論時にモデルを整列するメカニズムを提供する。
本稿では,既存の既成のLCMポリシを活用するエージェントベースのデコーディング戦略の混合を提案する。
論文 参考訳(メタデータ) (2025-03-27T17:34:25Z) - IMLE Policy: Fast and Sample Efficient Visuomotor Policy Learning via Implicit Maximum Likelihood Estimation [3.7584322469996896]
IMLEポリシーは、Implicit Maximum Likelihood Estimation (IMLE)に基づく新しい行動クローニング手法である
複雑なマルチモーダルな振る舞いを学ぶ上で、ベースラインメソッドのパフォーマンスに合わせるために、最小限のデモから効果的に学習し、平均で38%のデータを必要とします。
シミュレーションおよび実環境における多様な操作タスクに対するアプローチを検証し、データ制約下で複雑な振る舞いをキャプチャする能力を示す。
論文 参考訳(メタデータ) (2025-02-17T23:22:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。