論文の概要: MATES: Learning Multi-Agent Interactions by Transforming Observations for Frozen Single-Agent Policies
- arxiv url: http://arxiv.org/abs/2609.26010v1
- Date: Tue, 22 Sep 2026 11:10:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.339707
- Title: MATES: Learning Multi-Agent Interactions by Transforming Observations for Frozen Single-Agent Policies
- Title(参考訳): MATES:凍結単エージェントポリシーの変換観測によるマルチエージェントインタラクションの学習
- Abstract要約: MATES(Multi-Agent Observation Transformation for existing Single-Agent Policies)について紹介する。
MATESは、個別に識別可能な隣接情報を公開しながら、単独タスク情報を保存しているタスクのための入力側適応フレームワークである。
我々は、生涯にわたるパスフィニング、ナビゲーション、協調的な発見において、オン・アンド・オフ・ポリシーのアルゴリズムを用いてMATESを評価する。
- 参考スコア(独自算出の注目度): 2.2801444394060257
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent reinforcement learning (MARL) commonly trains decentralized policies from scratch, requiring agents to acquire individual task competence and coordination simultaneously. Yet many multi-agent problems admit a compatible single-agent counterpart in which the underlying task can be learned in isolation. We introduce Multi-Agent Observation Transformation for Existing Single-Agent Policies (MATES), an input-side adaptation framework for tasks whose multi-agent observations preserve the solo-task information while exposing separately identifiable neighbor information. From multi-agent experience, MATES learns a small adapter that maps this observation into the format expected by a frozen single-agent policy, inducing actions suited to the shared environment without updating the single-agent policy itself. MATES leaves the pretrained policy's internal architecture unchanged and retains the objectives and update procedures of the underlying MARL algorithm. We evaluate MATES using both on- and off-policy algorithms on lifelong pathfinding, navigation, and cooperative discovery, spanning discrete and continuous observation and action spaces. Across all evaluated settings, MATES optimizes only 3.5-7.3% as many parameters as full-policy training while consistently outperforming MARL training from scratch. It approaches the performance of full fine-tuning, remains competitive overall with demonstration-based baselines, and retains strong task performance at team sizes not encountered during training. These results provide evidence that, under this observation structure, effective multi-agent behavior can be learned without modifying the policy that encodes individual competence.
- Abstract(参考訳): マルチエージェント強化学習(MARL)は通常、個別のタスク能力の獲得と協調をエージェントが要求する、分散化された政策をゼロから訓練する。
しかし、多くのマルチエージェント問題は、基礎となるタスクを独立して学習できる互換性のある単一エージェントの問題を受け入れている。
MATES(Multi-Agent Observation Transformation for existing Single-Agent Policies, MATES)は, 個別に識別可能な隣接情報を公開しながら, 単独タスク情報を保存するタスクの入力側適応フレームワークである。
マルチエージェントの経験から、MATESは、この観察結果を凍った単一エージェントポリシーが期待するフォーマットにマッピングする小さなアダプタを学習し、単一エージェントポリシー自体を更新することなく、共有環境に適したアクションを誘導する。
MATESは、事前訓練されたポリシーの内部アーキテクチャをそのままにして、基礎となるMARLアルゴリズムの目的と手順を更新する。
個別かつ連続的な観察と行動空間にまたがる、生涯にわたるパスフィニング、ナビゲーション、共同発見のオン・オフ・ポリティクス・アルゴリズムを用いて、MATESを評価する。
評価されたすべての設定の中で、MATESは完全な政治訓練よりも3.5-7.3%しかパラメータを最適化していないが、常にMARLトレーニングをゼロから上回っている。
完全な微調整のパフォーマンスにアプローチし、デモベースのベースラインと総合的に競合し続け、トレーニング中に遭遇しないチームサイズでの強いタスクパフォーマンスを維持します。
これらの結果は、この観察構造の下では、個々の能力を符号化するポリシーを変更することなく、効果的なマルチエージェント動作が学べることを示す。
関連論文リスト
- MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation [64.2621682259008]
セルフサーチスケーリングによるマルチエージェント強化トレーニングと推論フレームワーク(MARTI-MARS2)
本稿では,MARTI-MARS2を用いたマルチエージェント強化学習・推論フレームワークを提案する。
我々は、MARTI-MARS2が77.7%を獲得し、GPT-5.1のような強力なベースラインを、挑戦的なコード生成ベンチマークで上回っていることを示す。
論文 参考訳(メタデータ) (2026-02-08T07:28:44Z) - Multi-Agent Inverse Q-Learning from Demonstrations [3.4136908117644698]
Multi-Agent Marginal Q-Learning from Demonstrations (MAMQL)は、マルチエージェントIRLのための新しいサンプル効率フレームワークである。
MAMQLは,従来のマルチエージェント手法よりも平均報酬率,サンプル効率,報酬回復率を2~5倍に向上させることを示した。
論文 参考訳(メタデータ) (2025-03-06T18:22:29Z) - MALT: Improving Reasoning with Multi-Agent LLM Training [67.76186488361685]
MALT(Multi-Agent LLM Training)は、推論プロセスを生成、検証、改善ステップに分割する、新しいポストトレーニング戦略である。
MATH、GSM8K、CSQAでは、MALTは、それぞれ15.66%、7.42%、9.40%の相対的な改善で同じベースラインLLMを上回っている。
論文 参考訳(メタデータ) (2024-12-02T19:30:36Z) - SACHA: Soft Actor-Critic with Heuristic-Based Attention for Partially
Observable Multi-Agent Path Finding [3.4260993997836753]
我々は,ヒューリスティック・ベース・アテンション(SACHA)を用いたソフト・アクター・クリティカル(Soft Actor-Critic)と呼ばれる新しいマルチエージェント・アクター・クリティカルな手法を提案する。
SACHAは、各エージェントが最短経路ガイダンスに選択的に注目するニューラルネットワークを、その視野内の複数のエージェントから学習する。
我々は、いくつかの最先端の学習ベースMAPF法に対して、成功率とソリューション品質に関して、良好な改善を示す。
論文 参考訳(メタデータ) (2023-07-05T23:36:33Z) - A Variational Approach to Mutual Information-Based Coordination for
Multi-Agent Reinforcement Learning [17.893310647034188]
マルチエージェント強化学習のための新しい相互情報フレームワークを提案する。
導出された下界を最大化するためにポリシーを適用することで,多エージェントアクタ-アクタ-アクタ-アクタ-アクタ-アクタ-アクタ-アクタ-アクタ-アクタ-アクタ-アクティベートアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-01T12:21:30Z) - Learning From Good Trajectories in Offline Multi-Agent Reinforcement
Learning [98.07495732562654]
オフラインマルチエージェント強化学習(MARL)は、事前コンパイルされたデータセットから効果的なマルチエージェントポリシーを学ぶことを目的としている。
オフラインのMARLが学んだエージェントは、しばしばこのランダムなポリシーを継承し、チーム全体のパフォーマンスを脅かす。
この問題に対処するために,共有個人軌道(SIT)と呼ばれる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-28T18:11:26Z) - RPM: Generalizable Behaviors for Multi-Agent Reinforcement Learning [90.43925357575543]
本稿では,MARLポリシーを総合性良く訓練するための多様なマルチエージェントトラジェクトリを収集するために,ランク付けされたポリシーメモリ(RPM)を提案する。
RPMにより、マルチエージェントの一般化評価シナリオと完全なタスクにおいて、MARLエージェントが未確認エージェントと対話することが可能になり、平均402%のパフォーマンスが大幅に向上する。
論文 参考訳(メタデータ) (2022-10-18T07:32:43Z) - Policy Diagnosis via Measuring Role Diversity in Cooperative Multi-agent
RL [107.58821842920393]
我々はエージェントの行動差を定量化し、bfロールの多様性を通して政策パフォーマンスとの関係を構築する
MARLの誤差は, 役割多様性と強い関係を持つ3つの部分に分けられる。
分解された要因は3つの一般的な方向における政策最適化に大きな影響を及ぼす可能性がある。
論文 参考訳(メタデータ) (2022-06-01T04:58:52Z) - FACMAC: Factored Multi-Agent Centralised Policy Gradients [103.30380537282517]
FACtored Multi-Agent Centralized Policy gradients (FACMAC)を提案する。
離散的および連続的な行動空間における協調的マルチエージェント強化学習のための新しい手法である。
我々は,マルチエージェント粒子環境の変動に対するFACMAC,新しいマルチエージェント MuJoCo ベンチマーク,およびStarCraft II マイクロマネジメントタスクの挑戦的セットについて評価した。
論文 参考訳(メタデータ) (2020-03-14T21:29:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。