論文の概要: MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation
- arxiv url: http://arxiv.org/abs/2607.27967v1
- Date: Thu, 30 Jul 2026 10:14:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.506063
- Title: MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation
- Title(参考訳): MARS-RA: Embodied Multi-Agent Cooperationにおけるマルチモーダル比較によるクレジットアサインメントのランクアグリゲーション
- Authors: Dawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison,
- Abstract要約: 信用割当は、協調型マルチエージェント強化学習における基本的な課題である。
ランキングアグリゲーション問題として信用代入を再構成するフレームワークであるMARS-RAを提案する。
- 参考スコア(独自算出の注目度): 9.118184203737597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Credit assignment is a fundamental challenge in cooperative multi-agent reinforcement learning, particularly in embodied AI settings characterized by limited and delayed feedback as well as dynamically changing numbers of active agents. We propose MARS-RA, a framework that reformulates credit assignment as a rank aggregation problem using contribution-based pairwise comparisons among agents generated by large multimodal models. This shift from absolute to relative estimation ensures robustness against noise and dynamic agent participation, converting comparison results into contribution scores for potential-based reward shaping. We provide theoretical justification for the convergence and robustness of the proposed framework, and show that Shapley values can be used as an interpretive reference. Experimental results on challenging tasks of different types indicate that MARS-RA can guide agents toward effective cooperation.
- Abstract(参考訳): クレジット割り当ては、協調的マルチエージェント強化学習における基本的な課題であり、特に限定的かつ遅延したフィードバックと動的に変化するアクティブエージェントの数によって特徴づけられる、具体化されたAI設定においてである。
大規模マルチモーダルモデルにより生成されたエージェント間のコントリビューションに基づくペアワイズ比較を用いて、クレジット割り当てをランクアグリゲーション問題として再構成するフレームワークMARS-RAを提案する。
この絶対値から相対値へのシフトにより、ノイズや動的エージェントの関与に対する堅牢性が保証され、比較結果を潜在的報酬形成のためのコントリビューションスコアに変換する。
本稿では,提案フレームワークの収束性と堅牢性に関する理論的正当性を示し,Shapley値が解釈基準として利用できることを示す。
異なるタイプの課題に対する実験結果から、MARS-RAは効果的な協力に向けてエージェントを導くことができることが示唆された。
関連論文リスト
- AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition [62.16431420189863]
LLMに基づくマルチモーダル感情認識は静的なパラメトリックメモリに依存しており、ニュアンス化された感情状態の解釈時にしばしば幻覚を与える。
本稿では,感情指向型マルチエージェント検索拡張生成フレームワークであるAffectAgentを紹介する。
AffectAgentは3つの共同最適化されたエージェント、すなわちクエリプランナー、エビデンスフィルタ、感情生成器から構成される。
論文 参考訳(メタデータ) (2026-04-14T13:49:19Z) - Adaptive Value Decomposition: Coordinating a Varying Number of Agents in Urban Systems [19.19146852846605]
Adaptive Value Decomposition (AVD)は、動的に変化するエージェントに適応する協調的なMARLフレームワークである。
トレーニング実行戦略は、エージェントが異なるタイミングで行動するときの非同期な意思決定に対応するように設計されている。
論文 参考訳(メタデータ) (2026-02-10T03:41:14Z) - Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning [112.16686518063456]
textbfMulti-Agent Test-Time Reinforcement Learning (MATTRL)を導入する。
MATTRLは、マルチターンの議論、テストタイムの経験の検索と統合、最終的な意思決定のコンセンサスに到達するための、複数の専門家のチームを形成する。
MATTRLは、医学、数学、教育の挑戦的なベンチマーク全体にわたって、マルチエージェントベースラインで平均3.67%、同等のシングルエージェントベースラインで平均8.67%の精度を向上する。
論文 参考訳(メタデータ) (2026-01-14T17:57:43Z) - Constructive Conflict-Driven Multi-Agent Reinforcement Learning for Strategic Diversity [27.335624335134018]
コンストラクティブ・コンフリクト(CoDiCon)は,競争インセンティブを協調シナリオに組み込んだ新しいアプローチである。
中央固有の報酬モジュールは、様々な報酬値を生成し、エージェントに分配し、競争と協力の効果的なバランスを確保する。
実験により,CoDiConは,多様かつ適応的な戦略を効果的に推進する競争本質的な報奨によって,優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-09-16T07:26:35Z) - Multi-level Advantage Credit Assignment for Cooperative Multi-Agent Reinforcement Learning [2.3173485093942943]
クレジットの割り当てには、共有報酬に対する各エージェントの貢献を評価することが含まれる。
本研究では,報酬を得るために協力するエージェントの数として,クレジット割り当てレベルを定式化する。
異なるレベルにまたがってクレジットを推測するために、明示的な対実的推論を行うマルチレベル・アドバンテージの定式化を導入する。
論文 参考訳(メタデータ) (2025-08-09T05:36:08Z) - Enhancing Heterogeneous Multi-Agent Cooperation in Decentralized MARL via GNN-driven Intrinsic Rewards [1.179778723980276]
MARL(Multi-agent Reinforcement Learning)は、シーケンシャルな意思決定と制御タスクの鍵となるフレームワークである。
これらのシステムを現実のシナリオに展開するには、分散トレーニング、多様なエージェントセット、そして頻繁な環境報酬信号から学ぶ必要がある。
我々は,新しいグラフニューラルネットワーク(GNN)に基づく本質的なモチベーションを利用して,異種エージェントポリシーの学習を容易にするCoHetアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-08-12T21:38:40Z) - Quantifying Agent Interaction in Multi-agent Reinforcement Learning for
Cost-efficient Generalization [63.554226552130054]
マルチエージェント強化学習(MARL)における一般化の課題
エージェントが未確認のコプレイヤーに影響される程度は、エージェントのポリシーと特定のシナリオに依存する。
与えられたシナリオと環境におけるエージェント間の相互作用強度を定量化する指標であるLoI(Level of Influence)を提示する。
論文 参考訳(メタデータ) (2023-10-11T06:09:26Z) - RACA: Relation-Aware Credit Assignment for Ad-Hoc Cooperation in
Multi-Agent Deep Reinforcement Learning [55.55009081609396]
本稿では、アドホックな協調シナリオにおいてゼロショットの一般化を実現するRACA(Relation-Aware Credit Assignment)と呼ばれる新しい手法を提案する。
RACAは、エージェント間のトポロジ構造を符号化するために、グラフベースのエンコーダ関係を利用する。
提案手法は,StarCraftIIマイクロマネジメントベンチマークとアドホック協調シナリオのベースライン手法よりも優れている。
論文 参考訳(メタデータ) (2022-06-02T03:39:27Z) - Policy Diagnosis via Measuring Role Diversity in Cooperative Multi-agent
RL [107.58821842920393]
我々はエージェントの行動差を定量化し、bfロールの多様性を通して政策パフォーマンスとの関係を構築する
MARLの誤差は, 役割多様性と強い関係を持つ3つの部分に分けられる。
分解された要因は3つの一般的な方向における政策最適化に大きな影響を及ぼす可能性がある。
論文 参考訳(メタデータ) (2022-06-01T04:58:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。