論文の概要: MASBench: Benchmarking LLM-based Multi-Agent Collaboration under Partial Observability
- arxiv url: http://arxiv.org/abs/2610.04672v1
- Date: Sat, 03 Oct 2026 17:40:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:52:20.5314
- Title: MASBench: Benchmarking LLM-based Multi-Agent Collaboration under Partial Observability
- Title(参考訳): MASBench: 部分観測可能性下でのLLMに基づくマルチエージェントコラボレーションのベンチマーク
- Abstract要約: 大規模言語モデル(LLM)は、徐々に自律エージェントのコアへと進化してきた。
このようなシステムの有効性は,エージェント自体だけでなく,コラボレーションメカニズムの設計や組織化にも依存する。
部分的に観測可能な制約の下で設計されたベンチマークであるMASBenchを紹介する。
- 参考スコア(独自算出の注目度): 34.63967424201551
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have progressively evolved into the core of autonomous agents. Building on this progress, LLM-based multi-agent systems (MAS) coordinate multiple agents into a synergistic team to accomplish complex tasks that exceed the capabilities of individual agents. The effectiveness of such systems depends not only on the agents themselves, but also on how collaboration mechanisms are designed and organized. Note that real-world collaboration is typically partially observable, where each agent can only access partial information about the environment due to physical or privacy-related constraints. However, many existing multi-agent benchmarks assume global observability, and leave limited support for systematically evaluating collaboration mechanisms. To bridge this gap, we introduce MASBench, a multi-agent collaboration benchmark designed under partially observable constraints. It is organized into three progressive task categories: Reasoning, Scheduling, and Game. Through this structure, we progressively evaluate three representative collaboration mechanisms: Protocol, Memory, and Routing. MASBench further provides deterministic evaluation metrics, including performance score, communication cost, and cost effectiveness, to characterize both collaboration outcomes and communication overhead. Experiments across diverse LLM backbones and mechanism configurations offer empirical guidance for effective MAS design. Code is available at: https://github.com/BUPT-GAMMA/MASBench
- Abstract(参考訳): 大規模言語モデル(LLM)は、徐々に自律エージェントのコアへと進化してきた。
この進歩に基づいて、LLMベースのマルチエージェントシステム(MAS)は、複数のエージェントを相乗的なチームにコーディネートし、個々のエージェントの能力を超える複雑なタスクを達成する。
このようなシステムの有効性は,エージェント自体だけでなく,コラボレーションメカニズムの設計や組織化にも依存する。
現実のコラボレーションは一般的に部分的に監視可能であり、各エージェントは物理的な制約やプライバシーに関する制約のため、環境に関する部分的な情報にのみアクセスすることができる。
しかし、既存のマルチエージェントベンチマークの多くは、グローバルな可観測性を前提としており、協調メカニズムを体系的に評価するための限定的なサポートを残している。
このギャップを埋めるために、部分的に観測可能な制約の下で設計されたマルチエージェント協調ベンチマークであるMASBenchを紹介する。
これは3つのプログレッシブタスクカテゴリ(推論、スケジューリング、ゲーム)に分けられる。
この構造を通じて,プロトコル,メモリ,ルーティングという3つの代表的な協調機構を段階的に評価する。
MASBenchはさらに、成果とコミュニケーションオーバーヘッドの両方を特徴付けるために、パフォーマンススコア、通信コスト、コスト効果などの決定論的評価指標を提供する。
多様なLCMバックボーンと機構構成にわたる実験は、効果的なMAS設計のための実証的なガイダンスを提供する。
コードは、https://github.com/BUPT-GAMMA/MASBenchで入手できる。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - Toward an Organizational Science of Multi-Agent LLM Systems: Decoupling Who, How, and Which Algorithm [14.162774819793759]
IMACSは、チームにいる人、メンバーがどのように整列し、どのアルゴリズムが作業を混乱させるかという、論理的に異なる3つの懸念を分離する。
我々は、この分離を利用して、協調プロトコルが固定されている間、組織的な課題が異なる制御された比較を行う。
また、プロトコルの選択を学習可能な変数に変換する。
論文 参考訳(メタデータ) (2026-07-28T08:35:21Z) - Effective Strategies for Asynchronous Software Engineering Agents [52.76455094324273]
本稿では,集中型タスクデリゲート,非同期実行,独立したワークスペースという,3つのSWEプリミティブに根ざした構造化マルチエージェント協調パラダイムを導入する。
CAIDは,紙再生タスク(PaperBench)では26.7%,Pythonライブラリ開発タスクでは14.3%,単一エージェントベースラインでは26.7%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-03-23T02:26:35Z) - EmCoop: A Framework and Benchmark for Embodied Cooperation Among LLM Agents [18.802912315746564]
EmCoopは、組み込みマルチエージェントシステムの協調を研究するためのベンチマークフレームワークである。
我々のフレームワークは、高レベルの認知層と低レベルのエンボディドインタラクション層を分離する。
コラボレーションの品質と障害モードを診断する,一般化可能なプロセスレベルのメトリクスを提案する。
論文 参考訳(メタデータ) (2026-02-27T22:28:33Z) - Emergent Coordination in Multi-Agent Language Models [2.504366738288215]
マルチエージェントシステムが高次構造の兆候を示すかどうかをテストするための情報理論フレームワークを提案する。
この情報分解により、マルチエージェントLLMシステムに動的に出現するかどうかを測定することができる。
我々は,エージェントの直接通信を使わずに,単純な推測ゲームを用いた実験に本フレームワークを適用した。
論文 参考訳(メタデータ) (2025-10-05T11:26:41Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents [59.825725526176655]
大規模言語モデル(LLM)は、自律的なエージェントとして顕著な能力を示している。
既存のベンチマークでは、単一エージェントタスクにフォーカスするか、狭いドメインに限定されており、マルチエージェントのコーディネーションと競合のダイナミクスを捉えていない。
多様な対話シナリオにまたがってLLMベースのマルチエージェントシステムを評価するためのベンチマークであるMultiAgentBenchを紹介する。
論文 参考訳(メタデータ) (2025-03-03T05:18:50Z) - Exploring Collaboration Mechanisms for LLM Agents: A Social Psychology View [60.80731090755224]
本稿では,理論的洞察を用いた実用実験により,現代NLPシステム間の協調機構を解明する。
我々は, LLMエージェントからなる4つの独特な社会をつくり, それぞれのエージェントは, 特定の特性(容易性, 過信性)によって特徴づけられ, 異なる思考パターン(議論, ふりかえり)と協調する。
以上の結果から, LLMエージェントは, 社会心理学理論を反映した, 適合性やコンセンサスリーディングといった人間的な社会的行動を示すことが明らかとなった。
論文 参考訳(メタデータ) (2023-10-03T15:05:52Z) - A Unified and Efficient Coordinating Framework for Autonomous DBMS
Tuning [34.85351481228439]
既存のMLベースのエージェントを効率的に活用するための統合コーディネートフレームワークを提案する。
機械学習ベースのエージェントを効果的に利用し、ワークロードの実行時間に1.414.1Xのスピードアップでより良い設定を実現できることを示す。
論文 参考訳(メタデータ) (2023-03-10T05:27:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。