論文の概要: Decision Protocols in Multi-Agent Large Language Model Conversations
- arxiv url: http://arxiv.org/abs/2607.05477v1
- Date: Mon, 06 Jul 2026 11:48:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.276001
- Title: Decision Protocols in Multi-Agent Large Language Model Conversations
- Title(参考訳): 多言語大言語モデル対話における決定プロトコル
- Abstract要約: マルチエージェントシステム(Multi-Agent Systems, MAS)は、タスクを専門のエージェントに分散してタスク性能を改善することで、有望なソリューションを提供する。
決定プロトコルは、複数のエージェントが協調して最終的なソリューションを作成する方法を特定するため、MASの重要なコンポーネントである。
この論文では、様々な決定プロトコルを実装し評価するMulti-Agent LLM(MALLM)フレームワークを紹介している。
- 参考スコア(独自算出の注目度): 1.0152838128195467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Improving the task performance of Large Language Models (LLMs) is essential, yet scaling these models faces significant challenges such as diminishing returns and high costs. Multi-Agent Systems (MAS) offer a promising solution by distributing tasks among specialized agents to improve the overall task performance. This can reduce training costs at the expense of increased test time due to the discussion and decision-making process. The decision protocol is a critical component of MAS because it specifies how multiple agents collaborate to create a final solution. This thesis introduces the Multi-Agent LLM (MALLM) framework, which implements and evaluates various decision protocols, namely voting, consensus, and judge decision mechanisms, to simulate multi-agent discussions for conversational task solving. Unlike previous work that used a single decision protocol or tested them on limited datasets, this study systematically examines their impact on a diverse set of tasks, ranging from knowledge-based datasets (MMLU, MMLU-Pro, GPQA) and logic-based datasets (StrategyQA, MuSR, Math-lvl-5, SQuAD 2.0). The results indicate that consensus protocols excel in knowledge-intensive domains while voting and judge protocols are more effective for logic-based tasks. Increasing response diversity through independent solution generation improves decision quality, while changes in information access during the decision process have minimal impact.
- Abstract(参考訳): LLM(Large Language Models)のタスクパフォーマンスの改善は不可欠だが、これらのモデルをスケールすることは、リターンの減少や高コストといった大きな課題に直面している。
マルチエージェントシステム(Multi-Agent Systems, MAS)は、タスクを専門のエージェントに分散してタスク性能を改善することで、有望なソリューションを提供する。
これにより、議論や意思決定のプロセスによるテスト時間の増加を犠牲にして、トレーニングコストを削減できます。
決定プロトコルは、複数のエージェントが協調して最終的なソリューションを作成する方法を特定するため、MASの重要なコンポーネントである。
この論文では、多エージェントLPM(Multi-Agent LLM)フレームワークを導入し、様々な意思決定プロトコル、すなわち投票、コンセンサス、判断機構を実装し、評価し、対話型タスク解決のためのマルチエージェント議論をシミュレートする。
この研究は、単一の決定プロトコルを使用したり、限られたデータセットでテストした以前の研究とは異なり、知識ベースのデータセット(MMLU、MMLU-Pro、GPQA)や論理ベースのデータセット(StrategyQA、MuSR、Math-lvl-5、SQuAD 2.0)など、さまざまなタスクに対する彼らの影響を体系的に調査する。
その結果,知識集約領域ではコンセンサスプロトコルが優れ,投票や判断プロトコルが論理ベースのタスクに有効であることが示唆された。
独立ソリューション生成による応答の多様性の向上は、意思決定の質を向上させる一方で、意思決定プロセスにおける情報アクセスの変化は、最小限の影響しか与えない。
関連論文リスト
- Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play [53.56274149236814]
Multi-Agent Fictitious Play (MAFP)は、ステークホルダーのスタンスをエージェントとして表現する新しいMASパラダイムである。
MAFPは各エージェントの判断を、他のエージェントの過去の決定の実証的な混合に応じて反復的に更新する。
我々は、行動前に競合シナリオの戦略を決定する能力をテストする挑戦的な意思決定タスクにおいて、MAFPを評価する。
論文 参考訳(メタデータ) (2026-06-17T17:31:06Z) - MO-MIX: Multi-Objective Multi-Agent Cooperative Decision-Making With Deep Reinforcement Learning [68.91090643731987]
深部強化学習(RL)は複雑な意思決定問題を解決するために広く応用されている。
既存のアプローチは、別々のフィールドに限られており、単一の目的でマルチエージェントの意思決定しか処理できない。
マルチオブジェクト型マルチエージェント強化学習(MOMARL)問題の解法としてMO-mixを提案する。
論文 参考訳(メタデータ) (2026-02-28T16:25:22Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Voting or Consensus? Decision-Making in Multi-Agent Debate [11.807132011179453]
意思決定が異なるタスクにどのように影響するかは、ほとんど分かっていない。
投票プロトコルは、推論タスクとコンセンサスプロトコルのパフォーマンスが13.2%向上し、知識タスクの2.8%向上した。
回答の多様性を高めて意思決定を改善するために,2つの新しい方法を提案する。
論文 参考訳(メタデータ) (2025-02-26T13:39:18Z) - PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning [16.523999372817435]
AGPS(Action Generation with Plackett-Luce Sampling)はエージェント決定順序最適化のための新しいメカニズムである。
本稿では,決定順序を最適化した逐次意思決定型MARLアルゴリズムである優先多重エージェント変換器(PMAT)を提案する。
StarCraft II Multi-Agent Challenge、Google Research Football、Multi-Agent MuJoCoといったベンチマークの実験では、PMATが最先端のアルゴリズムより優れていることが示されている。
論文 参考訳(メタデータ) (2025-02-23T08:30:14Z) - Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization [49.362750475706235]
強化学習(Reinforcement Learning, RL)は、大規模言語モデルを人間の好みと整合させ、複雑なタスクを遂行する能力を向上させる上で重要な役割を担っている。
反応生成過程をマルコフ決定プロセス(MDP)として定式化し,ソフトアクター・クリティック(SAC)フレームワークを用いて,言語モデルによって直接パラメータ化されたQ関数を最適化する,直接Q関数最適化(DQO)を提案する。
GSM8KとMATHという2つの数学問題解決データセットの実験結果から、DQOは従来の手法よりも優れており、言語モデルを整合させるための有望なオフライン強化学習手法として確立されている。
論文 参考訳(メタデータ) (2024-10-11T23:29:20Z) - Agent-Oriented Planning in Multi-Agent Systems [54.429028104022066]
マルチエージェントシステムにおけるエージェント指向計画のための新しいフレームワークであるAOPを提案する。
本研究では, エージェント指向計画の3つの重要な設計原則, 可解性, 完全性, 非冗長性を明らかにする。
大規模実験は,マルチエージェントシステムにおける単一エージェントシステムと既存の計画戦略と比較して,現実の問題を解決する上でのAOPの進歩を実証している。
論文 参考訳(メタデータ) (2024-10-03T04:07:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。