論文の概要: Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs
- arxiv url: http://arxiv.org/abs/2605.08686v1
- Date: Sat, 09 May 2026 04:51:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.812865
- Title: Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs
- Title(参考訳): 異種LCMを用いたマルチエージェントシステムに対する反復的批評・経路制御
- Authors: Wenzhi Fang, Liangqi Yuan, Guangchen Lan, Dong-Jun Han, Christopher G. Brinton,
- Abstract要約: マルチエージェント大言語モデル(LLM)システムは、異種モデルのプールを調整するためのコントローラに依存していることが多い。
逐次決定問題としてマルチエージェントコーディネーションを提案する。
- 参考スコア(独自算出の注目度): 31.34021188099265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent large language model (LLM) systems often rely on a controller to coordinate a pool of heterogeneous models, yet existing controllers are typically limited to one-shot routing: they select a model once and return its output directly. Such routing-only designs provide no mechanism to critique intermediate drafts or support iterative refinement. To address this limitation, we propose a critique-and-routing controller that casts multi-agent coordination as a sequential decision problem. At each turn, the controller evaluates the current draft, decides whether to stop or continue, and, if needed, selects the next agent for further refinement. We formulate this process as a finite-horizon Markov Decision Process (MDP) with explicit agent-utilization constraints, design a composite reward for controller decisions across turns, and optimize the controller via policy gradients under a Lagrangian-relaxed objective. Extensive experiments across multiple heterogeneous multi-agent systems and seven reasoning benchmarks show that our method consistently outperforms state-of-the-art baselines and substantially narrows the gap to the strongest agent, while using it for fewer than 25% of total calls.
- Abstract(参考訳): マルチエージェント大言語モデル(LLM)システムは、しばしば不均一モデルのプールを調整するためにコントローラに依存するが、既存のコントローラは通常、1ショットのルーティングに限られる。
このようなルーティングのみの設計は、中間ドラフトを批判したり、反復的な改善をサポートするメカニズムを提供しない。
この制限に対処するため,複数エージェントの協調を逐次決定問題として用いた批判・引き抜き制御器を提案する。
各ターンでコントローラは現在のドラフトを評価し、停止するか継続するかを決定し、必要に応じて次のエージェントを選択してさらなる改善を行う。
有限水平マルコフ決定過程 (MDP) として定式化し, エージェント利用制約を明示し, 制御器決定のための複合報酬をターン毎に設計し, ラグランジアン緩和目標の下で制御器を最適化する。
複数のヘテロジニアスなマルチエージェントシステムと7つの推論ベンチマークによる広範囲な実験により、我々の手法は一貫して最先端のベースラインを上回り、最強のエージェントとのギャップを著しく狭めつつ、総呼び出しの25%未満で使用しています。
関連論文リスト
- CAMO: A Conditional Neural Solver for the Multi-objective Multiple Traveling Salesman Problem [13.232337043603161]
多目的多目的トラベリングセールスマン問題(MOMTSP)に対する条件付きニューラルネットワークCAMOを提案する。
ターゲット、エージェント、選好ベクトルの様々な数にまたがって一般化し、パレートフロント(PF)に高品質な近似をもたらす。
実験により、CAMOは神経と慣性の両方に優れており、PFのより近い近似が達成されている。
論文 参考訳(メタデータ) (2026-03-19T15:59:45Z) - MO-MIX: Multi-Objective Multi-Agent Cooperative Decision-Making With Deep Reinforcement Learning [68.91090643731987]
深部強化学習(RL)は複雑な意思決定問題を解決するために広く応用されている。
既存のアプローチは、別々のフィールドに限られており、単一の目的でマルチエージェントの意思決定しか処理できない。
マルチオブジェクト型マルチエージェント強化学習(MOMARL)問題の解法としてMO-mixを提案する。
論文 参考訳(メタデータ) (2026-02-28T16:25:22Z) - Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation [50.22481337087162]
Referring Video Object (RVOS) は、テキストクエリに基づくビデオ内のオブジェクトのセグメンテーションを目的としている。
Refer-Agent (Refer-Agent) は、共用多エージェントシステムである。
論文 参考訳(メタデータ) (2026-02-03T14:48:12Z) - ORCH: many analyses, one merge-a deterministic multi-agent orchestrator for discrete-choice reasoning with EMA-guided routing [0.6445605125467574]
ORCHは異種言語モデルを編成する離散選択推論のためのフレームワークである。
タスクの分解と回答の集約に固定されたルールを使用し、パイプラインを予測可能、再現可能、トレーニング不要にする。
MMLU、MMLU-Pro、GSM8Kの実験では、ORCHは単一モデルベースラインと多数投票アンサンブルを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-02T08:27:58Z) - Merge and Guide: Unifying Model Merging and Guided Decoding for Controllable Multi-Objective Generation [49.98025799046136]
Merge-And-GuidEは、ガイド付きデコーディングにモデルマージを利用する2段階のフレームワークである。
ステージ1では、MAGEはガイダンスとベースモデルの互換性の問題を解決する。
ステージ2では、明示的で暗黙的な値モデルを統一的なガイダンスプロキシにマージします。
論文 参考訳(メタデータ) (2025-10-04T11:10:07Z) - Offline Multi-agent Reinforcement Learning via Score Decomposition [51.23590397383217]
オフライン協調型マルチエージェント強化学習(MARL)は、分散シフトによる固有の課題に直面している。
この作業は、オフラインとオンラインのMARL間の分散ギャップを明示的に解決する最初の作業である。
論文 参考訳(メタデータ) (2025-05-09T11:42:31Z) - PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning [16.523999372817435]
AGPS(Action Generation with Plackett-Luce Sampling)はエージェント決定順序最適化のための新しいメカニズムである。
本稿では,決定順序を最適化した逐次意思決定型MARLアルゴリズムである優先多重エージェント変換器(PMAT)を提案する。
StarCraft II Multi-Agent Challenge、Google Research Football、Multi-Agent MuJoCoといったベンチマークの実験では、PMATが最先端のアルゴリズムより優れていることが示されている。
論文 参考訳(メタデータ) (2025-02-23T08:30:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。