論文の概要: Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs
- arxiv url: http://arxiv.org/abs/2605.08686v1
- Date: Sat, 09 May 2026 04:51:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.812865
- Title: Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs
- Title(参考訳): 異種LCMを用いたマルチエージェントシステムに対する反復的批評・経路制御
- Abstract要約: マルチエージェント大言語モデル(LLM)システムは、異種モデルのプールを調整するためのコントローラに依存していることが多い。
逐次決定問題としてマルチエージェントコーディネーションを提案する。
- 参考スコア(独自算出の注目度): 31.34021188099265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent large language model (LLM) systems often rely on a controller to coordinate a pool of heterogeneous models, yet existing controllers are typically limited to one-shot routing: they select a model once and return its output directly. Such routing-only designs provide no mechanism to critique intermediate drafts or support iterative refinement. To address this limitation, we propose a critique-and-routing controller that casts multi-agent coordination as a sequential decision problem. At each turn, the controller evaluates the current draft, decides whether to stop or continue, and, if needed, selects the next agent for further refinement. We formulate this process as a finite-horizon Markov Decision Process (MDP) with explicit agent-utilization constraints, design a composite reward for controller decisions across turns, and optimize the controller via policy gradients under a Lagrangian-relaxed objective. Extensive experiments across multiple heterogeneous multi-agent systems and seven reasoning benchmarks show that our method consistently outperforms state-of-the-art baselines and substantially narrows the gap to the strongest agent, while using it for fewer than 25% of total calls.
- Abstract(参考訳): マルチエージェント大言語モデル(LLM)システムは、しばしば不均一モデルのプールを調整するためにコントローラに依存するが、既存のコントローラは通常、1ショットのルーティングに限られる。
このようなルーティングのみの設計は、中間ドラフトを批判したり、反復的な改善をサポートするメカニズムを提供しない。
この制限に対処するため,複数エージェントの協調を逐次決定問題として用いた批判・引き抜き制御器を提案する。
各ターンでコントローラは現在のドラフトを評価し、停止するか継続するかを決定し、必要に応じて次のエージェントを選択してさらなる改善を行う。
有限水平マルコフ決定過程 (MDP) として定式化し, エージェント利用制約を明示し, 制御器決定のための複合報酬をターン毎に設計し, ラグランジアン緩和目標の下で制御器を最適化する。
複数のヘテロジニアスなマルチエージェントシステムと7つの推論ベンチマークによる広範囲な実験により、我々の手法は一貫して最先端のベースラインを上回り、最強のエージェントとのギャップを著しく狭めつつ、総呼び出しの25%未満で使用しています。
関連論文リスト
- Multi-Objective Agent-Based Model Predictive Controller for Plug-and-Play Vehicle Control [18.92447175833456]
機能統合は、車両制御の傾向が高まり、しばしば複数のコントローラの調整が伴う。
エージェントベースのモデル予測制御(AMPC)は、コントローラをエージェントとして扱う分散ソリューションとして登場した。
本稿では,多目的AMPCと呼ばれる新しい分散制御方式を提案する。
論文 参考訳(メタデータ) (2026-09-10T18:35:08Z) - Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making [15.37854161578634]
凍結したLCMまたはVLMから隠れ状態軌跡を読み出し,展開時間制御信号を生成する軽量層であるMulti-Head Latent Controlを導入する。
キャパビリティヘッドは、現在のモデルがインスタンスを解決できるか、より強力なコラボレータに延期すべきかを予測し、レゾリューションヘッドは適切な解決判断の明確化、ツールの使用、回避、あるいは直接回答を予測する。
両方の頭部は、同じ凍結したLDMバックボーンの潜在トレースでのみ訓練され、モデルを変更することなく、ホック後の適応を可能にする。
論文 参考訳(メタデータ) (2026-07-15T18:36:54Z) - Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control [51.92884966472683]
MSCoTは、テストタイムの人間のモーション合成と制御のための、マルチスケールで粗い粒度モデルである。
MSCoTは動きを多スケールの階層表現に識別し、各時間スケールでトークンシーケンス全体を予測する。
論文 参考訳(メタデータ) (2026-05-14T15:09:49Z) - CAMO: A Conditional Neural Solver for the Multi-objective Multiple Traveling Salesman Problem [13.232337043603161]
多目的多目的トラベリングセールスマン問題(MOMTSP)に対する条件付きニューラルネットワークCAMOを提案する。
ターゲット、エージェント、選好ベクトルの様々な数にまたがって一般化し、パレートフロント(PF)に高品質な近似をもたらす。
実験により、CAMOは神経と慣性の両方に優れており、PFのより近い近似が達成されている。
論文 参考訳(メタデータ) (2026-03-19T15:59:45Z) - Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - MO-MIX: Multi-Objective Multi-Agent Cooperative Decision-Making With Deep Reinforcement Learning [68.91090643731987]
深部強化学習(RL)は複雑な意思決定問題を解決するために広く応用されている。
既存のアプローチは、別々のフィールドに限られており、単一の目的でマルチエージェントの意思決定しか処理できない。
マルチオブジェクト型マルチエージェント強化学習(MOMARL)問題の解法としてMO-mixを提案する。
論文 参考訳(メタデータ) (2026-02-28T16:25:22Z) - Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation [50.22481337087162]
Referring Video Object (RVOS) は、テキストクエリに基づくビデオ内のオブジェクトのセグメンテーションを目的としている。
Refer-Agent (Refer-Agent) は、共用多エージェントシステムである。
論文 参考訳(メタデータ) (2026-02-03T14:48:12Z) - ORCH: many analyses, one merge-a deterministic multi-agent orchestrator for discrete-choice reasoning with EMA-guided routing [0.6445605125467574]
ORCHは異種言語モデルを編成する離散選択推論のためのフレームワークである。
タスクの分解と回答の集約に固定されたルールを使用し、パイプラインを予測可能、再現可能、トレーニング不要にする。
MMLU、MMLU-Pro、GSM8Kの実験では、ORCHは単一モデルベースラインと多数投票アンサンブルを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-02T08:27:58Z) - Merge and Guide: Unifying Model Merging and Guided Decoding for Controllable Multi-Objective Generation [49.98025799046136]
Merge-And-GuidEは、ガイド付きデコーディングにモデルマージを利用する2段階のフレームワークである。
ステージ1では、MAGEはガイダンスとベースモデルの互換性の問題を解決する。
ステージ2では、明示的で暗黙的な値モデルを統一的なガイダンスプロキシにマージします。
論文 参考訳(メタデータ) (2025-10-04T11:10:07Z) - Offline Multi-agent Reinforcement Learning via Score Decomposition [51.23590397383217]
オフライン協調型マルチエージェント強化学習(MARL)は、分散シフトによる固有の課題に直面している。
この作業は、オフラインとオンラインのMARL間の分散ギャップを明示的に解決する最初の作業である。
論文 参考訳(メタデータ) (2025-05-09T11:42:31Z) - PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning [16.523999372817435]
AGPS(Action Generation with Plackett-Luce Sampling)はエージェント決定順序最適化のための新しいメカニズムである。
本稿では,決定順序を最適化した逐次意思決定型MARLアルゴリズムである優先多重エージェント変換器(PMAT)を提案する。
StarCraft II Multi-Agent Challenge、Google Research Football、Multi-Agent MuJoCoといったベンチマークの実験では、PMATが最先端のアルゴリズムより優れていることが示されている。
論文 参考訳(メタデータ) (2025-02-23T08:30:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。