論文の概要: The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate
- arxiv url: http://arxiv.org/abs/2605.00914v1
- Date: Wed, 29 Apr 2026 14:33:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.478473
- Title: The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate
- Title(参考訳): コンセンサスのコスト: 分離自己補正は非均一な多元性議論に有効である
- Authors: Blaž Bertalanič, Carolina Fortuna,
- Abstract要約: 2つの高拡散度ベンチマークにおいて、R=3$の討論ラウンドで均質なエージェントのチームについて検討する。
我々は、議論の失敗を3つのモデル依存の経路に分解する: サイコファン的整合性、ピア論理、コンセンサス崩壊。
その結果,7-8B パラメータクラスでは,構造的役割を持たない同種チームが非誘導的ピア交換の恩恵を受けないことが示唆された。
- 参考スコア(独自算出の注目度): 5.51170856062205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent debate, where teams of LLMs iteratively exchange rationales and vote on answers, is widely deployed under the assumption that peer review filters hallucinations. Yet the failure dynamics of homogeneous debate remain poorly understood, therefore we report findings from a controlled empirical study of teams of $N{=}10$ homogeneous agents (Qwen2.5-7B, Llama-3.1-8B, Ministral-3-8B) across $R{=}3$ debate rounds on two high-difficulty benchmarks (GSM-Hard and MMLU-Hard). We compare peer debate against isolated self-correction and a stochastic noise control that injects rationales from unrelated problems. We decompose debate failure into three model-dependent pathways: sycophantic conformity, where agents uncritically adopt majority answers (modal adoption up to 85.5%); contextual fragility, where peer rationales destabilize previously correct reasoning (vulnerability rate up to 70.0%); and consensus collapse, where plurality voting discards correct answers already present in the generation pool (oracle gap up to 32.3 percentage points). Ablations over communication density ($K \in \{2,4,9\}$) and sampling temperature ($T \in \{0.4, 0.7\}$) show that conformity reaches high levels at minimal peer exposure ($K{=}2$) and intensifies with greater initial diversity. Across all configurations, debate consumes 2.1-3.4$\times$ more tokens (up to 28,631 tokens per problem) than self-correction for equal or lower accuracy. Our results indicate that, within the 7-8B parameter class, homogeneous teams without structured roles do not benefit from unguided peer exchange, and that isolated self-correction consistently offers a more favorable cost-accuracy tradeoff.
- Abstract(参考訳): LLMのチームが合理性を反復的に交換し、回答に投票するというマルチエージェントの議論は、ピアレビューが幻覚をフィルターするという仮定の下で広く展開されている。
しかし、同種論争の失敗のダイナミクスはいまだ理解されていないため、2つの高次ベンチマーク(GSM-Hard と MMLU-Hard )上での議論ラウンドにまたがる、$N{=}10$同種エージェント(Qwen2.5-7B, Llama-3.1-8B, Ministral-3-8B)のチームによる制御実験の結果を報告する。
孤立自己補正に対するピアディベートと、関係のない問題から合理性を注入する確率的ノイズ制御を比較した。
我々は、議論の失敗を、3つのモデルに依存した経路に分解する: サイコファン的整合性、エージェントが非批判的に多数回答(モーダル採用率85.5%)を採用すること、文脈的脆弱性、ピア論理が事前の正しい推論を不安定化すること(70.0%)、複数の投票で既に生成プールに存在する正しい回答を放棄するコンセンサス崩壊(orcle gap to 32.3%)。
通信密度(K \in \{2,4,9\}$)とサンプリング温度(T \in \{0.4, 0.7\}$)に対するアブレーションは、コンホメーションが最小のピア露光(K{=}2$)で高いレベルに達することを示す。
すべての構成において、議論は2.1-3.4$\times$以上のトークン(問題当たり最大28,631トークン)を、同じまたは低い精度で自己補正するよりも消費する。
その結果, 7-8B パラメータクラスでは, 構造的役割を持たない同種チームは, 誘導されていないピア交換の恩恵を受けず, 孤立した自己補正は, より有利なコスト対精度のトレードオフを提供することがわかった。
関連論文リスト
- Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation [0.0]
政策シミュレーションにおいて,大規模言語モデル(LLM)を用いたマルチエージェント検討システムの提案が進んでいる。
評価エージェントは、割り当てられた値の観点に関わらず、同じ選択肢に収束する。
我々は、三段階の審議フレームワークであるAI Councilを提示し、2つの介入をテストするための2つの政策シナリオにわたる120の審議を行う。
論文 参考訳(メタデータ) (2026-04-29T11:47:28Z) - From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation [12.294365308421606]
我々は、議論のアウトプットを調整された行動逆エスカレート決定に変換する、ポストホックな意思決定層であるConformal Social Choiceを紹介する。
階層的なアクションポリシーは、シングルトンセットを自律的なアクションにマップし、より大きなセットを人間のエスカレーションにマップする。
この層は議論が確実に間違っている場合に作用しないため、残りの共形シングルトンは90.0--96.8%の精度に達する。
論文 参考訳(メタデータ) (2026-04-09T00:15:20Z) - Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus [0.0]
マルチエージェントLDM委員会は、異なるロールプロンプトの下で同じモデルを複製し、多数決によってアウトプットを集約する。
それぞれのエージェントのチェーン・オブ・シークレットの論理を組み込んで、100 GSM8Kの質問に3つのQwen2.5-14Bのエージェントでペアの類似度を測る。
DALCは、埋め込み幾何学から多様性重量を計算するトレーニングフリーコンセンサスプロトコルであり、GSM8Kでは87%、トークンコストでは84%に達する。
論文 参考訳(メタデータ) (2026-04-04T17:30:23Z) - Heterogeneous Consensus-Progressive Reasoning for Efficient Multi-Agent Debate [58.675713546748305]
マルチエージェント・ディベート(英: Multi-Agent Debate、MAD)は、複数のエージェントが推論および反復的批判サイクルの生成を通じて、反復的にソリューションを洗練する協調的なフレームワークである。
本研究は,HCP-MADのための不均一なコンセンサス・プログレッシブ推論を導入する。
HCP-MADは3段階のプログレッシブ推論機構を用いて、様々なタスク複雑度にまたがる適応的なソリューションを開発する。
論文 参考訳(メタデータ) (2026-04-03T06:58:59Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Internalizing Self-Consistency in Language Models: Multi-Agent Consensus Alignment [22.305033366660187]
言語モデル(LM)は矛盾する推論子であり、しばしば同じプロンプトに対する矛盾した応答を生成する。
適切に整合した推論モデルの本質的な性質として自己整合性を定式化し、MACA(Multi-Agent Consensus Alignment)を導入する。
MACAは、エージェントが自分自身をより決定的かつ簡潔に教えることを可能にし、外部の監督なしにマルチエージェント設定におけるピアインサイトをより活用する。
論文 参考訳(メタデータ) (2025-09-18T17:27:28Z) - Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models [56.055015597319674]
検証可能な報酬(RLVR)を用いた強化学習は,大規模言語モデル(LLM)の推論能力の向上に有効である
近年の自己回帰法は LLM の推論能力を解き放つためのラベルフリーな代替手段について検討している。
我々は、他の視点から補完的な監督を求めることにより、トレーニングの安定性を向上させる新しい自己監督型RLフレームワークであるtextitCo-rewardingを提案する。
論文 参考訳(メタデータ) (2025-08-01T08:09:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。