論文の概要: When Debate Helps: Proposal Supply and Verification-Aware Readout in Multi-Agent Reasoning
- arxiv url: http://arxiv.org/abs/2610.04686v1
- Date: Sat, 03 Oct 2026 17:59:46 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:27:48.990588
- Title: When Debate Helps: Proposal Supply and Verification-Aware Readout in Multi-Agent Reasoning
- Title(参考訳): 議論が助けになるとき:マルチエージェント推論における提案の供給と検証-
- Abstract要約: マルチエージェントの議論は推論を改善することができるが、単純な多数決に勝てないことが多い。
提案の供給は正しい回答を提示しなければなりませんし、読み出しは、投票が失敗したときにその答えを識別する必要があります。
- 参考スコア(独自算出の注目度): 7.463945838939353
- License:
- Abstract: Multi-agent debate can improve reasoning, yet often fails to beat simple majority voting. We argue that successful debate requires two distinct mechanisms: proposal supply must surface a correct answer, and readout must identify that answer when voting misses it. We formalize the first requirement through recoverable headroom, which measures cases where a correct proposal is available but the majority answer is wrong. For the second, we develop Latent Verification Debate (LVD), an accounting model in which candidate proposals receive answer-specific verification evidence before final generation. Controlled fixed-proposal interventions estimate this latent effect in equivalent peer-support units and show that correct evidence changes answer probabilities and generated decisions while proposal supply remains fixed. To improve proposal supply, we construct societies from neural-thicket agents using labeled and label-free coverage objectives. Across two backbones and matched-budget reasoning benchmarks, coverage-selected societies increase complementary proposal supply and improve aggregate accuracy in repeated stochastic evaluations. Round-level controls further show that interaction provides gains beyond applying the same finalizer directly to the initial proposals. These results identify proposal coverage and truth-sensitive evidence use as complementary conditions for debate to outperform voting. Code is available at https://github.com/Wang-ML-Lab/when-debate-helps.
- Abstract(参考訳): マルチエージェントの議論は推論を改善することができるが、単純な多数決に勝てないことが多い。
提案の供給は正しい回答を表わさなければならないし、読み出しは、投票が失敗したときにその答えを識別しなければならない。
我々は、正しい提案が可能であるが、大多数の答えが間違っているケースを計測する、回復可能なヘッドルームを通じて、最初の要件を定式化する。
第2に,提案候補が最終生成に先立って回答特異的な証拠を受信する会計モデルであるLatent Verification Debate (LVD) を開発する。
制御された固定手続き的介入は、等価なピアサポートユニットにおいてこの潜伏効果を推定し、提案の供給が固定されている間に、正しい証拠が確率と生成された決定に答えることを示す。
提案の供給を改善するために,ラベル付きおよびラベルなしカバレッジ目的を用いたニューラルネットワークエージェントから社会を構築する。
2つのバックボーンと一致予算推論ベンチマークで、カバレッジ選択された社会は相補的な提案の供給を増やし、繰り返し確率的評価において集約精度を向上させる。
ラウンドレベルのコントロールは、相互作用が初期提案に同じファイナライザを直接適用する以上の利益を提供することを示している。
これらの結果から,議論が投票を上回る相補的な条件として,提案のカバレッジと真理に敏感な証拠が同定された。
コードはhttps://github.com/Wang-ML-Lab/when-debate-helpsで入手できる。
関連論文リスト
- Counterfactual Self-Evolving Agents for Evidence-Grounded Reasoning [35.98610301736344]
セルフプレイプロジェクタ-ソルバ手法は、タスクを生成し、検証されたソリューションから学習することで推論を改善する。
そこで,本論文では,原事例を再考するための反実的文脈を生成する反実的自己進化について紹介する。
トレーニング可能なプロポーラは、対象とするエビデンスを編集し、因果的説明で潜在的な結果の変化を記述する。
論文 参考訳(メタデータ) (2026-09-26T18:54:50Z) - Black-Box Auditing of Epistemic Reliability in Multi-Agent Debate Distillation [19.88070595796935]
ディベート蒸留は、後続の議論における判断を改善するために、マルチエージェントの議論書き起こしを用いた弱い検証装置に適応する。
本研究では,隠れたタスクに対する正しい応答を抑えつつ,適応が監視性能を保ちながら,エピステマティックな信頼性劣化について検討した。
本研究では,2段階のブラックボックス監査フレームワークであるER-Auditを提案する。
実験の結果, 隠れタスクの精度は, 非劣化および低劣化境界に対する反例と共存できることがわかった。
論文 参考訳(メタデータ) (2026-09-26T08:33:34Z) - ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Hear Both Sides: Efficient Multi-Agent Debate via Diversity-Aware Message Retention [31.583055847273826]
Multi-Agent Debateは、大規模言語モデルの推論品質を改善するための有望なフレームワークとして登場した。
現在のアプローチは、放送前の低信頼応答をフィルタする不確実性推定に依存している。
本稿では,エージェント応答のサブセットを選択する軽量な討論フレームワークであるDiversity-Aware Retention (DAR)を提案する。
論文 参考訳(メタデータ) (2026-03-21T04:27:47Z) - Verifiable Reasoning for LLM-based Generative Recommendation [106.7765000777685]
大規模言語モデル(LLM)における推論は、最近、生成的レコメンデーションの強化に強い可能性を示している。
本稿では,信頼性の高いフィードバックを提供するために,検証と推論をインターリーブする新しいTextbftextitreason-verify-recommendパラダイムを提案する。
4つの実世界のデータセットの実験は、VRecが効率を損なうことなく、推奨の有効性とスケーラビリティを大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-03-08T16:55:45Z) - More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering [53.09478307383865]
大規模言語モデル(LLM)のための新しい推論フレームワークであるBiasPromptingを紹介する。
最終的な予測に到達する前に、LCMにすべての妥当な答えオプションの推論を生成し、批判的に評価するように誘導する。
広く使われている5つの質問応答ベンチマークにおいて、大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-11-25T09:01:08Z) - An empirical study on declined proposals: why are these proposals declined? [5.8828883295344925]
本研究では,Go言語における提案の特徴と結果について検討する。
提案は受け入れられるよりも拒否されることが多く、解決には通常1ヶ月以上かかります。
重複、限られたユースケース、プロジェクト原則違反など、提案が下降する9つの主要な理由を特定します。
論文 参考訳(メタデータ) (2025-10-08T13:09:51Z) - Information Bargaining: Bilateral Commitment in Bayesian Persuasion [60.3761154043329]
長期的説得のための統一的なフレームワークとよく構造化されたソリューションの概念を導入する。
この視点はゲーム構造の共通知識を明確にし、レシーバに匹敵するコミットメント能力を与える。
このフレームワークは、2段階の検証と推論のパラダイムによって検証される。
論文 参考訳(メタデータ) (2025-06-06T08:42:34Z) - Debate Only When Necessary: Adaptive Multiagent Collaboration for Efficient LLM Reasoning [8.800516398660069]
大規模言語モデル(LLM)の推論能力を高めるための,有望なフレームワークとして,マルチエージェントコラボレーションが登場した。
本稿では,エージェントの初期応答の信頼性スコアに基づいて,議論を選択的に活性化する適応型マルチエージェント討論フレームワークであるDebate Only When Necessary (DOWN)を提案する。
ダウンは最大6倍の効率向上を実現し、既存のメソッドのパフォーマンスを保留する。
論文 参考訳(メタデータ) (2025-04-07T13:17:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。