論文の概要: A Layered Analysis of Disagreement And Answer Quality in Multi-Agent LLM Debate
- arxiv url: http://arxiv.org/abs/2609.08016v1
- Date: Mon, 07 Sep 2026 21:57:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.526922
- Title: A Layered Analysis of Disagreement And Answer Quality in Multi-Agent LLM Debate
- Title(参考訳): マルチエージェントLDMディベートにおける分解・アンサー品質の層解析
- Abstract要約: マルチエージェントの議論は、真の不一致を克服することで、回答の質を向上させると広く考えられている。
我々は、友好的(共通の根拠を探る)、中立的、敵対的な3つのトーンの下で750の議論を評価する。
バイアスチェックされた陪審員は299/299の結びつきを返し、検証可能な制御タスクの精度は変化せず、バイアスチェックのない陪審員は66%の勝利を宣言した。
- 参考スコア(独自算出の注目度): 12.15064553632491
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent debate, in which several LLMs exchange arguments before answering, is widely assumed to improve answer quality by surfacing genuine disagreement. That mechanism is rarely checked. We introduce four measurements: (A) the agreement a debater reports; (B) whether its reply text actually pushes back; (C) whether the position persists once the eliciting instruction is removed; and (D) for open-weight models, the stance response in the debater's own token log-probabilities. We evaluate three-model committees debating open-ended GlobalOpinionQA across 750 debates under three tones: friendly (seek common ground), neutral, and hostile (stress-test every position). (A) Tone strongly reshapes reported agreement: full agreement differs by 50.4 percentage points between the friendly and hostile endpoints. (B) A judge that reads only the reply text, never the self-report or the condition, recovers the same pattern. (C) The dissent appears partly tied to the instruction that elicited it: labels revert toward agreement 23.1 points more often after deleting the hostile instruction than under a matched re-ask that keeps it; question-weighted inference is inconclusive on first-round turns alone (p=0.0625), significant pooling all rounds (p=0.016), and only 11/28 first-round reversions also appear in the reply text. (D) Opposing arguments weaken a debater's stance margin more consistently than they shift its direction. For final answers we detect no quality gain: a bias-checked jury returns 299/299 ties (ruling out only large differences), accuracy on a verifiable control task is unchanged, and a jury without the bias check had declared debate the winner 66% of the time -- an artifact of reading order. Taken together, LLM debate readily changes what agents say, but we find much weaker evidence that it changes what they persistently endorse or improves the quality of the final answer.
- Abstract(参考訳): 回答の前に複数のLLMが議論を交わすマルチエージェントの議論は、真の不一致を克服することによって、回答の質を向上させると広く仮定されている。
その仕組みはめったにチェックされない。
本稿では, (A) 討論者が報告する合意, (B) 回答文が実際に押し返されるかどうか, (C) 提示命令が削除された時点でその位置が持続するか否か, (D) オープンウェイトモデルの場合, 討論者のトークンログの確率に対するスタンス応答について述べる。
オープンエンドのGlobalOpinionQAについて議論する3つのモデル委員会を、友好性(共通点)、中立性(中立性)、敵対性(あらゆる立場でストレステスト)という3つのトーンの下で750の議論で評価する。
(A) トーンは、報告された合意を強く不満に思う: 完全な合意は、友好的なエンドポイントと敵対的なエンドポイントの間で50.4ポイント異なる。
(B) 自己申告又は条件のない返信文のみを読み取る裁判官は、同じパターンを回復する。
(C) 反対意見は、それを引き起こした命令に部分的に結びついている: ラベルは、一致した再攻撃の下で、敵意の命令を削除した後23.1ポイントの頻度で削除する; 質問重み付き推論は、第一ラウンド単独で不決定であり(p=0.0625)、全てのラウンドをプールする(p=0.016)、返信テキストには、11/28の第一ラウンドのリバージョンしか現れない。
(D)反対論は、議論者の立場を方向転換するよりも一貫して弱める。
バイアスチェックされた陪審員は299/299の結びつき(大きな違いだけを排除)、検証可能な制御タスクの正確性は変わらない。
まとめてみれば、LSMの議論はすぐにエージェントの発言を変えるが、最終回答の質を持続的に支持したり改善したりするものを変えるというより弱い証拠が見つかる。
関連論文リスト
- FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect [69.8983512616053]
大規模な言語モデルは、しばしばユーザによる暗黙のスタンスと一致する微妙な言い換えに応答を変更する。
これによってユーザーは、根拠となる事実ではなく、どのようにして質問を言い表したかというアドバイスをユーザーに残すことができる。
FramingQAは、法律、医学、ファイナンス、ロボットシミュレーションにまたがるフレーミングに疑問を呈するモデル感度を測定するベンチマークである。
論文 参考訳(メタデータ) (2026-09-07T12:56:44Z) - Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience [1.3299507495084417]
不均一なピアが正直なエージェントのリビジョン行動をどのように変えるかを測定する。
誠実なピアは有害なリビジョンを著しく低くし、敵のピアはそれを逆転させる。
また,対立する同族同族者が存在する場合の効果も測定した。
論文 参考訳(メタデータ) (2026-06-18T06:06:28Z) - Collaborative Disagreement Resolution for Scalable Oversight [26.071237160687243]
分解分解能は、非専門家モデルが真実を識別するのに役立ち、標準的な議論では 49.2% よりも62.1% の精度で判断できる。
本研究は,敵の説得から協調的真理探索まで,スケーラブルな監視プロトコルを再考する実証的証拠を提供する。
論文 参考訳(メタデータ) (2026-06-02T12:55:49Z) - The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation [68.98390038721963]
問題クリティカルな事実の最大72%を,マルチエージェントによる議論で消し去ることを示す。
保持された証拠は誤解を招くことなく問題を再構築し、最終的なスタンスをベースモデルに固定し、単一の悪意のあるエージェントが誤った情報を共有コンテキストに注入することができる。
我々は、どの事実、不確実性、正当な不一致が相互作用を生き残るかを測定する評価を求める。
論文 参考訳(メタデータ) (2026-06-02T02:15:40Z) - MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation [51.32912774464992]
大規模な言語モデルは、しばしば完全に指定されたプロンプトからタスクを解くが、同じ要求が複数のターンに広がると分解する。
本研究は, モデル自体の方針から, 履歴をクリアした基準を用いて汚染を低減させる, オンライン自己蒸留法であるMAIGOを提案する。
ミドルターンの場合、MAIGOは、ユーザ可視のシャードプレフィックスを保持しながら、事前のアシスタント応答を削除します。
論文 参考訳(メタデータ) (2026-05-26T15:38:46Z) - Debate Helps Weak Judges Reward Stronger Models [3.8081143468439147]
評論は、批評家の能力が審査員の能力を超えなければならない場合に、コンサルタントの基準を判断する上で有効であることを示す。
我々のセットの2つの非対応ペアでは、議論はヌルエフェクトを生じ、批判者が書き起こしに入ると、検証率はパーセンテージポイント減少する。
これらの結果は、検証可能な領域におけるトレーニング不要なスケーラブルな監視のための、より安価なプリミティブであることを示唆している。
論文 参考訳(メタデータ) (2026-05-26T13:02:35Z) - GRASP: Deterministic argument ranking in interaction graphs [65.66879897437157]
全体的判断はモデル間不一致に悩まされていることを示す。
この不安定性は、議論の複雑な相互作用構造を1つの不透明なスコアに崩壊させることから生じる。
安定な局所的相互作用判断をグローバルなランキングに集約する決定論的なフレームワークであるGRASPを提案する。
論文 参考訳(メタデータ) (2026-05-18T21:49:02Z) - Measuring Opinion Bias and Sycophancy via LLM-based Persuasion [8.399156116912904]
提案手法は,提案するトピックに対して,アシスタントが持つ意見を検出する方法である。
直接探索は、シミュレーションされたユーザーから圧力をエスカレートする5ターンにわたってモデルの意見を求める。
間接的調査は決して意見を求めず、議論的な議論においてモデルを関与させ、それがどのように譲歩し、抵抗し、あるいは反弁論をするかを通してバイアスを漏らす。
論文 参考訳(メタデータ) (2026-04-23T11:34:06Z) - Towards Scalable Oversight with Collaborative Multi-Agent Debate in Error Detection [81.52796950244705]
自己診断は、信頼できる外部からのフィードバックがなければ、複雑なタスクでは信頼できない。
我々は,新たなコラボレーティブMADプロトコルであるColMADを導入し,MADを非ゼロ和ゲームとして再構成する。
ColMADは従来の競合MADよりも19%優れていた。
論文 参考訳(メタデータ) (2025-10-23T19:46:00Z) - Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding [40.78154629252038]
曖昧なクレームにバイナリラベルを強制すると、評価の信頼性が低下する。
請求項のニュアンス評価を提供する方法として,LCM生成した要約の編集を紹介する。
我々は,ARMが主張の忠実性に関するアノテータ合意において,絶対的な21%の改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-04-01T19:08:24Z) - When Persuasion Overrides Truth in Multi-Agent LLM Debates: Introducing a Confidence-Weighted Persuasion Override Rate (CW-POR) [0.46040036610482665]
多くの実世界のシナリオでは、1つの大言語モデル(LLM)が矛盾する主張に遭遇する可能性がある。
1つのLCMベースのエージェントは、TruthfulQAから現実的な回答を提供し、もう1つのエージェントは、虚偽を積極的に擁護し、同じアーキテクチャが裁判官として機能する。
信頼度重み付き説得率(CW-POR)を導入し、裁判官がどの程度の頻度で騙されるかだけでなく、その誤った選択をいかに強く信じるかを捉える。
論文 参考訳(メタデータ) (2025-04-01T02:45:02Z) - On scalable oversight with weak LLMs judging strong LLMs [67.8628575615614]
我々は、2つのAIが1人の裁判官を納得させようとする議論、すなわち1人のAIが1人の裁判官を説得し、質問をする。
大規模言語モデル(LLM)をAIエージェントと人間の判断のためのスタンドインの両方として使用し、判断モデルがエージェントモデルよりも弱いと判断する。
論文 参考訳(メタデータ) (2024-07-05T16:29:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。