論文の概要: Collaborative Disagreement Resolution for Scalable Oversight
- arxiv url: http://arxiv.org/abs/2607.01251v1
- Date: Tue, 02 Jun 2026 12:55:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.635869
- Title: Collaborative Disagreement Resolution for Scalable Oversight
- Title(参考訳): スケーラブルな監視のための協調的分解分解能
- Abstract要約: 分解分解能は、非専門家モデルが真実を識別するのに役立ち、標準的な議論では 49.2% よりも62.1% の精度で判断できる。
本研究は,敵の説得から協調的真理探索まで,スケーラブルな監視プロトコルを再考する実証的証拠を提供する。
- 参考スコア(独自算出の注目度): 26.071237160687243
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Debate, where AI agents argue opposing positions, has emerged as a key approach to scalable oversight. However, debate faces a fundamental tension: models are incentivized to be persuasive to the judge, which may not always align with epistemic honesty. In this work, we propose an alternative paradigm: disagreement resolution, which reframes the interaction mechanism from adversarial debate to collaborative truth seeking. Drawing on principles from human mediation and conflict resolution, where mediators facilitate dialogue to help disputing parties reach consensus rather than adjudicating between them, we design an automated pipeline that adapts these strategies to AI oversight. Unlike standard debate where models argue for fixed positions, our pipeline directs models to collaboratively identify points of disagreement, examine the evidence for conflicting claims, and converge toward consensus or isolate the specific ''crux'' of their disagreement. We find that Disagreement Resolution consistently helps non-expert models identify the truth, achieving 62.1% judging accuracy compared to 49.2% for standard debate. Our results provide encouraging empirical evidence for rethinking the scalable oversight protocol from adversarial persuasion to collaborative truth-seeking.
- Abstract(参考訳): AIエージェントが反対の立場を主張する議論が、スケーラブルな監視に対する重要なアプローチとして浮上した。
しかし、議論は根本的な緊張に直面しており、モデルは裁判官に説得力を与えるように動機づけられる。
本研究では、対立する議論から協調的真理探索への相互作用機構を再構築する「不一致解決」という代替パラダイムを提案する。
仲裁と紛争解決の原則に基づいて、仲介者が対話を促進し、紛争当事者の意見が合意に達するのに役立つように、私たちはこれらの戦略をAIの監視に適応する自動パイプラインを設計します。
モデルが定位置を論じる標準的な議論とは異なり、我々のパイプラインはモデルに対して、不一致点を協調的に特定し、矛盾する主張の証拠を調べ、合意に向かって収束するか、不一致点の特定の 'crux'' を分離するように指示する。
不一致解決法は、非専門家モデルによる真実の識別を一貫して支援し、標準的な議論では 49.2% に対して 62.1% の精度で判定する。
本研究は,敵の説得から協調的真理探索まで,スケーラブルな監視プロトコルを再考する実証的証拠を提供する。
関連論文リスト
- Measuring AI Accountability Through Argumentation Analysis: Can Model Reasoning Withstand Scrutiny? [0.0]
現実的な曖昧さにもかかわらず機能するように設計された代替規格について検討する。
我々は、ウォルトンの議論スキームの理論とGovierの議論の緊急性に関する基準に基づく4相弁証法を用いる。
推論の異なるフレームに適応し、多重選択フレーミングを越えて拡張し、評定に先立つ推論とポストホックの正当化の両方を扱う。
論文 参考訳(メタデータ) (2026-09-04T12:40:39Z) - ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence [48.938290419832335]
我々は、モデル応答が、その基盤となる文書における矛盾する証拠をどのように認識するかを定量化する新しいメトリクスであるConflictScoreを紹介する。
我々のフレームワークは, 反応を原子的クレームに分解し, それぞれのクレームに対して各クレームをラベル付けし, それらのラベルを2つの補完的尺度に集約する。
論文 参考訳(メタデータ) (2026-06-24T23:00:09Z) - Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal [0.0]
マルチエージェントシステムは通常、投票、コンセンサスプロトコル、討論、フォールトトレラントアグリゲーションを通じて不一致を減らすように設計されている。
我々は、この目的が、エージェントエラーよりも真の規範的不確実性を反映しているような、バリューラデンなタスクには不十分であると主張している。
本稿では,推論トレースとエージェント決定を記号的不一致状態に抽象化する知識表現層を提案する。
論文 参考訳(メタデータ) (2026-06-02T21:21:02Z) - The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation [68.98390038721963]
問題クリティカルな事実の最大72%を,マルチエージェントによる議論で消し去ることを示す。
保持された証拠は誤解を招くことなく問題を再構築し、最終的なスタンスをベースモデルに固定し、単一の悪意のあるエージェントが誤った情報を共有コンテキストに注入することができる。
我々は、どの事実、不確実性、正当な不一致が相互作用を生き残るかを測定する評価を求める。
論文 参考訳(メタデータ) (2026-06-02T02:15:40Z) - GRASP: Deterministic argument ranking in interaction graphs [65.66879897437157]
全体的判断はモデル間不一致に悩まされていることを示す。
この不安定性は、議論の複雑な相互作用構造を1つの不透明なスコアに崩壊させることから生じる。
安定な局所的相互作用判断をグローバルなランキングに集約する決定論的なフレームワークであるGRASPを提案する。
論文 参考訳(メタデータ) (2026-05-18T21:49:02Z) - Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models [99.26398772227684]
我々は,人間とAIの協調的クレーム検証のためのフレームワークであるCo-FactCheckerを提案する。
Co-FactCheckerは専門家のフィードバックをトレース編集に変換する。
人間の評価は、マルチターン対話よりもCo-FactCheckerの方が好ましいことを示している。
論文 参考訳(メタデータ) (2026-04-15T10:35:00Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - Knowledge Divergence and the Value of Debate for Scalable Oversight [0.0]
AIフィードバックからの議論と強化学習は、高度なAIシステムのスケーラブルな監視方法として提案されている。
議論モデル間の知識の相違の幾何学を通して、議論の価値をパラメータ化することでこれを解析する。
議論とRLAIFの間の最初の公式な関係は、敵の監視プロトコルが正当化されたときの理解のための幾何学的基礎である。
論文 参考訳(メタデータ) (2026-03-05T15:36:08Z) - SAD: A Large-Scale Strategic Argumentative Dialogue Dataset [60.33125467375306]
実際には、議論はしばしばマルチターン対話として実現される。
大規模なtextbfStrategic textbfArgumentative textbfDialogue データセットは,392,822例からなる。
論文 参考訳(メタデータ) (2026-01-12T11:11:37Z) - AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs [0.13525723298325706]
我々は主観的な質問に議論を適用し、実験の前に大きな言語モデルの事前の信念を明示的に測定する。
我々は2つの議論プロトコルを逐次かつ同時に実装し、潜在的体系的バイアスを評価する。
本研究の主目的は, モデルが従来の信念よりも, 判断ペルソナと整合した姿勢を擁護する傾向にあることにある。
論文 参考訳(メタデータ) (2025-10-15T05:02:13Z) - AI Debate Aids Assessment of Controversial Claims [73.8907110799657]
我々は、AI論争が、議論の的になっている事実性主張の側面に対立する2つのAIシステムを議論させることで、偏見のある裁判官を真実に導くことができるかどうかを調査する。
研究Iでは、議論は人間の判断精度と信頼性の校正を継続的に改善し、コンサルタントを上回ります。
研究IIでは、人間のような人格を持つAI裁判官は、人格を持たない人格(70.1%)やデフォルトのAI裁判官(69.8%)よりも高い精度(78.5%)を達成する。
これらの調査結果は、AIの議論が、競争対象ドメインにおけるスケーラブルでバイアス耐性のある監視への有望な道であることを示している。
論文 参考訳(メタデータ) (2025-06-02T19:01:53Z) - From Argumentation to Deliberation: Perspectivized Stance Vectors for Fine-grained (Dis)agreement Analysis [17.184962277653902]
本稿では,計算的議論設定における議論の熟考的分析のためのフレームワークを開発する。
我々は、ある問題に関して異なる議論者や利害関係者の議論で表される偏見的姿勢のきめ細かい分析を行う。
我々は、この分析を、ある問題に対する全ての議論者の個人的観念的姿勢を特徴付けるパースペクティブ化されたスタンスベクトルで定式化する。
論文 参考訳(メタデータ) (2025-02-10T13:08:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。