論文の概要: A Theory of Post-hoc Debate Judgement
- arxiv url: http://arxiv.org/abs/2608.19002v1
- Date: Wed, 19 Aug 2026 15:03:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.435623
- Title: A Theory of Post-hoc Debate Judgement
- Title(参考訳): ポストホック論争判決の理論
- Authors: Xiang Yin, Adam Dejl, Antonio Rago, Lihu Chen, Francesca Toni,
- Abstract要約: エージェントが議論を行うすべての設定に適用可能な,新たな議論判断理論を開発し,検証する。
我々は、多くの形式的特性を、懸念、堅牢性、基礎性、説明可能性として、一般的には、議論の判断が満足するために要求されるであろういくつかの形式的特性を識別する。
両手法が類似した精度性能を示すことを示すが, 前者は形式的保証を欠いている可能性がある。
- 参考スコア(独自算出の注目度): 29.17703958536647
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Debates have recently emerged as a useful methodology for agentic AI to improve performance as well as to aid explainability and user engagement. For example, LLM-empowered agents may debate internally (with themselves) and/or externally (with other agents). In many settings where debates are used, debates' outcomes and resulting outputs are determined post-hoc by external judges, often LLMs. In this paper we develop and test a novel theory of debate judgement applicable to all settings where agents engage in debates by providing pros and cons for their opinions therein. Specifically, we identify a number of formal properties that debate judgement may be required to satisfy in general, as concerns reproducibility, robustness, groundedness and explainability. Then, we explore their satisfaction formally and/or experimentally, for claim verification settings, for two specific alternative debate judgement methods: variants of the LLMs as a judge idea and formal semantics drawn from computational argumentation. We show that the two methods give similar accuracy performances but the former may lack formal guarantees that the latter brings. Overall, our study indicates argumentation semantics as an ideal candidate for principled judges in debate-driven AI.
- Abstract(参考訳): ディベートは最近、エージェントAIがパフォーマンスを改善し、説明可能性やユーザエンゲージメントを支援するための有用な方法論として登場した。
例えば、LDMを動力とするエージェントは、内部(自身)および外部(他のエージェント)で議論することがある。
議論が使用される多くの環境では、議論の結果と結果のアウトプットは、外部の審査員によって、しばしばLLMによって決定される。
本稿では,エージェントが議論に携わるすべての場面に適用可能な,新たな議論判断理論を開発し,検証する。
具体的には、再現性、堅牢性、基礎性、説明可能性に関する懸念として、判断を議論する上で一般的に必要となるいくつかの形式的特性を特定します。
そこで我々は,LLMの判断概念としての変種と,計算的議論から引き出された形式的意味論の2つの代替的議論判断法について,その満足度を形式的および実験的に検討する。
2つの手法が類似した精度性能を示すことを示すが、前者は後者がもたらす正式な保証を欠いている可能性がある。
本研究は、議論駆動型AIにおける原則的判断者にとって、議論の意味論が理想的な候補であることを示す。
関連論文リスト
- Knowledge Divergence and the Value of Debate for Scalable Oversight [0.0]
AIフィードバックからの議論と強化学習は、高度なAIシステムのスケーラブルな監視方法として提案されている。
議論モデル間の知識の相違の幾何学を通して、議論の価値をパラメータ化することでこれを解析する。
議論とRLAIFの間の最初の公式な関係は、敵の監視プロトコルが正当化されたときの理解のための幾何学的基礎である。
論文 参考訳(メタデータ) (2026-03-05T15:36:08Z) - AI-Assisted Moot Courts: Simulating Justice-Specific Questioning in Oral Arguments [7.808898285349819]
そこで我々は,モットコートスタイルのトレーニングにおいて,AIモデルが正義固有の質問を効果的にシミュレートできるかどうかを検討する。
本稿では,プロンプトベースおよびエージェントによる口頭弁論シミュレータの構築と評価を行う。
シミュレーションされた質問は、人間アノテータによって現実的と見なされることが多く、基礎的な真実の実質的な法的問題への高いリコールが達成されている。
論文 参考訳(メタデータ) (2026-03-05T01:45:28Z) - R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory [18.007379464461312]
本稿では,議論的メモリ上に構築されたマルチターン討論を生成するエージェントフレームワークであるR-Debaterを提案する。
R-Debaterは、ケースライクな証拠を検索するための議論知識ベースと、前回の議論は、旋回するコヒーレントな発話を構成するロールベースのエージェントと統合する。
論文 参考訳(メタデータ) (2025-12-31T07:33:12Z) - Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents [13.626715532559079]
複数のLLMエージェントを用いた議論駆動手法を採用した最初のクレーム検証フレームワークであるDebateCVを提案する。
本フレームワークでは,2つのデバタがクレームに対して反対の立場をとり,複数ラウンドの議論を行う一方,モデレーターは議論を評価し,正当化とともに評決を行う。
実験の結果,提案手法は,証拠品質の異なる既存のクレーム検証方法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2025-07-25T09:19:25Z) - Arbiters of Ambivalence: Challenges of Using LLMs in No-Consensus Tasks [52.098988739649705]
本研究では, LLMのバイアスと限界について, 応答生成器, 判定器, 討論器の3つの役割について検討した。
我々は、様々な先行的曖昧なシナリオを含む例をキュレートすることで、合意なしのベンチマークを開発する。
以上の結果から, LLMは, オープンエンドの回答を生成する際に, 曖昧な評価を行うことができる一方で, 審査員や討論者として採用する場合は, 合意なしのトピックにスタンスを取る傾向が示唆された。
論文 参考訳(メタデータ) (2025-05-28T01:31:54Z) - Debating for Better Reasoning: An Unsupervised Multimodal Approach [56.74157117060815]
議論のパラダイムをマルチモーダルな設定に拡張し、より弱いモデルがより強力なモデルの性能を監督し、強化する可能性を探る。
視覚的質問応答 (VQA) に焦点をあて, 2つの「目に見える」専門家の視覚言語モデルが解答について議論する一方, 「盲目」(テキストのみ)の判断は議論の品質にのみ依存する。
この枠組みでは, 専門家は信念に沿う回答のみを守り, 明示的な役割プレーの必要性を排除し, 専門家の不一致の事例に議論を集中させる。
論文 参考訳(メタデータ) (2025-05-20T17:18:17Z) - On scalable oversight with weak LLMs judging strong LLMs [67.8628575615614]
我々は、2つのAIが1人の裁判官を納得させようとする議論、すなわち1人のAIが1人の裁判官を説得し、質問をする。
大規模言語モデル(LLM)をAIエージェントと人間の判断のためのスタンドインの両方として使用し、判断モデルがエージェントモデルよりも弱いと判断する。
論文 参考訳(メタデータ) (2024-07-05T16:29:15Z) - Debatrix: Multi-dimensional Debate Judge with Iterative Chronological Analysis Based on LLM [51.43102092480804]
Debatrixは、Large Language Models (LLMs)に基づく自動ディスカッションジャッジである。
実世界の議論シナリオに合わせるため、私たちはPanelBenchベンチマークを導入し、システムの性能と実際の議論結果を比較した。
以上の結果から,LSMを直接使用して議論評価を行ない,顕著な改善が見られた。
論文 参考訳(メタデータ) (2024-03-12T18:19:47Z) - Reward Design for Justifiable Sequential Decision-Making [12.284934135116515]
本稿では,強化学習エージェントに対する議論に基づく報酬モデルを提案する。
議論に基づく報酬モデルにより得られるフィードバック信号で報酬を増大させることで、裁判官の好意的な政策が得られることを示す。
論文 参考訳(メタデータ) (2024-02-24T14:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。