論文の概要: Robust Conformal Consensus: Multi-Agent LLM-as-a-Judge Interval Evaluation with Conformal Prediction
- arxiv url: http://arxiv.org/abs/2609.06367v1
- Date: Sun, 06 Sep 2026 03:55:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.231077
- Title: Robust Conformal Consensus: Multi-Agent LLM-as-a-Judge Interval Evaluation with Conformal Prediction
- Title(参考訳): ロバストコンフォーマルコンセンサス:コンフォーマル予測を用いたマルチエージェントLCM-as-a-Judge間隔評価
- Authors: Lihui Liu,
- Abstract要約: マルチエージェントLCM-as-a-Judge評価のためのロバストな不確実性推定フレームワークを提案する。
異なるLLM裁判官の間隔を考慮し、より安定かつ信頼性の高い不確実性推定値を得る。
提案手法は,複数の審査員にまたがる間隔に基づくアグリゲーションにより,より安定した評価結果が得られることを示す。
- 参考スコア(独自算出の注目度): 7.792321858331646
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-a-Judge has emerged as a promising paradigm for evaluating natural language generation. However, the uncertainty associated with such evaluations remains largely unexplored, which limits their reliability in real-world applications. Although conformal prediction offers a principled framework for uncertainty quantification, existing approaches typically apply it to a single LLM judge, overlooking the variability introduced by using different LLM evaluators. In this work, we propose a robust uncertainty estimation framework for multi-agent LLM-as-a-Judge evaluation. Our approach constructs conformal prediction intervals for LLM-based scores from multiple LLMs. By considering intervals from different LLM judges, we obtain more stable and reliable uncertainty estimates. Extensive experiments demonstrate that our method produces valid prediction intervals with coverage guarantees, and that interval-based aggregation across multiple judges leads to more stable evaluation outcomes.
- Abstract(参考訳): LLM-as-a-Judgeは、自然言語生成を評価するための有望なパラダイムとして登場した。
しかし、そのような評価にまつわる不確実性はほとんど未解明であり、現実のアプリケーションにおける信頼性を制限している。
共形予測は、不確実性定量化のための原則化された枠組みを提供するが、既存のアプローチは、通常、異なるLLM評価器を用いて導入された変動性を見越して、1つのLLM裁判官にそれを適用している。
本研究では,マルチエージェントLCM-as-a-Judge評価のためのロバストな不確実性推定フレームワークを提案する。
提案手法は,複数 LLM からの LLM スコアに対する共形予測間隔を構成する。
異なるLLM裁判官の間隔を考慮し、より安定かつ信頼性の高い不確実性推定値を得る。
広範囲な実験により,本手法はカバレッジ保証付きで有効な予測区間を生成し,複数の判断者間での間隔に基づくアグリゲーションにより,より安定した評価結果が得られることが示された。
関連論文リスト
- Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation [68.106428321492]
大規模言語モデル (LLM) は高度な推論能力を示し、ロボットが自然言語の命令を理解し、適切な接地で高レベルな計画を生成することができる。
LLMの幻覚は重大な課題であり、しばしば過度に信頼され、不一致または安全でない計画に繋がる。
本研究は, 信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性評価を別々に評価するものである。
論文 参考訳(メタデータ) (2025-10-09T10:26:58Z) - Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction [13.958280616597385]
本研究は,LLMに基づくスコアリングの予測間隔を共形予測によって提供することにより,不確実性を分析するための最初の枠組みを示す。
我々は,共形予測がカバレッジ保証付きで有効な予測間隔を提供できることを示す広範な実験と分析を行う。
論文 参考訳(メタデータ) (2025-09-23T05:26:28Z) - Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge [0.3759936323189418]
大規模言語モデル(LLM)はますます強力でユビキタスなものになってきていますが、その性質はアウトプットの信頼性に課題をもたらします。
マクドナルドのオメガを利用したLCM判定の信頼性を厳格に評価するための新しい枠組みを提案する。
論文 参考訳(メタデータ) (2024-12-17T03:37:31Z) - Black-box Uncertainty Quantification Method for LLM-as-a-Judge [13.45579129351493]
LLM-as-a-Judge評価の信頼性を高めるために設計された不確実性を定量化する新しい手法を提案する。
生成された評価と可能な評価の関係を分析して不確実性を定量化する。
これらの関係を相互に評価し、トークン確率に基づく混乱行列を構築することにより、高いあるいは低い不確実性のラベルを導出する。
論文 参考訳(メタデータ) (2024-10-15T13:29:22Z) - Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge [84.34545223897578]
多くの領域で優れているにもかかわらず、潜在的な問題は未解決のままであり、その信頼性と実用性の範囲を損なう。
提案手法は, LLM-as-a-Judgeにおける各種類のバイアスを定量化し, 解析する自動バイアス定量化フレームワークである。
当社の作業は、これらの問題に対処するステークホルダの必要性を強調し、LLM-as-a-Judgeアプリケーションで注意を喚起します。
論文 参考訳(メタデータ) (2024-10-03T17:53:30Z) - Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates [11.948519516797745]
LLM審査員の信頼性とアライメントを評価・比較・可視化するオープンソースフレームワークを開発した。
以上の結果から,LLM判定性能に対するプロンプトテンプレートの影響や,LLM判定器とヒト評価器の中間的なアライメントレベルに有意な影響が示唆された。
論文 参考訳(メタデータ) (2024-08-23T11:49:01Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Benchmarking LLMs via Uncertainty Quantification [91.72588235407379]
オープンソースのLarge Language Models(LLM)の普及は、包括的な評価方法の緊急の必要性を強調している。
我々は不確実性定量化を統合した LLM のための新しいベンチマーク手法を提案する。
以上の結果より, 精度の高いLSMでは, 精度が低下する可能性があり, II) より大規模なLSMでは, より小型のLSMに比べて不確実性が高いこと, III) 命令ファインタニングではLCMの不確実性が高くなる傾向が示唆された。
論文 参考訳(メタデータ) (2024-01-23T14:29:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。