論文の概要: Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue
- arxiv url: http://arxiv.org/abs/2608.26529v1
- Date: Thu, 27 Aug 2026 02:03:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.214086
- Title: Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue
- Title(参考訳): オープンエンド対話におけるペアワイズLLM判断のための多段階コンフォーマルリスク制御
- Abstract要約: オープンエンド対話におけるLLM-as-a-Judge評価のためのマルチエキスパートコンフォーマルリスク制御(CRC)アルゴリズムについて検討する。
まず、スコア平均化と決定投票という2つのマルチエキスパートCRC手法を設計し、スコアと判定レベルで集計する。
どちらの戦略も、均質な専門家パネルのシングルエキスパート手法よりも優れているが、異質なLCMの判断ではリスクは高いが、限られた範囲しか回復しない。
本稿では,初期しきい値比を用いて,専門家ごとに異なる尺度をキャプチャするMarginal-Calibrated Conformal Consensus (MC3)を提案する。
- 参考スコア(独自算出の注目度): 39.31787545232512
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we explore multi-expert Conformal Risk Control (CRC) algorithms for pairwise LLM-as-a-Judge evaluation in open-ended dialogue. Our core insight is that multi-expert aggregation offers a complementary remedy to CRC: whereas CRC controls risk at the decision threshold through abstention, aggregation sanitizes the scoring function at its source. Guided by this, we first design two multi-expert CRC methods: Score Averaging and Decision Voting, which aggregate at the score and decision levels, respectively. While both strategies outperform single-expert methods on homogeneous expert panels, on heterogeneous LLM judges they remain risk-valid but recover only limited coverage, because a uniform threshold cannot match the experts' distinct scoring scales. To resolve this issue, we further propose Marginal-Calibrated Conformal Consensus (MC3): it captures distinct per-expert scales via initial threshold ratios, while jointly tuning a unified decision function $C_t(x)$ applied identically in both calibration and test, thereby preserving exchangeability. To evaluate our framework, we construct Panel, a 1,800-pair human pairwise-preference benchmark for open-ended dialogue. It is built on responses generated by four open-weight LLMs over dialogue contexts from three domains (ESConv, MSC, DREAM), with full logit access. In experiments, we find that both Score Averaging and Decision Voting substantially improve accuracy and acceptance rate on homogeneous panels. Notably, MC3 extends these gains to heterogeneous panels by accommodating distinct per-expert scoring scales across all three datasets.
- Abstract(参考訳): 本稿では,オープンエンド対話におけるLLM-as-a-Judge評価のためのマルチエキスパートコンフォーマルリスク制御(CRC)アルゴリズムについて検討する。
我々の中核的な洞察は、マルチエキスパート・アグリゲーションは、CRCに補完的な対策を与え、CRCは、棄権によって決定しきい値のリスクを制御するが、アグリゲーションは、その情報源のスコアリング機能を浄化する。
そこで我々はまず,スコア平均化と決定投票という2つのマルチエキスパートCRC手法を設計した。
どちらの戦略も、均質な専門家パネルのシングルエキスパート手法よりも優れているが、均一な閾値は専門家の異なる評価尺度と一致しないため、不均一なLCMの判断ではリスクを負うが、限られた範囲のみを回復する。
この問題を解決するために,Marginal-Calibrated Conformal Consensus (MC3) を提案する。これは初期しきい値比によって異なる専門家単位の尺度をキャプチャし,統一された決定関数 $C_t(x)$ をキャリブレーションとテストの両方で同一に適用することにより,交換性を維持する。
このフレームワークを評価するために,オープンエンド対話のための1,800対の人間ペアワイズ参照ベンチマークであるPanelを構築した。
3つのドメイン(ESConv、MSC、DREAM)から対話コンテキスト上で4つのオープンウェイトLLMが生成した応答に基づいて構築され、完全なロジットアクセスが可能である。
実験の結果,Score Averaging と Decision Voting の両者が等質パネルの精度と受入率を大幅に向上させることがわかった。
特に、MC3はこれらのゲインを3つのデータセットすべてに異なる評価尺度を割り当てることで、異種パネルに拡張する。
関連論文リスト
- Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation [40.2978746802106]
LLM審査員は、きめ細かいルックスチェックリストに対する反応をますます評価している。
現在のメソッドは通常、それぞれを別々の推論コールで評価する。
その結果,どのルーリックが同一であるかによって,1つのルーリックシフトの判定が行われることがわかった。
我々は、4つの制御された操作を通して干渉を探索する測定フレームワークを開発した。
論文 参考訳(メタデータ) (2026-08-05T03:35:29Z) - Boosting Self-Consistency with Ranking [56.38798757709555]
自己整合性は、複数の推論パスをサンプリングし、最も頻繁な回答を選択することで、大きな言語モデルを改善する。
この制限は、自己整合性における解答選択をランク付け問題として再構成する、ランク付け改善自己整合性(RISC)に対処する。
論文 参考訳(メタデータ) (2026-06-03T16:12:30Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - Split the Differences, Pool the Rest: Provably Efficient Multi-Objective Imitation [49.86232017439639]
マルチ出力拡張行動クローン(MA-BC)について紹介する。
MA-BCは、振る舞いの衝突が観測されない状態-動作ペアをプールしながら、専門家データを分離する。
我々は,MA-BCが極小であることを示す,多目的模倣学習のための新しい下位境界を確立する。
論文 参考訳(メタデータ) (2026-05-12T11:49:08Z) - Autorubric: A Unified Framework for Rubric-Based LLM Evaluation [34.429649156970015]
大規模言語モデル(LLM)を評価するための統一フレームワークを提案する。
この論文で提案されているオープンソースのPythonフレームワークであるAutorubricで、それぞれのテクニックが実現されている。
Autorubricは、重み付き二分、順序、および名目基準をサポートしており、多数派、重み付き、一対一、無投票のアグリゲーションによるシングルジャッジとマルチジャッジのアンサンブルの評価である。
論文 参考訳(メタデータ) (2026-02-13T02:26:30Z) - Distribution-Calibrated Inference time compute for Thinking LLM-as-a-Judge [5.855996386998925]
大きな言語モデル(LLM)をペアの選好の判断に使用すると、単一サンプルレベルではノイズが残る。
本研究では,各項目ごとにn個の独立した思考型サンプルを生成する評価器の推論時間計算(ITC)について検討する。
論文 参考訳(メタデータ) (2025-12-02T18:46:47Z) - Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following [99.20581206115979]
Multi-Crit は、マルチモーダルな審査員が複数の基準に従い、信頼できる基準レベルの判断を下す能力を評価するためのベンチマークである。
25 LMMの包括的分析から,1) プロプライエタリなモデルは,(特にオープンエンド評価において) 多元的基準への一貫した従順性を維持するのに苦慮している,2) オープンソースのモデルは,様々な基準に柔軟に遅れている,3) 全体論的判断信号による批判的微調整は,視覚的根拠を高めるが,多元的基準レベルの判断に一般化することができない,などが分かる。
論文 参考訳(メタデータ) (2025-11-26T18:35:17Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Classifying Inconsistency in AHP Pairwise Comparison Matrices Using Machine Learning [0.0]
本研究では,三進選好逆転(PR)を利用して,一貫性のより堅牢で解釈可能な評価を行う新しい方法を提案する。
PR法は97%の精度を達成し、CR法(Consistency Ratio, Consistency Ratio)の50%をはるかに上回り、偽陰性率は5.5%に比べてわずか2.6%である。
論文 参考訳(メタデータ) (2025-05-07T14:17:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。