論文の概要: When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
- arxiv url: http://arxiv.org/abs/2607.08065v1
- Date: Thu, 09 Jul 2026 02:46:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.39645
- Title: When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
- Title(参考訳): LLMの合意は正しいか? 自信の信号としての自己整合性と相互モデル合意を振り返る
- Authors: Kaihua Ding,
- Abstract要約: LLM-as-judgeは、企業パイプラインでAIシステムを評価する上で、ますますデフォルトになっている。
判断者間の整合性、あるいはモデル自身のサンプルが正当性を示していることを示す。
大規模なクロスランナー研究において、合意がいつ有用なプロキシであるかを問う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-as-judge (Zheng et al., 2023) is increasingly the default for evaluating AI systems in enterprise pipelines, often scaled to ensembles (Verga et al., 2024) or "mixture-of-experts" (Shazeer et al., 2017) panels of judges. These systems share a key assumption: that consistency -- agreement among judges, or among a model's own samples -- indicates correctness. We show this assumption is unreliable. Agreement is not accuracy: a model can agree with itself, and different models can agree with each other, out of shared bias, a memorized heuristic, or an option-position prior rather than truth. We ask when agreement is nonetheless a usable proxy, in a large-scale cross-runner study: 53 runners drew K=50 samples for assigned overlapping cases across comparisons of model tier, prompting, and scale on GPQA Diamond and AIME -- 265,000 samples. Using majority-correctness as the deployment label and a hierarchical runner-clustered bootstrap, agreement is a positive but weak predictor (rho 0.20-0.59, all positive under item-clustered resampling) whose usefulness is regime-dependent: best for unsaturated mid-tier models and for allocating compute, and worst -- over-confident yet no more accurate -- for the most consistent frontier model (agreement >=0.8 on 77% of GPQA case-result entries, 48% of those wrong). An exploratory cross-family check on three Claude tiers shows the same frontier over-confidence, with confident errors recurring across providers above a marginal-preserving null. Self-consistency is thus a conditional proxy for correctness, not a standalone confidence score. We publicly release the de-identified per-run rows and answer distributions.
- Abstract(参考訳): LLM-as-judge (Zheng et al , 2023) は、企業パイプラインにおけるAIシステム評価のデフォルトとしてますます多くなり、審査員のアンサンブル (Verga et al , 2024) や "mixture-of-experts" (Shazeer et al , 2017) のパネルに拡張されている。
これらのシステムは重要な前提を共有している: 整合性 -- 審査員間の合意、またはモデルのサンプル間の合意 -- は正確性を示している。
この仮定は信頼できない。
モデルはそれ自身と一致し、異なるモデルは、共有バイアス、記憶されたヒューリスティック、真実よりもむしろオプションポジションから、互いに一致することができる。
53人のランナーが、モデル層の比較、プロンプト、GPQA DiamondとAIME --265,000のサンプルに対して、割り当てられた重複するケースに対して、K=50のサンプルを描画しました。
デプロイラベルとしてマジョリティの正確さと階層的なランニングクラスタのブートストラップを使用することで、合意は肯定的だが弱い予測子(rho 0.20-0.59, all positive under item-clustered resampling)であり、その有用性は構造に依存している。
3つのクロード層に関する探索的なクロスファミリーチェックでは、同じフロンティアの過信が示され、限界保存null以上のプロバイダ間で確実にエラーが繰り返される。
したがって、自己整合性は、スタンドアローンの信頼スコアではなく、正確性のための条件付きプロキシである。
我々は、未同定のランごとの行と回答の分布を公開します。
関連論文リスト
- CALIBER: Calibrating Confidence Before and After Reasoning in Language Models [16.376895132982938]
本稿では,CALIBER(Calibration Before and After Reasoning)について紹介する。
この統一されたプロトコルの下で、CALIBERはBigMathDigitsにおける最強の単一信頼ベースラインよりも、期待エラー(ECE)を52.5%削減した。
より大きな30Bモデルでは、CALIBERはBrierスコアとAUROCの競争力を維持しながら、BigMathDigitsで最高のECEを達成する。
論文 参考訳(メタデータ) (2026-06-23T08:03:20Z) - Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias [0.0]
実際に判断の検証は、偶然を正さず、系統的に差別能力を過度に過大評価する、正確な一致の合意に依存している。
MT-Bench, judgeBench, RewardBenchの9つのプロバイダから21人の審査員が, 118ラン以上の3つのプロトコル(アグリメント, 一貫性, バイアス監査)と約541,000の個人判定で評価された。
論文 参考訳(メタデータ) (2026-06-17T19:37:13Z) - Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution [0.0]
予測市場は、不確実な出来事を予測するために集合的なインテリジェンスを集約する。
既存のオラクルシステムは、高速だが不安定な自動化と、正確だがコストのかかる人間の仲裁とをトレードオフする。
マルチエージェントLLMアーキテクチャが単一モデルベースラインよりもオラクル分解能を向上できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-05-29T03:44:19Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Arbitrariness and Social Prediction: The Confounding Role of Variance in
Fair Classification [31.392067805022414]
異なる訓練されたモデル間での予測のばらつきは、公正なバイナリ分類における重要な、未探索のエラーの原因である。
実際には、いくつかのデータ例のばらつきは非常に大きいので、決定を効果的に任意にすることができる。
予測が任意である場合に分類を省略するアンサンブルアルゴリズムを開発した。
論文 参考訳(メタデータ) (2023-01-27T06:52:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。