論文の概要: CLM-as-a-Judge: Evaluating an Open Contrastive Decision Model on Public Judge Benchmarks
- arxiv url: http://arxiv.org/abs/2610.07177v1
- Date: Mon, 05 Oct 2026 18:01:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.578814
- Title: CLM-as-a-Judge: Evaluating an Open Contrastive Decision Model on Public Judge Benchmarks
- Title(参考訳): CLM-as-a-Judge:公開審査基準に基づくオープンコントラスト決定モデルの評価
- Abstract要約: オープンコントラスト決定モデルは、ハード・パブリック・ベンチマークの審査員としてほぼ偶然である。
矛盾は+0.401まで過信されるが、保留された校正アイテムに1つのプールされた温度が適合し、予想される校正誤差は0.062まで修復される。
しかし、自信に満ちたカスケードは0.923から1.000のアイテムを登録済みの0.97保持バーの強い判事にエスカレートする。
- 参考スコア(独自算出の注目度): 0.010480658740597679
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An open contrastive decision model is near chance as a judge on the hard public benchmarks: Contrastive-LM/CLM-v0.1-8B scores between 0.351 (best- of-four, chance 0.250) and 0.593 (pairwise, chance 0.500), is statistically indistinguishable from coin flipping on RM-Bench and JudgeBench, and answers every HaluEval item with one constant label, matching the trivial always-first baseline at 0.581. Judges with the same parameter count score far higher everywhere: a reward model reaches 0.764 to 0.976 and a generative judge 0.611 to 0.778, and every gap to CLM is significant after Benjamini-Hochberg correction. Two properties do work. Raw confidences are overconfident by up to +0.401, yet one pooled temperature fit on held-out calibration items repairs expected calibration error to at most 0.062, and the repaired confidence ranks the model's own errors above chance on three of six benchmarks. The decision order-flip rate is 0.0002 against 0.2188 for the generative judge, and the length-preference shift is -0.023 against -0.217. The confidence-gated cascade, however, escalates between 0.923 and 1.000 of items to the strong judge at the preregistered 0.97 retention bar: calibrated confidence about a near-chance judge has almost nothing to keep. The design: five public preference benchmarks and one hallucination benchmark with real labels, scored under a preregistration frozen before any test item was seen, against generative, reward-model, and trivial baselines, with per-item predictions released.
- Abstract(参考訳): Contrastive-LM/CLM-v0.1-8B スコア 0.351 (best-of-four, chance 0.250) と 0.593 (pairwise, chance 0.500) のスコアは、RM-Bench と judgeBench のコインフリップと統計的に区別できない。
報酬モデルが 0.764 から 0.976 に達し、生成的判断が 0.611 から 0.778 となり、ベンジャミン=ホックベルク修正後の CLM へのギャップは大きい。
2つのプロパティが機能します。
高い信頼度は+0.401まで過大評価されるが、保留中のキャリブレーションアイテムに1つのプールド温度が適合し、予想されるキャリブレーション誤差は0.062まで修復され、修理された信頼度は6つのベンチマークのうち3つのベンチマークでモデル自身のエラーを上回っている。
決定順序-フリップ率は0.0002対0.2188であり、長基準シフトは-0.023対-0.217である。
しかし、自信に満ちたカスケードは、0.923から1.000のアイテムを事前登録された0.97保持バーの強い裁判官にエスカレートする。
デザイン:5つのパブリックな選好ベンチマークと1つの幻覚ベンチマークが実際のラベル付きで、テスト項目を見る前に事前登録でスコアされ、生成的、報酬モデル、自明なベースラインに対して、イテムごとの予測がリリースされている。
関連論文リスト
- Calibrated Answers About Randomized Trials From a 4-Billion-Parameter Open Model: A Registered Test and a License-Clean Release [0.0]
Fiorillo v0.5は、各回答の確率で型付き質問に答えるオープンモデルである。
その主要な専門家はランダム化裁判の論文を読み、6,144個のトークンにカットし、介入が著しく増加したかどうかを答える。
論文 参考訳(メタデータ) (2026-10-04T15:09:39Z) - AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation [35.18016233072556]
AGO AI Quality Gateは、産業RAGアセスメントエンゲージメントにデプロイされるエビデンスファーストの品質ゲートフレームワークである。
AGOは4つの重要なコンポーネントを統合している。データ不足を処理し、エラーを明確な結果として判断する4状態決定モデルだ。
RAGBenchは、12データセットにわたる100kの注釈付きRAGトレースの公開ベンチマークである。
論文 参考訳(メタデータ) (2026-10-01T07:24:04Z) - Pinned and Still Unstable: Within-Judge Verdict Variance and the Noise Floor of LLM-as-Judge Leaderboards [0.0]
LLM評価は、審査員を固定されたモデルバージョンに固定し、温度ゼロで復号すると再現可能な判定が得られると仮定する。
この仮定は、LLM-as-Judgeがクラウドサービスインフラ上でどのように運用されているかという特性として失敗することを示す。
論文 参考訳(メタデータ) (2026-09-27T00:19:41Z) - JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models [25.5874772119945]
JevAdvBench は RLCD モデルの最初の敵対的ベンチマークである。
ラベルではなく、モデル自身のクリーンな決定に対して攻撃された各決定をスコア付けし、同じ再実行による変更に対して読み取る。
Jev-1.13.0では、リワードは再実行ベースラインの1.2パーセント以内に留まり、スキーマ外のフィールドはモデルに到達しない。
論文 参考訳(メタデータ) (2026-09-25T11:32:19Z) - Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings in Open-Ended Theory-of-Mind Tracking [0.5735035463793009]
Open-ended Theory-of-Mind (ToM) トラッカーは有限参照を欠く有効な信念を出力する。
有限参照+マーチャントパイプラインは、不正な出力をマークし、適切なスコアモデル選択をリバース可能なプロキシラベルを生成する。
論文 参考訳(メタデータ) (2026-08-26T11:36:31Z) - Ask Which, Not How Good: Sizing Benchmarks Scored by an LLM [0.47745223151611654]
LLM判事によるベンチマークは、通常1点の10分の1の違いを判断するが、これらのベンチマークの解像度は測定されていない。
測定対象としてシステムを扱い,373,019の判断をシステム,項目,判断,相互作用成分に分解する。
論文 参考訳(メタデータ) (2026-08-17T09:08:49Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment [26.786161923794115]
大規模言語モデル(LLM)は、推論品質の評価手段としてますます使われていますが、その信頼性と支払いリスク設定の偏りはよく分かっていません。
本稿では,Merchant Category Code(MCC)に基づく商業リスク評価において,LCM推論を評価するための構造化マルチ評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-04T22:55:16Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。