論文の概要: LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning
- arxiv url: http://arxiv.org/abs/2607.10139v2
- Date: Mon, 20 Jul 2026 01:48:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.203884
- Title: LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning
- Title(参考訳): 陪審員としてのLLM:LLM推論のためのプロセスリワードモデルより優れたクロスモデルコンセンサス
- Abstract要約: モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
- 参考スコア(独自算出の注目度): 6.241883798820154
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Selecting the correct answer from a pool of candidate reasoning chains is the engine of test-time scaling, yet the standard selectors each carry a cost: self-consistency inherits the errors of the single model it resamples, and trained reward models need labeled data and transfer poorly off-distribution. We study a third signal, free at inference time: cross-model consensus, the degree to which independently trained models, each solving the problem once, agree on a final answer. We treat the panel as an LLM-jury, in which the structure of agreement, not any model's score of another, is the verification signal. Across seven benchmarks it selects correct answers better than self-consistency and far better than a model scoring its own candidates: on competition math it closes the entire gap to an oracle selector, while self-scoring closes almost none. The mechanism is error decorrelation: independently trained models err differently, so their wrong answers scatter while the correct one accumulates agreement. We make this precise with a parameter-free law, derived in closed form, that predicts consensus accuracy from three measured panel statistics to a mean absolute error of $0.03$ and exposes the method's ceiling: a shared-error floor where models share a misconception, near zero on math but non-trivial on science. Against four trained verifiers spanning discriminative, outcome, and generative reward models, the free LLM-jury matches the strongest inside their math training domain and is the top selector outside it. Cross-model consensus is thus a verifier we can characterize in advance: a law that says when to trust it, and a floor that marks where it cannot.
- Abstract(参考訳): 正しい答えを候補推論チェーンのプールから選択することは、テストタイムスケーリングのエンジンであるが、標準セレクタはそれぞれコストがかかる: 自己整合性は、再サンプリングする単一モデルのエラーを継承する。
モデル間のコンセンサス(モデル間のコンセンサス)、独立に訓練されたモデルの度合い(各モデルが一度解決した度合い)は最終解に一致する。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
7つのベンチマークで、自己整合性よりも正確な回答を選択し、独自の候補を評価するモデルよりもはるかに優れている。
独立に訓練されたモデルが異なるので、正しいモデルが合意を蓄積している間、間違った答えが散らばる。
我々は,3つのパネル統計値から平均絶対誤差0.03ドルまでコンセンサス精度を予測し,提案手法の天井を露呈するパラメータフリー法則を用いて,これを正確にする: モデルが数学ではゼロに近いが科学では自明ではない誤認識を共有する共有エラーフロア。
差別的、結果、生成的報酬モデルにまたがる4つの訓練された検証対象に対して、自由 LLM-jury は数学の訓練領域の中で最強であり、その外で最も高いセレクタである。
クロス・モデル・コンセンサス(英語版)は、いつそれを信頼すべきかという法則と、それができない場所を示すフロアを前もって特徴付けることができるバリデーションである。
関連論文リスト
- Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation [52.58737865652009]
NLPにおけるMultiple-choice Question answering (MCQA)ベンチマークは、数右スコアリング(精度)を用いる。
教育試験において、スコアリング方式は、応答モードモデルが従うこと、および応答のグレーディングルールの組み合わせであり、どの能力に報酬を与えるかを規定する重要な設計選択である。
我々は、MCQAが6つの教育にインスパイアされた6つのスキームで、正確性を超えた能力を評価することで、数字右の代替手段がどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-08-30T16:35:22Z) - Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization [1.1316247605466565]
正解が常にオプションAである数学問題に対してGRPOを用いて言語モデルを訓練し、不偏解位置を持つ未知のテストセットで評価する。
Qwen2.5、Llama 3.x、Gemma-3のモデルでは、より小さなモデルではオプションAレートが0.90を超えている。
有能なモデルは、Aを選択しながら正しい数値解に到達した推論を生成する。
論文 参考訳(メタデータ) (2026-08-15T23:13:57Z) - Learning When to Trust via Selective Context Preference Optimization [34.54211638111961]
言語モデルは次第に外部の信号に答えを条件付けている。
誤解を招く人は正しい答えを間違えることがある。
私たちはその問題を選択的信頼と再考した。
論文 参考訳(メタデータ) (2026-08-06T17:59:58Z) - When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals [0.0]
LLM-as-judgeは、企業パイプラインでAIシステムを評価する上で、ますますデフォルトになっている。
判断者間の整合性、あるいはモデル自身のサンプルが正当性を示していることを示す。
大規模なクロスランナー研究において、合意がいつ有用なプロキシであるかを問う。
論文 参考訳(メタデータ) (2026-07-09T02:46:51Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Cross-Model Disagreement as a Label-Free Correctness Signal [10.66607150500579]
クロスモデル不一致は、既存の生産システムにドロップできる正確性指標である。
検証モデルからの生成は不要であり、正当性ラベルは不要である。
その結果、ラベルなしの正当性推定に対する実践的で訓練のないアプローチとして、クロスモデル不一致が確立された。
論文 参考訳(メタデータ) (2026-03-26T13:46:22Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - How Can I Publish My LLM Benchmark Without Giving the True Answers Away? [3.4155322317700585]
大規模言語モデル(LLM)ベンチマークをインターネット上で公開することで、将来のLLMを汚染するリスクがある。
一般的な緩和策は、ベンチマークを非公開にし、参加者がモデルや予測をオーガナイザに提出できるようにすることである。
質問に対する根本的回答を完全に開示することなく,ベンチマークを公開する方法を提案する。
論文 参考訳(メタデータ) (2025-05-23T16:57:34Z) - Ranked from Within: Ranking Large Multimodal Models Without Labels [73.96543593298426]
ソフトマックス分布から導かれる不確実性スコアは,様々なタスクにまたがるランキングモデルに対して,ロバストな基礎となることを示す。
これにより、ラベルのないデータに対するLMMのランク付けが容易になり、手動のアノテーションを必要とせずに、多様なターゲットドメインのモデルを選択するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-12-09T13:05:43Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。