論文の概要: Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation
- arxiv url: http://arxiv.org/abs/2607.27984v1
- Date: Thu, 30 Jul 2026 10:29:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.511898
- Title: Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation
- Title(参考訳): 裁判官を分かち合い、ディフェデラルを学ぶ: スペシャライゼーションがLCMの評価に役立つ場所
- Abstract要約: 99,952 の公試例について検討した。
正しいルーブリックを供給すると、応答のみの制御よりもロックテストの精度が2.11ポイント向上する。
RewardBench 2では、報酬スコアを変更することなく0.6B-4B-8Bカスケードを通した正当性ヘッドの例を学習した。
- 参考スコア(独自算出の注目度): 0.1269104766024433
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Agentic systems have widened the gap between producing candidate outputs and reviewing them. This paper asks a practical architectural question: should domain specialization be built into an evaluator's weights, or into the rule that decides when its judgment can be trusted? We study 99,952 public, rubric-conditioned examples. Supplying the correct rubric improves locked-test accuracy by 2.11 points over a response-only control; replacing it with an unrelated rubric costs 2.66 points. Dividing the same training corpus among eight criterion-family LoRA judges, however, loses 10.05 points and cuts audited coverage at a 5% risk target from 24.44% to 5.43%. Matching the bank's stored capacity with one rank-64 adapter does not reproduce this loss. Nor is the result explained by learning rate or optimizer steps. Initializing the family adapters from a shared, trained judge recovers test accuracy to 76.85%, 19.94 points above scratch training at the same learning rate (95% interval 18.88-21.02). The result changes when specialization governs deferral rather than judgment. On RewardBench 2, learned correctness heads route examples through a 0.6B-4B-8B cascade without changing any reward score. Across 20 locked repartitions, the cascade attains 89.40% accuracy, compared with 84.75% for 8B alone, at 0.415 normalized parameter compute. Every run passes an exact one-sided 95% risk audit; margin-based rules remain near 84.8% accuracy while using at least 0.94 compute. These results suggest a qualified design rule: share the learning of judgment until there is enough data to justify a split, and place domain-specific adaptation in an audited release boundary.
- Abstract(参考訳): エージェントシステムは、候補出力の生成とレビューの間のギャップを広げている。
ドメインの特殊化を評価者の重みに組み込むべきか、それともその判断がいつ信頼できるかを決める規則に組み込むべきか?
99,952 の公試例について検討した。
正しいルーリックを供給することで、応答のみの制御よりもロックテストの精度が2.11ポイント向上し、無関係なルーリックに置き換える。
しかし、同じトレーニングコーパスを8人の審査員に分けた場合、10.05ポイントを失い、5%のリスクターゲットで監査対象を24.44%から5.43%に減らした。
銀行の格納容量を1つのランク64アダプタと一致させることは、この損失を再現しない。
学習率やオプティマイザのステップによって説明される結果でもない。
共有された訓練を受けた裁判官からファミリーアダプタを初期化すると、テスト精度は76.85%、19.94ポイントが同じ学習率(95%間隔18.88-21.02)でスクラッチトレーニングを上回っている。
結果が変わるのは、専門化が判断よりもdeferralを統治する時である。
RewardBench 2では、報酬スコアを変更することなく0.6B-4B-8Bカスケードを通した正当性ヘッドの例を学習した。
20個のロックされた再分割で、カスケードは89.40%の精度を達成し、8B単独では84.75%、正規化されたパラメータ計算は0.415である。
全てのランは、正確に片側95%のリスク監査をパスし、マージンベースのルールは、少なくとも0.94の計算を使いながら、84.8%の精度で残っている。
これらの結果は、分割を正当化する十分なデータがあるまで判断の学習を共有し、監査されたリリースバウンダリにドメイン固有の適応を配置する、という有資格な設計ルールを示唆している。
関連論文リスト
- Abstention Errors and Segment Support in CUAD: An Auditable Contract-Extraction Case Study [0.0]
本稿では,CUAD が発行した 102-contract test split に対する固定公開 RoBERTa チェックポイントの再現性評価について述べる。
30,464の返却候補文字列のうち19,562は注釈付き回答のない質問に現れる。
このシステムは2,938問のうち1,335問に答え、45.4%が偽陽性である。
論文 参考訳(メタデータ) (2026-09-07T21:26:53Z) - A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation [14.867869624585886]
評価器の構成妥当性を2次元プロファイルとして定式化する。
S と R は独立であり、スカラーの要約がすべての関連する比較を保存することはないことを示す。
これらの結果から, 評価対象構造の変化に対して, 高判定基準は弱い感度で共存できることが示唆された。
論文 参考訳(メタデータ) (2026-08-25T11:32:54Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators [10.23869027501654]
評価者はしばしば、欠陥のある推論、エージェントシステムの致命的な失敗、レビューのルーティング、トレーニングフィードバックの提供を通じて、正しいラベルを生成する。
根拠,規範,権威の3つのコアソースを通じて,評価者による説明責任の定式化を行う。これらのソースを評価すれば,判断更新を特徴付ける8セルの逆実判定キューブが得られる。
信頼に値する評価のための標準精度とともに、予測と認定を分離し、変換の一貫性を報告しなければならない。
論文 参考訳(メタデータ) (2026-08-21T10:01:58Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch [44.05969616406614]
Autoresearchは、変更を提案し、フルトレーニングジョブを実行し、メトリックを改善する変更を維持することによって、マシンラーニングコードを改善する。
本研究では,この事前執行判断の信頼性が,自動検索の軌道上でどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-07-30T05:08:15Z) - Theoria: Rewrite-Acceptability Verification over Informal Reasoning States [0.0]
このギャップを埋める検証アーキテクチャであるTheoriaを紹介します。
候補解は、型付き状態遷移のシーケンスに書き換えられる。
すべての遷移は独立して監査可能である。
論文 参考訳(メタデータ) (2026-07-01T17:56:42Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks [12.396822247035578]
目的抽出とメタ認知のためのベンチマークであるexMTを提案する。
マルチターン書き起こしが与えられた場合、モデルは1文ベース目標と自己報告された自信を出力しなければならない。
正確性は金の目標と類似性によって評価され、300の校正項目で1度閾値付けされる。
論文 参考訳(メタデータ) (2025-08-23T03:32:04Z) - Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making [38.75183725659772]
大規模言語モデル(LLM)は、複雑な推論を必要とするタスクにますます使われている。
モデル動作の理解と信頼性向上には,内部プロセスの測定が不可欠である,と我々は主張する。
計画,修正,資源制約のある意思決定という3つの中核的な側面に沿ってLCMを評価する枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-13T17:59:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。