論文の概要: Conditional Evaluation of Language Models with Cheap Auxiliary Signals
- arxiv url: http://arxiv.org/abs/2608.16210v1
- Date: Mon, 17 Aug 2026 07:44:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.579391
- Title: Conditional Evaluation of Language Models with Cheap Auxiliary Signals
- Title(参考訳): チープ補助信号を用いた言語モデルの条件付き評価
- Abstract要約: ゴールドレーベルだけで条件付きパフォーマンスプロファイルを推定するのは高価である。
LACE(Local Augmented Control-Variate Evaluation)は,条件付きLCM評価のための半教師付き推定器である。
実験により,MATH-500,ScienceQA,MMLU,WinoGrande,HellaSwag,TruthfulQA,GSM8K,ARCの性能評価を行った。
- 参考スコア(独自算出の注目度): 7.275460635772361
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aggregate accuracy hides where models succeed and fail. Estimating conditional performance profiles from gold labels alone is expensive, while cheap auxiliary signals such as LLM-judge scores, pairwise comparisons, confidence scores, and judge-disagreement features can be collected for every benchmark item but are often biased or miscalibrated. We propose LACE (Local Augmented Control-Variate Evaluation), a semi-supervised estimator for conditional LLM evaluation. The key step is local centering: after subtracting the conditional mean of a cheap signal within the target profile region, any linear augmentation has zero conditional mean and therefore cannot change the estimand. The augmentation coefficient is used only for efficiency, and a local ridge control variate combines a gold-label residual mean from the labeled subset with a cheap-signal mean from the full item pool. We prove calibration-free identification, unbiasedness for grouped profiles, local oracle optimality within centered linear augmentations, and first-order adaptivity to the estimated coefficient. The resulting gain formula is governed by a population local $R^2$, which characterizes how the efficiency attainable from the cheap signals varies across profile values. We also derive corresponding estimators for direct paired model gaps and deployment-weighted scores. We empirically evaluate the primary performance-profile estimator on MATH-500, ScienceQA, MMLU, WinoGrande, HellaSwag, TruthfulQA, GSM8K, and ARC.
- Abstract(参考訳): 集約精度は、モデルの成功と失敗の場所を隠す。
ゴールドラベルだけで条件付き性能プロファイルを推定することは高価であるが、LLM-judgeスコア、ペア比較、信頼スコア、および判定判定機能といった安価な補助信号はベンチマーク項目ごとに収集できるが、バイアスや誤判定がしばしばある。
LACE(Local Augmented Control-Variate Evaluation)は,条件付きLCM評価のための半教師付き推定器である。
鍵となるステップは局所集中であり、ターゲットプロファイル領域内の安価な信号の条件平均を減算した後、任意の線形拡張は条件平均をゼロとし、したがって推定値を変更できない。
増強係数は効率のためだけに使用され、局所リッジ制御バリアレートは、ラベル付きサブセットからの金ラベル残差平均と、フルアイテムプールからの安価な信号平均とを結合する。
我々は, 偏差のない同定, グループプロファイルの不偏性, 中心線形拡張における局所オラクル最適性, 推定係数への一階適応性を証明した。
結果として得られる利得公式は、ローカルな$R^2$で管理され、これは、安価な信号から得られる効率がプロファイル値によってどのように異なるかを特徴付ける。
また、直接ペアモデルギャップとデプロイメント重み付けスコアの対応推定器を導出する。
実験により,MATH-500,ScienceQA,MMLU,WinoGrande,HellaSwag,TruthfulQA,GSM8K,ARCの性能評価を行った。
関連論文リスト
- LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains [4.560961083890857]
大規模言語モデル(LLM)システムは、検証、テストタイムのスケーリング、ツールの実行、その他の選択的な計算処理に限定的な計算を割り当てるために不確実性信号を使用するようになっている。
我々は,不確実性の品質がコスト層全体で不均一であることを示し,多くのエラーが集中しているにもかかわらず,ほぼランダムな差別性を示す地域もあることを示した。
論文 参考訳(メタデータ) (2026-06-14T14:45:57Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning [17.98540130851038]
検証可能な報酬を伴う強化学習は、LSM推論を改善するための標準的なレシピとなっている。
しかし、支配的なアルゴリズム GRPO は全てのトークンに対して単一の軌道レベルの利点を割り当てる。
我々は,Oracle-Prompted Policy Optimization (OPPO)を提案する。
論文 参考訳(メタデータ) (2026-05-21T00:55:13Z) - When Individually Calibrated Models Become Collectively Miscalibrated [3.556355987197792]
本研究では,個別に調整した予測器が戦略的に相互作用した場合に集団的に誤判定されることを示す。
正の相関関係を持つブライアスコアに基づくアグリゲーションでは、各エージェントの個別に最適なレポートは、正のクラス確率を体系的に過小評価する。
対照的に、VCGベースのアグリゲーションは、限界貢献に報いることでインセンティブを調整し、支配的な戦略的なインセンティブ互換性とほぼ最適のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T05:25:16Z) - Evidence-based Distributional Alignment for Large Language Models [58.65469623911573]
LLM分布推定の忠実度とロバスト性を改善する証拠に基づくアライメント手法であるEvi-DAを提案する。
対象国が与えられた場合、Evi-DAは関連するWorld Values Survey項目とその回答分布を検索し、オプション毎に粗いヴェルツェル値シグネチャを予測し、国条件の回答分布を構造化形式で推測する。
論文 参考訳(メタデータ) (2026-03-03T03:34:06Z) - Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals [18.612081365101464]
我々は,標準ラベル付き結果と,モデルが補助的推論連鎖を判断することで得られるペアワイズ比較信号とを組み合わせたフレームワークを開発する。
シミュレーション全体では, モデル出力ノイズの増加に伴い, 評価精度が大幅に向上し, ゲインが増大する。
GPQA Diamond、AIME 2025、GSM8Kの実験では、より正確な性能推定とより信頼性の高いモデルランキングが示されている。
論文 参考訳(メタデータ) (2026-02-03T03:40:01Z) - KAIROS: Scalable Model-Agnostic Data Valuation [8.766103946679435]
KAIROSはスケーラブルでモデルに依存しない評価フレームワークで、各例に分散影響スコアを割り当てる。
KAIROSは、最先端のモデル-、Shapley-、Wassersteinベースのベースラインを精度とランタイムの両方で一貫して上回っている。
論文 参考訳(メタデータ) (2025-06-30T12:44:28Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - Stochastic Optimization of Areas Under Precision-Recall Curves with
Provable Convergence [66.83161885378192]
ROC(AUROC)と精度リコール曲線(AUPRC)の下の領域は、不均衡問題に対する分類性能を評価するための一般的な指標である。
本稿では,深層学習のためのAUPRCの最適化手法を提案する。
論文 参考訳(メタデータ) (2021-04-18T06:22:21Z) - SLOE: A Faster Method for Statistical Inference in High-Dimensional
Logistic Regression [68.66245730450915]
実用データセットに対する予測の偏見を回避し、頻繁な不確実性を推定する改善された手法を開発している。
私たちの主な貢献は、推定と推論の計算時間をマグニチュードの順序で短縮する収束保証付き信号強度の推定器SLOEです。
論文 参考訳(メタデータ) (2021-03-23T17:48:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。