論文の概要: DualEval: Joint Model-Item Calibration for Unified LLM Evaluation
- arxiv url: http://arxiv.org/abs/2606.26429v1
- Date: Wed, 24 Jun 2026 22:40:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.095098
- Title: DualEval: Joint Model-Item Calibration for Unified LLM Evaluation
- Title(参考訳): DualEval:統一LDM評価のための連立モデル項目校正
- Authors: Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica,
- Abstract要約: DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
- 参考スコア(独自算出の注目度): 67.99119926012686
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current LLM evaluation relies on two complementary but often disconnected signals: static benchmarks with objective correctness labels and arena-style preference data that better reflect open-ended user interactions. We introduce DualEval, a latent model-item calibration framework that represents models and evaluation items in a shared space, jointly estimating model ability together with item difficulty and sharpness. We apply DualEval across four domains: coding, math, miscellaneous domain-knowledge tasks, and generic everyday user queries. Our evaluation uses 18 frontier LLMs, static benchmark labels, and reward-model scores validated against held-out human preferences for open-ended model responses. Empirically, our framework produces reliable and balanced model rankings, and its learned item-level profiles support downstream applications such as benchmark compression for sample-efficient evaluation and anomaly detection for contamination or outlier analysis. Overall, DualEval unifies static and arena-style evaluation through joint model-item calibration, producing model rankings and item-level diagnostics that support more sample-efficient, interpretable, and auditable evaluation pipelines.
- Abstract(参考訳): 現在のLCM評価は、2つの補完的だがしばしば非連結な信号に依存している: 客観的な正当性ラベルを持つ静的ベンチマークと、オープンなユーザインタラクションをよりよく反映するアリーナスタイルの嗜好データである。
このフレームワークはモデルと評価項目を共有空間で表現し、アイテムの難易度とシャープネスとともにモデル能力を共同で推定する。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
評価では,18のフロンティアLCM,静的ベンチマークラベル,およびオープンエンドモデル応答に対する人間の嗜好に対する報酬モデルスコアを用いて評価を行った。
実験的に,本フレームワークは信頼性とバランスの取れたモデルランキングを生成し,その学習項目レベルのプロファイルは,サンプル効率評価のためのベンチマーク圧縮や,汚染や外れ値解析のための異常検出などの下流アプリケーションをサポートする。
全体として、DualEvalは、静的およびアリーナスタイルの評価を、ジョイントモデルイテムキャリブレーションを通じて統合し、よりサンプル効率、解釈可能、監査可能な評価パイプラインをサポートするモデルランキングとアイテムレベルの診断を生成する。
関連論文リスト
- Latent Performance Profiling of Large Language Models [47.009623327601226]
隠れたアクティベーションと出力分布からタスクに依存しない診断を導出するフレームワークであるLatent Performance Profiling(LPP)を紹介する。
静的精度スコアとは異なり、LPPは同様のサイズのモデル間で安定でアーキテクチャに敏感なシグネチャを提供する。
類似のベンチマークスコアを持つモデルは、エントロピーや適応性の違いなど、対照的なプロファイルを示すことができることを示す。
論文 参考訳(メタデータ) (2026-05-28T14:41:26Z) - Provable Joint Decontamination for Benchmarking Multiple Large Language Models [19.929035827959822]
ベンチマーク除染を共同選択問題として定式化し,JECS(Joint Envelope Conformal Selection)を提案する。
JECS はモデルごとの同値 p を計算し、それを最大値で集約し、最大 p 個の null 分布の保守的エンベロープを再構成する。
様々なモデルとベンチマーク実験により、JECSは目標のGCR制御を一貫して維持しつつ、最大pベースラインよりも高い出力を達成することが示された。
論文 参考訳(メタデータ) (2026-05-20T09:16:39Z) - ReFINE: A Reward-Based Framework for Interpretable and Nuanced Evaluation of Radiology Report Generation [39.542375803362965]
ReFINEは、放射線学レポート生成(R2Gen)に特化して設計された自動評価指標である。
ユーザが指定した基準に従ってレポートをスコアし、詳細なサブスコアを提供し、解釈可能性を高める。
実験では,従来の指標と比較して,人間の判断とReFINEの相関が高められ,モデル選択における優れた性能が示された。
論文 参考訳(メタデータ) (2024-11-26T10:48:55Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models [60.48306899271866]
GREATスコア(GREAT Score)と呼ばれる新しいフレームワークを提案する。
我々は,ロバストベンチにおける攻撃ベースモデルと比較し,高い相関性を示し,GREATスコアのコストを大幅に削減した。
GREAT Scoreは、プライバシーに敏感なブラックボックスモデルのリモート監査に使用することができる。
論文 参考訳(メタデータ) (2023-04-19T14:58:27Z) - A Unified Statistical Learning Model for Rankings and Scores with
Application to Grant Panel Review [1.240096657086732]
ランク付けとスコアは、審査員がオブジェクトのコレクションにおける好みや品質の知覚を表現するために使用する2つの一般的なデータタイプである。
各タイプのデータを個別に研究するためのモデルが多数存在するが、両タイプのデータを同時に取得する統一統計モデルは存在しない。
このギャップを埋めるために,Mallows-Binomialモデルを提案し,BinomialスコアモデルとMallowsの$phi$ランキングモデルを組み合わせた。
論文 参考訳(メタデータ) (2022-01-07T16:56:52Z) - How Faithful is your Synthetic Data? Sample-level Metrics for Evaluating
and Auditing Generative Models [95.8037674226622]
ドメインに依存しない方法で生成モデルの忠実度,多様性,一般化性能を特徴付ける3次元評価指標を提案する。
当社のメトリクスは、精度リコール分析により統計的発散測定を統合し、モデル忠実度と多様性のサンプルおよび分布レベルの診断を可能にします。
論文 参考訳(メタデータ) (2021-02-17T18:25:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。