論文の概要: HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data
- arxiv url: http://arxiv.org/abs/2606.29784v1
- Date: Mon, 29 Jun 2026 05:04:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.055329
- Title: HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data
- Title(参考訳): HERO:歴史データを用いた生成モデル評価の信頼性と感度の向上
- Authors: Xinrui Ruan, Zhenyu Zhao, Waverly Wei, Yueshan Zhang, Zeyu Zheng, Sui Huang, Jingshen Wang,
- Abstract要約: 本稿では,履歴データを用いてバイアス(信頼性の向上)を抑え,モデル性能評価のばらつき(感度の向上)を低減するフレームワークHEROを紹介する。
HEROは、歴史的金のアノテーションから学んだ銀のラベルを校正し、その結果の見積もりを安定化させる。
- 参考スコア(独自算出の注目度): 18.101523840765623
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable generative AI models critically rely on expert human annotations to evaluate output quality, yet these "gold" labels are expensive to collect and limited in quantity. Organizations thus often turn to collecting vast but noisy "silver" labels from crowdsourced workers or vendor annotators as proxies for gold labels. Because gold remains the evaluation target, naively aggregating noisy silver labels may introduce bias, and estimators built on sparsely observed gold labels may have high variance to resolve the model performance gaps that guide practical decisions. Model evaluation has become an ongoing operational practice rather than a one-time exercise, with evaluation rounds repeating across model versions, releases, and content domains. A natural question is whether the previous historical evaluation data can be used to improve each new round of evaluation. We introduce HERO (History Enhanced RObust model evaluation), a novel framework that uses historical data to suppress bias (improve reliability) and reduce variance (improve sensitivity) in model performance evaluation. HERO calibrates silver labelers' performance learned from historical gold annotations, and stabilizes the resulting estimator by anchoring it to covariate information measured with high precision in the historical data. HERO can be broadly applied across multiple common evaluation tasks, and remains valid when only a subset of historical labelers appears in the current round. We establish conditions under which the bias and variance reductions hold, showcase HERO's performance in simulation studies, and demonstrate its effectiveness on real-world model evaluation benchmarking datasets.
- Abstract(参考訳): 信頼性の高い生成AIモデルは、出力品質を評価するために専門家のアノテーションに批判的に依存するが、これらの「ゴールド」ラベルは収集し制限する費用がかかる。
そのため、組織はしばしば、金のラベルのプロキシとして、クラウドソースされた労働者やベンダーのアノテーターから、巨大だが騒々しい「銀」ラベルを収集する。
金は評価対象のままであるため、ノイズの多い銀のラベルに偏りが生じる可能性があり、わずかに観察された金のラベルの上に構築された推定器は、実用的な決定を導くモデル性能ギャップを解決するために高いばらつきを持つ可能性がある。
モデル評価は、モデルバージョン、リリース、コンテンツドメイン間で繰り返し実施される評価ラウンドによって、1回のエクササイズではなく、進行中の運用プラクティスになっている。
自然の疑問は、過去の評価データが新しい評価ラウンドの改善に利用できるかどうかである。
HERO(History Enhanced RObust model evaluation)は、履歴データを用いてバイアス(信頼性の向上)を抑え、モデル性能評価におけるばらつき(感度の向上)を低減する新しいフレームワークである。
HEROは、歴史的金のアノテーションから学んだ銀のラベルの演奏を校正し、歴史的データの高精度な測定情報に固定することで、その結果の推定を安定化する。
HEROは、複数の共通評価タスクに広く適用することができ、現在のラウンドに履歴ラベルのサブセットが現れる場合にのみ有効である。
偏りと分散の低減が達成される条件を確立し、シミュレーション研究においてHEROの性能を示し、実世界のモデル評価ベンチマークデータセットにその効果を示す。
関連論文リスト
- Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling [6.372025352636228]
本稿では,アノテータの動作を現実的にモデル化するためのマルチレベルブートストラップ手法を提案する。
統計的意義を達成するために必要なアイテム数(N$)とアイテムあたりのレスポンス数(K$)のトレードオフを分析する。
論文 参考訳(メタデータ) (2026-05-13T17:22:27Z) - Fault-Tolerant Evaluation for Sample-Efficient Model Performance Estimators [13.227055178509524]
本稿では, バイアスと分散を考慮した耐障害性評価フレームワークを提案する。
我々は、$varepsilon$の適切なキャリブレーションにより、異なる分散状態の信頼性が保証されることを示す。
実世界のデータセットの実験は、我々のフレームワークが推定器の振る舞いに関する包括的で実行可能な洞察を提供することを示した。
論文 参考訳(メタデータ) (2026-02-06T22:14:46Z) - LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content [62.816876067499415]
我々は、科学的ArXiv論文に基づくスケーラブルな進化型ライブベンチマークであるLiveXivを提案する。
LiveXivは、任意のタイムスタンプでドメイン固有の原稿にアクセスし、視覚的な問合せペアを自動的に生成することを提案する。
ベンチマークの最初のバージョンで、複数のオープンでプロプライエタリなLMM(Large Multi-modal Models)をベンチマークし、その挑戦的な性質を示し、モデルの真の能力を明らかにする。
論文 参考訳(メタデータ) (2024-10-14T17:51:23Z) - QualEval: Qualitative Evaluation for Model Improvement [82.73561470966658]
モデル改善のための手段として,自動定性評価による定量的スカラー指標を付加するQualEvalを提案する。
QualEvalは強力なLCM推論器と新しいフレキシブルリニアプログラミングソルバを使用して、人間の読みやすい洞察を生成する。
例えば、その洞察を活用することで、Llama 2モデルの絶対性能が最大15%向上することを示す。
論文 参考訳(メタデータ) (2023-11-06T00:21:44Z) - Manual Evaluation Matters: Reviewing Test Protocols of Distantly
Supervised Relation Extraction [61.48964753725744]
2つのDS-REデータセット(NYT10とWiki20)に対して手動でアノテートしたテストセットを構築し、いくつかの競合モデルを徹底的に評価する。
その結果,手動による評価は,自動的な評価とは全く異なる結論を示すことがわかった。
論文 参考訳(メタデータ) (2021-05-20T06:55:40Z) - GPM: A Generic Probabilistic Model to Recover Annotator's Behavior and
Ground Truth Labeling [34.48095564497967]
本稿では,基礎となる真実とアノテーションの振舞いを推測する確率論的グラフィカルアノテーションモデルを提案する。
提案モデルでは,アノテータがラベル付け処理中にタスクに対して厳格に動作したかどうかを識別できる。
論文 参考訳(メタデータ) (2020-03-01T12:14:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。