論文の概要: Dynamically Allocating Evaluation Effort for Model Ranking
- arxiv url: http://arxiv.org/abs/2608.03437v1
- Date: Tue, 04 Aug 2026 10:33:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.139625
- Title: Dynamically Allocating Evaluation Effort for Model Ranking
- Title(参考訳): モデルランク付けのための動的アロケート評価
- Authors: Vilém Zouhar, Julia Kreutzer, Alon Lavie, Tom Kocmi, Matt Post, Ondřej Bojar, Mrinmaya Sachan,
- Abstract要約: 相関アームを用いたマルチアームバンディット構成において,マルチモデル人体評価をベストアーム識別問題として定式化する。
トップパフォーマンスモデル間の差別を改善することを示します。
これにより、評価はより速く、より安価で、より大規模な競争評価目標に適合する。
- 参考スコア(独自算出の注目度): 60.00410111594536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While human evaluation is the gold standard in many NLP tasks, it suffers from prohibitive costs and poor scalability. When identifying top-performing models, typical evaluation protocols waste effort by exhaustively evaluating all models on the entire benchmark, a safe but inefficient approach. In this work, we formalize multi-model human evaluation as a best-arm identification problem in a multi-armed bandit setup with correlated arms, where pulling an arm corresponds to human-evaluating a model. By sampling adaptively based on the intermediate model rankings obtained on the samples so far, we can focus the annotation budget on the most competitive models. We prove the optimality of the proposed algorithms and show that it improves discrimination between top-performing models. This makes evaluations faster, cheaper and more aligned with large-scale competition evaluation goals.
- Abstract(参考訳): 人間の評価は多くのNLPタスクにおいてゴールドスタンダードであるが、禁止コストとスケーラビリティの低下に悩まされている。
最高のパフォーマンスのモデルを特定する場合、典型的な評価プロトコルは、ベンチマーク全体においてすべてのモデルを徹底的に評価することで、労力を無駄にします。
本研究では,腕を引っ張る動作が人間評価モデルに対応する多腕バンディット構成において,マルチモデル人体評価をベストアーム識別問題として定式化する。
これまでに得られた中間モデルランキングを適応的にサンプリングすることにより、最も競争力のあるモデルにアノテーション予算を集中させることができる。
本稿では,提案アルゴリズムの最適性を証明し,トップパフォーマンスモデル間の差別を改善することを示す。
これにより、評価はより速く、より安価で、より大規模な競争評価目標に適合する。
関連論文リスト
- To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG [31.664195597760422]
検索拡張生成のためのマルチエージェント文書評価は計算コストが高い。
各種QAベンチマークを用いて、7B-9B命令調整モデルに対する無訓練介入の制御を行った。
モデル適応型ルーティングアーキテクチャであるMADARAを提案する。
論文 参考訳(メタデータ) (2026-06-23T21:34:23Z) - Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity [14.830460628644715]
大規模言語モデルは通常、テストクエリ毎にすべてのモデルを評価することでベンチマークされる。
本稿では,従来の逐次リジェクトアルゴリズムをペア比較で拡張したSySR(Sychronized Successive Rejects)を提案する。
論文 参考訳(メタデータ) (2026-06-05T17:03:19Z) - Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization [17.34147279018477]
統計的妥当性を損なうことなく,MABと安価な予測スコアを組み合わせた原理的枠組みを提案する。
分散を低減するために低ランク予測を用いた各モデルの性能の2倍頑健な推定器を導出する。
実世界のベンチマークによる実証的な結果から,本手法は必要な評価回数を削減し,計算とコストに有意義な節約をもたらすことが示された。
論文 参考訳(メタデータ) (2026-05-11T11:43:28Z) - Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization [12.964518425036168]
パーソナライズド・リワードベンチ(Personalized RewardBench)は、パーソナライズされた好みをモデル化するための報酬モデルの能力を厳格に評価する新しいベンチマークである。
選択された応答対と拒否された応答対は、ユーザ固有のルーリックへの厳密な固執(または違反)に基づいて構成し、好みの区別が個人ごとに一意に調整されていることを保証します。
本ベンチマークでは,既存のベースラインと比較して,Best-of-N(BoN)サンプリングとPPO(Porximal Policy Optimization)の両方において,ダウンストリーム性能と有意に高い相関関係を示した。
論文 参考訳(メタデータ) (2026-04-08T17:55:00Z) - Learning Ordinal Probabilistic Reward from Preferences [25.069054134899744]
確率的リワードモデル(PRM: Probabilistic Reward Model)を提案する。
提案手法では,報酬を決定論的スカラーとしてモデル化する代わりに,ランダム変数として扱い,各応答の品質の完全な確率分布を学習する。
OPRM上に構築したRerea Flooding Tuning(RgFT)と呼ばれるデータ効率のトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-02-13T06:43:02Z) - QualEval: Qualitative Evaluation for Model Improvement [82.73561470966658]
モデル改善のための手段として,自動定性評価による定量的スカラー指標を付加するQualEvalを提案する。
QualEvalは強力なLCM推論器と新しいフレキシブルリニアプログラミングソルバを使用して、人間の読みやすい洞察を生成する。
例えば、その洞察を活用することで、Llama 2モデルの絶対性能が最大15%向上することを示す。
論文 参考訳(メタデータ) (2023-11-06T00:21:44Z) - GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models [60.48306899271866]
GREATスコア(GREAT Score)と呼ばれる新しいフレームワークを提案する。
我々は,ロバストベンチにおける攻撃ベースモデルと比較し,高い相関性を示し,GREATスコアのコストを大幅に削減した。
GREAT Scoreは、プライバシーに敏感なブラックボックスモデルのリモート監査に使用することができる。
論文 参考訳(メタデータ) (2023-04-19T14:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。