論文の概要: BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges
- arxiv url: http://arxiv.org/abs/2607.16239v1
- Date: Fri, 26 Jun 2026 00:31:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.907726
- Title: BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges
- Title(参考訳): BACON: 複数のAI判事によるモデリングと評価のための予算付きヒューマンキャリブレーション
- Abstract要約: 校正されていないAI評価は、下流の判断を歪める可能性がある。
予算化された人間のキャリブレーションと複数のAI-judge出力を組み合わせて、より正確なアノテーションを生成する4段階パイプラインであるBACONを提案する。
- 参考スコア(独自算出の注目度): 36.076465167585674
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: AI judges offer a scalable, low-cost alternative to human evaluation, but their outputs can be biased relative to human preferences and highly item-dependent, varying across judges, tasks, and domains. When uncalibrated AI evaluations are used for model ranking, item scoring, or population-level quality reporting, these biases can directly distort downstream decisions. We propose BACON, a four-stage pipeline that combines budgeted human calibration with multiple AI-judge outputs to produce more accurate annotations. BACON constructs full-coverage auxiliary features for every item, including multi-judge scores, token-level uncertainty statistics, and contextual embeddings. It then collects human labels for a small sampled subset and trains a cross-fitted outcome model to generate calibrated item-level surrogate predictions. These predictions support two use cases: population-level estimation of summary metrics, such as means or quantiles, using an augmented estimating-equation estimator with valid confidence intervals; and individual-level surrogate scoring for item ranking and annotation. BACON treats AI judges as auxiliary measurements rather than ground truth: human labels provide the calibration anchor, while AI-derived signals improve efficiency. Across diverse tasks, domains, and labeling budgets, BACON improves predictive accuracy and ranking consistency, and reduces bias and variance relative to raw AI outputs and purely human-label-based methods. These results show that BACON offers a practical, statistically grounded framework for scalable evaluation with limited human annotation.
- Abstract(参考訳): AIジャッジは、人間の評価に代わるスケーラブルで低コストな代替手段を提供するが、そのアウトプットは人間の好みに対して偏りがあり、判断、タスク、ドメインによって異なる、アイテムに依存している。
モデルランキング、アイテムスコアリング、あるいは集団レベルの品質レポートにAI評価の未調整が使用される場合、これらのバイアスは、下流の判断を直接歪めることができる。
予算化された人間のキャリブレーションと複数のAI-judge出力を組み合わせて、より正確なアノテーションを生成する4段階パイプラインであるBACONを提案する。
BACONは、マルチジャッジスコア、トークンレベルの不確実性統計、コンテキスト埋め込みなど、すべての項目の完全なカバレッジ補助機能を構築している。
その後、小さなサンプルサブセットのために人間のラベルを収集し、調整されたアイテムレベルのサロゲート予測を生成するために、適合した結果モデルをトレーニングする。
これらの予測は、2つのユースケースをサポートする:手段や量子化などの要約指標の集団レベルの推定、有効信頼区間を持つ拡張推定方程式推定器の使用、項目のランク付けとアノテーションに対する個人レベルのサロゲートスコア。
BACONはAIの判断を、真実ではなく補助的な測定として扱う:人間のラベルはキャリブレーションアンカーを提供し、AI由来の信号は効率を向上する。
さまざまなタスク、ドメイン、ラベルの予算にわたって、BACONは予測精度とランキングの整合性を改善し、生のAI出力と純粋に人間ラベルベースの方法に対するバイアスと分散を低減する。
これらの結果から,BACONは人的アノテーションを限定した拡張性評価のための実践的,統計的基盤の枠組みを提供することが示された。
関連論文リスト
- Bayes-Optimal BER and AUC: Estimation and Evaluation of Estimators [47.001801756596926]
機械学習の基本的な量は、与えられたタスク上の任意のモデルによって達成可能な最適なパフォーマンスである。
最近の研究により、ベイズ誤差は二項分類におけるソフトラベルから推定できることが示されている。
最適なBERとAUCのためのソフトラベルに基づく推定器を提案する。
論文 参考訳(メタデータ) (2026-09-02T08:49:23Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - Pairwise Comparison for Bias Identification and Quantification [5.490018587818889]
オンラインニュースとソーシャルメディアの言語バイアスを測定するのは難しい。
我々は、バイアスアノテーションのペアワイズ比較を活用することで、アノテーションの労力を削減することを目指している。
論文 参考訳(メタデータ) (2025-12-16T16:36:55Z) - Efficient Bayesian Inference from Noisy Pairwise Comparisons [7.5294643377975765]
Bradley-Terry ベースの手法では、比較結果から項目スコアを更新するが、既存の手法ではレーダの変動を無視するか、収束保証の欠如を無視する。
ベイズ的なBradley-Terry型であるBBQを導入し、レーダの品質、重み付け、信頼できない参加者の排除を明確にモデル化する。
実験の結果、BBQはより早く収束し、よく校正された不確実性推定を行い、より堅牢で解釈可能なランキングを得ることが示された。
論文 参考訳(メタデータ) (2025-10-10T12:37:20Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Regression for the Mean: Auto-Evaluation and Inference with Few Labels through Post-hoc Regression [4.813376208491175]
Prediction Powered Inference (PPI)フレームワークは、大量の擬似ラベル付きデータと、実際の高品質なラベルを持つ小さなサンプルの両方を活用する方法を提供する。
ラベル付きデータが不足すると、PPI++メソッドは古典的推論よりもさらにパフォーマンスが良くなる。
本稿では, 頑健な回帰器を用いたPPIに基づく2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-19T17:17:46Z) - Balancing Label Quantity and Quality for Scalable Elicitation [2.2143065226946423]
本研究では,NLP分類タスクにおける量品質トレードオフのミクロ経済性について検討する。
教師付き微調整を用いた事前学習モデルから分類知識を抽出する3つの方法について検討した。
固定ラベル付予算において,教師付き微調整の精度を最大5ポイント向上できることがわかった。
論文 参考訳(メタデータ) (2024-10-17T04:39:58Z) - Beyond correlation: The Impact of Human Uncertainty in Measuring the Effectiveness of Automatic Evaluation and LLM-as-a-Judge [51.93909886542317]
一つの集計相関スコアを*参照することで、人名と自動評価の基本的な違いが曖昧になることを示す。
本研究では,評価性能のより堅牢な解析を行うために,ラベルの不確実性による階層化データを提案する。
論文 参考訳(メタデータ) (2024-10-03T03:08:29Z) - Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments [2.1370543868467275]
本稿では,大規模言語モデルと人的評価を協調させる手法について検討する。
我々はこのバイアスを定量化するためにベイズ統計とt検定を用い、GPTScorerを調整するための再校正手順を開発した。
以上の結果から,再校正したLCM評価器と,複数のユースケースにおけるヒト評価との整合性は有意に改善した。
論文 参考訳(メタデータ) (2024-07-05T09:26:40Z) - Self-Training with Pseudo-Label Scorer for Aspect Sentiment Quad Prediction [54.23208041792073]
Aspect Sentiment Quad Prediction (ASQP) は、与えられたレビューに対して全てのクワッド(アスペクト項、アスペクトカテゴリー、意見項、感情極性)を予測することを目的としている。
ASQPタスクにおける重要な課題はラベル付きデータの不足であり、既存のメソッドのパフォーマンスを制限している。
そこで我々は,擬似ラベルスコアラーを用いた自己学習フレームワークを提案し,レビューと擬似ラベルの一致をスコアラーが評価する。
論文 参考訳(メタデータ) (2024-06-26T05:30:21Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - Uncertainty-Driven Action Quality Assessment [11.958132175629368]
本稿では,複数の判定スコアの多様性を捉えるために,不確実性駆動型AQA (UD-AQA) という新しい確率モデルを提案する。
我々は,AQA回帰損失の再重み付けに使用される各予測の不確かさを推定する。
提案手法は,オリンピックイベントMTL-AQAとFineDivingの3つのベンチマークと,手術スキルJIGSAWSデータセットの3つのベンチマークで比較結果を得た。
論文 参考訳(メタデータ) (2022-07-29T07:21:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。