論文の概要: Accuracy and Normalized Accuracy under Length Bias: Analysis, Guidelines, and a Bayesian Alternative
- arxiv url: http://arxiv.org/abs/2607.12767v1
- Date: Tue, 14 Jul 2026 13:39:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.159421
- Title: Accuracy and Normalized Accuracy under Length Bias: Analysis, Guidelines, and a Bayesian Alternative
- Title(参考訳): 長さバイアスの精度と正規化精度:解析・ガイドライン・ベイズ代替案
- Abstract要約: 条件付きログ確率によって候補完了をランク付けする多重選択ベンチマークは、長さバイアスに悩まされる。
これはしばしば過度に修正され、代わりに長い回答に対するバイアスが生じることを実証的に示します。
EmphBayesian correct, a score rule that compute the posterior probability of each candidate under a explicit prior over answer length。
- 参考スコア(独自算出の注目度): 2.1880101879169067
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multiple-choice benchmarks that rank candidate completions by conditional log-probability suffer from a length bias: because log-probabilities sum over tokens, longer answers tend to be penalized relative to shorter ones in practice. A common mitigation is to normalize scores by completion length, but we show empirically that this heuristic frequently over-corrects, introducing a bias toward longer answers instead. We first analyze these scoring rules, characterizing when standard and length-normalized accuracy are appropriate and how their length biases depend on the distribution of completion lengths. Motivated by this analysis, we introduce \emph{Bayesian accuracy}, a scoring rule that computes the posterior probability of each candidate under an explicit prior over answer length, thereby removing linear length effects. Bayesian accuracy is a drop-in replacement for likelihood-based multiple-choice evaluation, requires no additional forward passes, and consistently exhibits lower empirical length bias than both standard and length-normalized accuracy across benchmarks and few-shot settings.
- Abstract(参考訳): 条件付きログ確率によって候補完了をランク付けする多重選択ベンチマークは、長さバイアスに悩まされる。
一般的な緩和は、完了の長さによってスコアを正規化することであるが、このヒューリスティックな度に過度に修正されることを経験的に示し、代わりに長い答えに偏見をもたらす。
まず、これらのスコアリングルールを分析し、標準および長さ正規化精度が適切で、その長さバイアスが完了長さの分布に依存するかを特徴付ける。
この分析に動機づけられた評価規則である 'emph{Bayesian accuracy} を導入する。これは、各候補の後続確率を明示的な事前回答長で計算し、線形長効果を除去するスコアリングルールである。
ベイズ精度は、可能性に基づく多重選択評価のドロップイン置換であり、追加の前方通過を必要としない。
関連論文リスト
- Beyond Optimal Rates in Stochastic Optimization: Trajectory-Adaptive Stopping Rules [42.38093055717409]
我々は、新しい信頼系列法と、適応されたプロセスに対する時間一様経験的バーンスタイン不等式を開発する。
結果の停止規則は、自然勾配の地平線より少ない数桁の順序を必要とすることが示される。
論文 参考訳(メタデータ) (2026-08-26T09:02:46Z) - Tailoring Strictly Proper Scoring Rules for Downstream Tasks: An Application to Causal Inference [48.78219918881965]
本稿では,ダウンストリーム誤差メトリックの局所曲率をマッチングすることにより,タスク固有の厳密なスコアリングルールを導出するフレームワークを提案する。
これを平均処理効果 (ATE) 推定に適用し, 閉形式損失と対応する正準確率写像を導出する。
論文 参考訳(メタデータ) (2026-06-02T08:41:25Z) - Robust Length Prediction: A Perspective from Heavy-Tailed Prompt-Conditioned Distributions [61.56973419225008]
既存の出力長予測法は、プロンプトのみの予測では信頼性が低い。
本稿では,同じプロンプトからトレーニング対象を構成するプロンプト条件付き長さ分布法を提案する。
さまざまなシナリオにわたる実験では、予測品質が一貫した向上を示している。
論文 参考訳(メタデータ) (2026-04-09T07:49:52Z) - Computable Bernstein Certificates for Cross-Fitted Clipped Covariance Estimation [0.0]
計算可能なベルンシュタイン型偏差証明を備えたクロスフィットクリッピング共分散推定器を提案する。
結果として得られる手順は、緩やかな尾の規則性の下での有効ランクのような本質的な複雑性尺度に適応する。
論文 参考訳(メタデータ) (2026-02-15T06:53:40Z) - Questioning the Coverage-Length Metric in Conformal Prediction: When Shorter Intervals Are Not Better [8.898113982504247]
コンフォーマル予測(CP)は分布のない不確実性定量化の基礎となっている。
この研究は、これらの標準メトリクスの十分性について批判的に検証する。
偏差トリック (PT) と呼ばれる反直観的アプローチにより, 間隔長が知覚的に改善されることが実証された。
論文 参考訳(メタデータ) (2026-01-29T09:31:28Z) - Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics [22.666172957826163]
品質評価(QE)メトリクスは、参照なし評価のための機械翻訳において不可欠であり、強化学習のようなタスクにおける報酬信号である。
第一に、QEメトリクスは、高品質でエラーのないテキストであっても、翻訳長の増大を伴うエラーを常に過大予測する。
これらの固有長バイアスは、より長く正しい翻訳を不公平に罰し、QEの再分類やQE指導による強化学習のような応用において、準最適決定につながる可能性がある。
論文 参考訳(メタデータ) (2025-10-24T21:22:06Z) - CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models [29.95434387343843]
本稿では,3つのコンポーネントによる長さバイアスを緩和する統合フレームワークを提案する。
CoLDは一貫して報酬長相関を減少させ、ステップ選択の精度を改善し、より簡潔で論理的に妥当な推論を促進する。
論文 参考訳(メタデータ) (2025-07-21T15:07:59Z) - UNCERTAINTY-LINE: Length-Invariant Estimation of Uncertainty for Large Language Models [51.53270695871237]
UNCERTAINTY-LINEは、名目上は長さ正規化UQ法よりも一貫して改善されていることを示す。
本手法は, ポストホック, モデル非依存であり, 様々なUQ尺度に適用可能である。
論文 参考訳(メタデータ) (2025-05-25T09:30:43Z) - Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation [64.59292053188264]
主流SDベンチマークと推論重ベンチマークの実験結果から,SVIPの優れた性能が示された。
SVIPは、ドラフトエントロピーを参照して、ドラフトシーケンスの長さを適応的に決定する、投機的復号システムのためのトレーニング不要な動的長さポリシーである。
論文 参考訳(メタデータ) (2024-11-27T15:53:17Z) - Explaining Length Bias in LLM-Based Preference Evaluations [52.141933285905885]
本研究では,選好評価指標,特に勝率を,好ましさと情報量という2つの重要な要素に分解する。
応答長が情報量に影響を与えることにより評価に影響を及ぼすことを示す。
本稿では,利得率測定のための簡易かつ効果的な調整法であるAdapAlpacaを提案する。
論文 参考訳(メタデータ) (2024-07-01T08:37:41Z) - Adapting Static Fairness to Sequential Decision-Making: Bias Mitigation Strategies towards Equal Long-term Benefit Rate [41.51680686036846]
逐次意思決定におけるバイアスに対処するため,Equal Long-term Benefit Rate (ELBERT) という長期公正性の概念を導入する。
ELBERTは、以前の長期公正の概念に見られる時間的差別問題に効果的に対処する。
ELBERT-POは高い有効性を維持しながらバイアスを著しく減少させることを示した。
論文 参考訳(メタデータ) (2023-09-07T01:10:01Z) - Optimal Change-Point Detection with Training Sequences in the Large and
Moderate Deviations Regimes [72.68201611113673]
本稿では,情報理論の観点から,新しいオフライン変化点検出問題について検討する。
基礎となる事前および変更後分布の知識は分かっておらず、利用可能なトレーニングシーケンスからのみ学習できると仮定する。
論文 参考訳(メタデータ) (2020-03-13T23:39:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。