論文の概要: Task-Aware Calibration: Provably Optimal Decoding in LLMs
- arxiv url: http://arxiv.org/abs/2605.10202v1
- Date: Mon, 11 May 2026 08:48:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.666112
- Title: Task-Aware Calibration: Provably Optimal Decoding in LLMs
- Title(参考訳): タスク対応校正: LLMにおけるおそらく最適復号化
- Authors: Tim Tomov, Dominik Fuchsgruber, Rajeev Verma, Stephan Günnemann,
- Abstract要約: LLMデコーディングは、しばしば出力を生成するためにモデルの予測分布に依存する。
本稿では,タスク誘発潜在空間におけるモデルの予測分布をキャリブレーションするパラダイムとしてタスクキャリブレーションを導入する。
我々の研究は、タスクキャリブレーションが様々なタスクやアプリケーションに対してより信頼性の高いモデル決定を可能にすることを実証している。
- 参考スコア(独自算出の注目度): 46.26328678647223
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM decoding often relies on the model's predictive distribution to generate an output. Consequently, misalignment with respect to the true generating distribution leads to suboptimal decisions in practice. While a natural solution is to calibrate the model's output distribution, for LLMs, this is ill-posed at the combinatorially vast level of free-form language. We address this by building on the insight that in many tasks, these free-form outputs can be interpreted in a semantically meaningful latent structure, for example, discrete class labels, integers, or sets. We introduce task calibration as a paradigm to calibrate the model's predictive distribution in the task-induced latent space. We apply a decision-theoretic result to show that Minimum Bayes Risk (MBR) decoding on the task-calibrated latent distribution is the optimal decoding strategy on latent model beliefs. Empirically, it consistently improves generation quality across different tasks and baselines. We also introduce Task Calibration Error (TCE), an application-aware calibration metric that quantifies the excess loss due to miscalibration. Our work demonstrates that task calibration enables more reliable model decisions across various tasks and applications.
- Abstract(参考訳): LLMデコーディングは、しばしば出力を生成するためにモデルの予測分布に依存する。
結果として、真の生成分布に対する不一致は、実際は準最適決定に繋がる。
自然な解法はモデルの出力分布をキャリブレーションすることであるが、LLMの場合、これは組合せ的に広大な自由形式の言語において悪影響を及ぼす。
多くのタスクにおいて、これらの自由形式出力は意味論的に意味のある潜在構造、例えば離散クラスラベル、整数、集合で解釈できるという洞察に基づいてこの問題に対処する。
本稿では,タスク誘発潜在空間におけるモデルの予測分布をキャリブレーションするパラダイムとしてタスクキャリブレーションを導入する。
本稿では,最小ベイズリスク(MBR)をタスクキャリブレーションした潜在分布上で復号化することが,潜在モデル信念における最適復号化戦略であることを示す。
経験的には、異なるタスクとベースラインにわたる生成品質を一貫して改善する。
また、誤校正による余剰損失を定量化するアプリケーション対応校正基準であるタスク校正誤差(TCE)も導入する。
我々の研究は、タスクキャリブレーションが様々なタスクやアプリケーションに対してより信頼性の高いモデル決定を可能にすることを実証している。
関連論文リスト
- Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision [16.289117637700446]
正準緩和法は、インスタンスレベルでの正当性を忠実に反映した正当性スコアを提供することである。
本研究は, 局所プラッツスケーリングを3種類の微粒な信頼度スコアに別々に適用することを提案する。
より広い範囲の確率区間にわたるキャリブレーション誤差を, 微粒な信頼度スコアが常に低いキャリブレーション誤差を達成できることが判明した。
論文 参考訳(メタデータ) (2026-04-08T06:41:09Z) - Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume [45.38219855706969]
マルチモーダル大規模言語モデル(MLLM)のためのトレーニング不要不確実性定量化フレームワークUMPIREを紹介する。
UMPIREは、与えられたタスクインスタンスに対するサンプルMLLM応答の不整合調整セマンティックボリュームを計算する。
UMPIREは、画像、音声、ビデオテキストのベンチマークにおいて、エラー検出と不確実性校正において、基準値よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-02-27T17:18:42Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Learning What Matters: Probabilistic Task Selection via Mutual Information for Model Finetuning [20.93518809718398]
混合最適化のための原則的でスケーラブルなフレームワークであるTASKPGMを紹介する。
TASKPGMはマルコフランダム場(MRF)上のエネルギー関数を最小化して連続タスク比を選択する
本手法は, 単純な制約下で閉形式解を導出し, タスク間の代表性と多様性を確実にバランスさせる。
論文 参考訳(メタデータ) (2025-07-16T20:14:55Z) - Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding [48.92310906093414]
マルチモーダル大言語モデル(LLM)に適した不確実性定量化(UQ)の校正手法を提案する。
マルチモーダルモデルのキャリブレーションを改善するために,自己整合性に加えてクロスモーダル整合性を活用する。
医療質問応答(Slake)や視覚質問応答(VQAv2)といった複数のマルチモーダルタスクに対して,LLaVA-MedやLLaVAといったマルチモーダルモデルを考慮したアプローチを提案する。
論文 参考訳(メタデータ) (2025-04-30T19:19:21Z) - Adaptive Draft-Verification for Efficient Large Language Model Decoding [24.347886232342862]
大規模言語モデル(LLM)デコードでは、与えられたコンテキストに基づいてトークンのシーケンスを生成する。
典型的な自己回帰復号法では、生成されたトークンごとに別の前方通過が必要となる。
微調整を必要とせずにLDMデコーディングを高速化するADEDを導入する。
論文 参考訳(メタデータ) (2024-06-27T22:20:39Z) - Calibrating Large Language Models with Sample Consistency [76.23956851098598]
本稿では,複数サンプルモデル生成系の分布から信頼度を導出する可能性について,一貫性の3つの尺度を用いて検討する。
その結果、一貫性に基づくキャリブレーション手法は、既存のポストホック手法よりも優れていることがわかった。
種々のLMの特性に合わせて,キャリブレーションに適した整合性指標を選択するための実用的なガイダンスを提供する。
論文 参考訳(メタデータ) (2024-02-21T16:15:20Z) - Large Language Models are Miscalibrated In-Context Learners [22.30783674111999]
本研究では,学習方法の異なる選択にまたがる行動の詳細な分析を行う。
低リソース環境における全ての学習手法に誤校正問題が存在することを観察する。
最大確率で自己認識を行うことで,ロバストかつ校正された予測が得られることがわかった。
論文 参考訳(メタデータ) (2023-12-21T11:55:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。