論文の概要: Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling
- arxiv url: http://arxiv.org/abs/2607.01612v1
- Date: Thu, 02 Jul 2026 02:29:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.64006
- Title: Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling
- Title(参考訳): 信頼性によるスケーリング: 適応的なテスト時間スケーリングのためのLCMの信頼性の校正
- Abstract要約: 新たな強化学習アルゴリズムは、正確性、校正、データセットインフォームド参照精度の報酬を統合する。
C3RLは精度を犠牲にすることなくキャリブレーションを強化し、パフォーマンスとキャリブレーションの両指標において現在の最先端の手法より優れている。
実験の結果、CASはドメイン内およびドメイン外のデータセットの多数投票を上回り、推論予算を最大12.33倍削減している。
- 参考スコア(独自算出の注目度): 2.8793525226737327
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training large language models (LLMs) with reinforcement learning (RL) has significantly advanced their performance on reasoning and question-answering tasks. However, prevailing RL reward designs typically prioritize response correctness, neglecting to incentivize models to express their confidence accurately. This leads to a critical problem: performance gains are often accompanied by poor calibration between confidence and accuracy, misleading models to overconfidently hallucinate when uncertain. To address this limitation, we propose $\textbf{C}$orrectness and $\textbf{C}$onfidence $\textbf{C}$alibration $\textbf{R}$einforcement $\textbf{L}$earning ($\textbf{C3RL}$), a novel RL algorithm integrating correctness, calibration and dataset-informed reference accuracy rewards together. Comprehensive evaluation across 8 text and multimodal datasets demonstrates that C3RL enhances calibration without sacrificing accuracy, outperforming the current state-of-the-art method in both performance and calibration metrics. Utilizing the well-calibrated verbalized confidence from C3RL, we further introduce $\textbf{C}$onfidence-based $\textbf{A}$daptive Test Time $\textbf{S}$caling ($\textbf{CAS}$), an adjustable inference-time strategy that allocates computational resources based on response confidence. Experiments show that CAS surpasses majority voting on both in-domain and out-of-domain datasets while reducing the inference budget by up to 12.33 times. We believe the synergy of C3RL and CAS paves the way for deploying more reliable and resource-efficient LLMs. The code, data and models will be released.
- Abstract(参考訳): 強化学習(RL)を用いた大規模言語モデル(LLM)の訓練は、推論や質問応答のタスクにおいて、その性能を著しく向上させてきた。
しかしながら、一般的なRL報酬設計では、反応の正しさを優先し、モデルの信頼性を正確に表現するためにモデルのインセンティブを無視する。
パフォーマンス向上には、信頼性と正確性の間のキャリブレーションの欠如が伴うことが多く、不確実な時に過度に幻覚を引き起こすモデルが誤解を招く。
この制限に対処するため、新しいRLアルゴリズムである$\textbf{C}$orrectness and $\textbf{C}$onfidence $\textbf{C}$alibration $\textbf{R}$einforcement $\textbf{L}$earning$\textbf{C3RL}$。
8つのテキストとマルチモーダルデータセットの総合的な評価は、C3RLが精度を犠牲にすることなくキャリブレーションを強化し、パフォーマンスとキャリブレーションの両方で現在の最先端の手法より優れていることを示している。
さらに、C3RLの言語的信頼を利用して、応答信頼度に基づいて計算リソースを割り当てる調整可能な推論時戦略である、$\textbf{C}$onfidence-based $\textbf{A}$daptive Test Time $\textbf{S}$caling ($\textbf{CAS}$
実験の結果、CASはドメイン内およびドメイン外のデータセットの多数投票を上回り、推論予算を最大12.33倍削減している。
我々は,C3RLとCASの相乗効果が,より信頼性が高く,資源効率のよいLLMの展開の道を開くと信じている。
コード、データ、モデルがリリースされる。
関連論文リスト
- Calibrating LLMs with Semantic-level Reward [35.81380656593668]
言語モデルを直接意味空間で校正するフレームワークであるtextbfCalibration with Semantic Reward (CSR) を提案する。
CSRは、ほぼすべての設定において、言語化信頼ベースラインよりも低ECEと高AUROCを一貫して達成する。
論文 参考訳(メタデータ) (2026-05-15T03:55:11Z) - Process Supervision of Confidence Margin for Calibrated LLM Reasoning [52.373121066425455]
強化学習(RL)によるテスト時間計算のスケーリングは,大規模言語モデル(LLM)推論能力を向上させるための信頼性の高い経路として登場した。
しかし、結果に基づく報酬は、しばしばモデルに過信感を与え、幻覚、信頼できない信頼ベースの制御、不要な計算割り当てをもたらす。
本稿では,信頼性と信頼性を両立させるキャリブレーションを意識したRLフレームワークであるReinforcement Learning with Confidence Margin(textbfRLCM)を紹介する。
論文 参考訳(メタデータ) (2026-04-25T14:40:13Z) - Self-Calibrating Language Models via Test-Time Discriminative Distillation [18.46710400838861]
大規模言語モデル(LLM)は、しばしば間違って答える質問に対して体系的に過度に信頼されている。
我々は、テスト時間トレーニング(TTT)パイプラインである$textbfSECL$ ($textbfSE$lf-$textbfC$alibrating $textbfL$anguage Modelsを紹介します。
論文 参考訳(メタデータ) (2026-03-18T13:28:50Z) - $\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving [75.29519604607111]
検証可能な報奨(RLVR)による強化学習は、大規模言語モデル(LLM)の推論性能を高めることを約束している。
チェーン・オブ・シークレット(CoT)の初期方向や品質が最適以下である場合、モデルが正しい答えに到達できないことがよく示される。
再解決による強化学習 (Reinforcement Learning with Re-solving, Re$2$) を導入し, LLM が非生産的推論経路を柔軟に放棄し,必要ならば解法を再開することを学ぶ。
論文 参考訳(メタデータ) (2026-03-07T13:17:46Z) - Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs [19.079556051442168]
強化学習(Reinforcement Learning, RL)は、推論タスクにおける大規模言語モデルの改善に広く用いられている。
しかし、REINFORCE や GRPO のような広く採用されている批判のない政策段階的手法では、高い非同期性によって政策段階的推定器は明らかにノイズを生じさせる。
本稿では,REINFORCE/GRPOスタイルのアルゴリズムの安定化手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T18:40:51Z) - Balancing Classification and Calibration Performance in Decision-Making LLMs via Calibration Aware Reinforcement Learning [10.123352394689134]
よく校正された信頼性により、下流のシステムは、いつモデルを信頼するか、いつフォールバックメカニズムを延期するかを決定できる。
RLVRはタスク性能を向上するが、極めて自信過剰なモデルを生成する。
本稿では,意思決定確率を直接調整するキャリブレーション対応強化学習の定式化を提案する。
論文 参考訳(メタデータ) (2026-01-19T18:31:31Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Diagnosing and Mitigating System Bias in Self-Rewarding RL [37.83913102876393]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデル(LLM)の推論能力を拡大するが、継続するデータスケーリングのためにラベル付きサンプルの制限によりボトルネックが残る。
モデルは高信頼のロールアウトを過大評価する傾向があり、バイアスがあり不安定な報酬推定につながる。
本稿では,多種多様なモデルを集約し,報酬とロールアウトの選択に適応する強化学習(RLER)を提案する。
論文 参考訳(メタデータ) (2025-10-10T03:38:17Z) - Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty [59.97939500426759]
本稿ではRLCRについて述べる。RLCRは精度と信頼性を共同で向上する推論モデルを訓練する手法である。
多様なデータセット間で、RLCRは精度を損なうことなくキャリブレーションを大幅に改善することを示す。
また,言語的信頼度をテスト時に活用し,精度とキャリブレーションを向上させることも実証した。
論文 参考訳(メタデータ) (2025-07-22T17:56:01Z) - Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers [57.95157497749428]
RL$V$は、LLMを推論器と生成検証器の両方として共同で訓練することにより、任意の値自由なRL法を増強する。
RL$V$は、並列サンプリングでMATHの精度を20%以上向上し、効率的なテスト時間計算のスケーリングを可能にする。
論文 参考訳(メタデータ) (2025-05-07T22:41:26Z) - S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning [51.84977135926156]
S$2$Rはモデルに推論時の自己検証と自己正当性を教えることによってLLM推論を強化する効率的なフレームワークである。
以上の結果から,Qwen2.5-math-7Bの精度は51.0%から81.6%に向上した。
論文 参考訳(メタデータ) (2025-02-18T13:40:22Z) - Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning [50.9692060692705]
本稿では、オフラインRL用の決定変換器をベースとした一般的なフレームワークである、$textbfMo$tion Control(textbfLaMo$)のための$textbfLanguage Modelsを紹介する。
私たちのフレームワークは4つの重要なコンポーネントを強調しています。
逐次事前学習したLMを用いた決定変換器の初期化(2)LoRA微細調整法を用いて
特に,本手法は,限られたデータサンプルを持つシナリオにおいて,優れた性能を示す。
論文 参考訳(メタデータ) (2023-10-31T16:24:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。