論文の概要: Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration
- arxiv url: http://arxiv.org/abs/2607.13753v2
- Date: Mon, 20 Jul 2026 09:24:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.522382
- Title: Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration
- Title(参考訳): トレーニング後の信頼度の変化: SFT, RL, OPD 形状 CoT の校正方法の3段階解析
- Abstract要約: 本稿では,3段階のキャリブレーション・フレームワークを導入する。
SFTは早期停止のための最強のオンライン信号を提供し、RLは最も信頼性の高いトレースレベル信号を生成する。
位置認識型信頼戦略であるPosConfを提案する。
- 参考スコア(独自算出の注目度): 20.813380812371637
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models have made strong reasoning gains through supervised fine-tuning, reinforcement learning, and on-policy distillation, yet these post-training methods are usually evaluated only by final-answer accuracy. We study how they reshape confidence during reasoning. We introduce a three-stage calibration framework that evaluates confidence before, during, and after chain-of-thought generation, corresponding to difficulty estimation, early termination, and answer aggregation. Through a controlled comparison on mathematical reasoning benchmarks, we find that OPD provides the most useful pre-reasoning confidence, SFT gives the strongest online signal for early stopping, and RL produces the most reliable trace-level signal for aggregation. We further show that confidence reliability is position-dependent: RL confidence becomes informative after a path-commitment phase, while OPD confidence is useful early but can become inversely calibrated later. Based on this observation, we propose PosConf, a position-aware confidence strategy that uses confidence only from reliable relative-position intervals. PosConf improves RL answer aggregation by 6.1 points over majority voting and consistently improves OPD early stopping under tight token budgets, with gains up to 4.3 points by avoiding its later inverse-calibration region, showing that \emph{confidence in reasoning models should be used both stage-wise and position-awarely}. Our code is available at https://github.com/EIT-NLP/Post-Training-Calibration.
- Abstract(参考訳): 大規模言語モデルでは, 教師付き微調整, 強化学習, オンライン蒸留などにより, 推論精度が向上している。
我々は、彼らが推論中にどのように信頼を形作るかを研究する。
本稿では,3段階のキャリブレーション・フレームワークを導入し,予測の難易度,早期終了度,解答集合度に応じて,チェーン・オブ・ソート生成前後の信頼度を評価する。
数式推論ベンチマークの制御による比較により,OPDは最も有用な事前推論信頼度,SFTは早期停止のための最強のオンライン信号,RLは最も信頼性の高いトレースレベル信号を生成することがわかった。
さらに、信頼度は位置依存的であることを示し、RL信頼度は経路制限フェーズ後に情報化され、OPD信頼度は早期に有用であるが、後で逆校正される可能性がある。
本研究は,信頼度を信頼度間隔からのみ活用する位置認識型信頼戦略であるPosConfを提案する。
PosConfは多数決よりもRL答えの集計を6.1ポイント改善し、厳格なトークン予算の下でPDの早期停止を継続的に改善する。
私たちのコードはhttps://github.com/EIT-NLP/Post-Training-Calibrationで公開しています。
関連論文リスト
- Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - Enhancing LLM Metacognition via Cognitive Pairwise Training [56.19495984013656]
検証可能な報酬を伴う強化学習は、証拠や推論が信頼できない場合に、モデルが自信を持って回答する意思を増す。
既存のSFT法やRL法は、主にLLMに対して応答レベルでの不確実性を拒否または表現するよう教えている。
本稿では,認知的中級アライメント段階である認知的ペアワイズトレーニング(CPT)を提案する。
論文 参考訳(メタデータ) (2026-05-30T19:53:19Z) - Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation? [4.120238673372104]
半教師付き学習は、アノテーションのコストを削減する主要なパラダイムとなっている。
現在の進歩は2倍の過信問題によって曇っていると我々は主張する。
本稿では,二軸信頼性評価エンジン上に構築した三空間原理分割フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T08:16:40Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning [5.094079537924077]
信頼性トラジェクトリは、誤った推論トレースから正解であることを示す。
正確性関連情報は推論の尾に富む。
本稿では,信頼度評価のための信頼軌道から学習する軽量な推定器であるNeuralConfを提案する。
論文 参考訳(メタデータ) (2026-05-16T05:57:00Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Process Supervision of Confidence Margin for Calibrated LLM Reasoning [52.373121066425455]
強化学習(RL)によるテスト時間計算のスケーリングは,大規模言語モデル(LLM)推論能力を向上させるための信頼性の高い経路として登場した。
しかし、結果に基づく報酬は、しばしばモデルに過信感を与え、幻覚、信頼できない信頼ベースの制御、不要な計算割り当てをもたらす。
本稿では,信頼性と信頼性を両立させるキャリブレーションを意識したRLフレームワークであるReinforcement Learning with Confidence Margin(textbfRLCM)を紹介する。
論文 参考訳(メタデータ) (2026-04-25T14:40:13Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation [63.49409574310576]
大規模言語モデル(LLM)は自信過剰を示し、信頼度の高いスコアを誤った予測に割り当てる。
本研究では,テキスト生成中に高精度できめ細かな信頼スコアを提供する信頼度推定手法であるFineCEを紹介する。
論文で使用されたコードとすべてのベースラインはGitHubで公開されている。
論文 参考訳(メタデータ) (2025-08-16T13:29:35Z) - SteerConf: Steering LLMs for Confidence Elicitation [11.872504642312705]
大規模言語モデル(LLM)は、様々な領域で素晴らしいパフォーマンスを示すが、しばしば過剰な自信に悩まされる。
本稿では,LCMの信頼性スコアを体系的に評価し,キャリブレーションと信頼性を向上させる新しいフレームワークであるSteerConfを提案する。
論文 参考訳(メタデータ) (2025-03-04T18:40:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。