論文の概要: When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models
- arxiv url: http://arxiv.org/abs/2606.30852v1
- Date: Mon, 29 Jun 2026 19:33:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.994151
- Title: When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models
- Title(参考訳): 学習がいつ助けになるか : 推論モデルにおける早期退学の費用対効果
- Authors: Zhe Dong, Fang Qin, Manish Shah,
- Abstract要約: LearnStopは、言語モデル推論のための隠れ状態のないチェックポイントストッパーである。
本研究では,言語モデル解析のための隠れ状態のないチェックポイントストッパーであるLearnStopを用いて,この問題について検討する。
- 参考スコア(独自算出の注目度): 4.8190992438931035
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning models spend different amounts of useful computation across instances, but it remains unclear when a learned stopping rule improves over simple confidence or convergence thresholds. We study this question with LearnStop, a hidden-state-free checkpoint stopper for reasoning language models. At fixed budget checkpoints, LearnStop probes a short answer from the current reasoning prefix and predicts prefix correctness from online features such as answer confidence, entropy, prefix vote share, answer stability, and backtracking-marker density. Across 18 task-model settings spanning GSM8K, MATH-500, MMLU-Pro, AIME-90, GPQA, Qwen3, and DeepSeek-R1 distillations, the answer is task-dependent. On free-form math, learned multi-feature stopping improves the fixed-budget frontier and often beats scalar exits: on GSM8K with Qwen3-32B, the empirical frontier reaches a post-hoc peak adapt gain of +0.157, validation-selected operating points preserve positive gains, and the paired gain over the strongest scalar baseline is +0.028. On multiple-choice and very hard settings, scalar confidence, entropy, or stability rules are competitive or stronger. We therefore frame learned stopping not as a universal replacement for scalar exits, but as a tool whose value depends on trajectory structure. We further provide validation-selected operating points, paired bootstrap tests, finite-grid lost-correct risk calibration, cost accounting under KV-fork, prefix-cache, and black-box regimes, H100 serving profiles, checkpoint-schedule sweeps, transfer analyses, and robustness checks. The main practical finding is that learned stopping is useful when many questions become correct before full budget but do not exhibit a single reliable scalar stopping signal; its benefits largely disappear when confidence or answer convergence already solves the stopping problem.
- Abstract(参考訳): 推論モデルはインスタンス間で異なる量の有用な計算に費やされるが、学習された停止規則が単純な信頼や収束しきい値よりも改善されるかどうかは不明だ。
本研究では,言語モデル解析のための隠れ状態のないチェックポイントストッパーであるLearnStopを用いて,この問題について検討する。
固定予算チェックポイントでは、LearnStopが現在の推論プレフィックスから短い回答を探索し、回答信頼、エントロピー、プレフィックス投票共有、回答安定性、バックトラッキングマーカー密度などのオンライン機能からプレフィックスの正しさを予測する。
GSM8K、MATH-500、MMLU-Pro、AIME-90、GPQA、Qwen3、DeepSeek-R1にまたがる18のタスクモデル設定はタスク依存である。
自由形式数学では、学習された多機能停止は固定予算フロンティアを改善し、しばしばスカラー出口を破る: GSM8K with Qwen3-32B では、経験的フロンティアはポストホックピーク適応ゲイン+0.157、バリデーション選択されたオペレーティングポイントは正のゲインを維持し、最強スカラーベースライン上のペアゲイン+0.028である。
多重選択と非常にハードな設定では、スカラーの信頼、エントロピー、安定性のルールは競争力があるか強いかのどちらかである。
そこで我々は、スカラー出口の普遍的な置換ではなく、軌道構造に依存したツールとして停止を学習した。
さらに、検証選択された運用ポイント、ペアブートストラップテスト、有限グリッドの紛失リスクキャリブレーション、KVフォークによるコスト会計、プレフィックスキャッシュ、ブラックボックスレシスタンス、H100サービスプロファイル、チェックポイントスケジュールスイープ、転送分析、ロバストネスチェックを提供する。
主な実践的発見は、学習した停止は、多くの質問が完全な予算の前に正しいときに有用であるが、単一の信頼できるスカラー停止信号は示さない。
関連論文リスト
- Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models [27.97382399449914]
強化学習(RL)ファインタニングは大規模言語モデル(LLM)の整合に不可欠であるが、そのプロセスは不安定である。
実際に、最高のチェックポイントを選択することは難しい。トレーニング中の検証セットのチェックポイントを評価することは、計算コストが高く、優れた検証セットが必要である。
チェックポイント選択(UGCS)に対する不確実性誘導手法を導入し,これらの落とし穴を回避する。
論文 参考訳(メタデータ) (2025-11-13T01:46:58Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Entropy After $\langle \texttt{/Think} \rangle$ for reasoning model early exiting [38.93424884988798]
正しい解に到達した後も、回答を再検討し続けながら、大きな推論モデルが過大評価されていることを示す。
We propose Entropy After /Think> (EAT) for monitoring and decide whether to exit reasoning early。
EATは、正確性を損なうことなく、トークン使用量を13~21%削減する。
論文 参考訳(メタデータ) (2025-09-30T16:59:37Z) - Centaur: Robust End-to-End Autonomous Driving with Test-Time Training [84.78837437133234]
我々は,手作業によるルールやコスト関数に頼ることなく,テストタイムトレーニングを通じてプランナーの行動を更新するCentaurを提案する。
本稿では,クラスタ・エントロピー(Cluster Entropy,クラスタ・エントロピー)と呼ばれる新しい不確実性尺度を開発した。
論文 参考訳(メタデータ) (2025-03-14T17:59:41Z) - Upper Confidence Primal-Dual Reinforcement Learning for CMDP with
Adversarial Loss [145.54544979467872]
マルコフ決定過程(CMDP)に対するオンライン学習の検討
本稿では,遷移モデルから標本化した軌跡のみを必要とする,新しいEmphupper confidence primal-dualアルゴリズムを提案する。
我々の分析では、ラグランジュ乗算過程の新たな高確率ドリフト解析を、高信頼強化学習の記念後悔解析に組み入れている。
論文 参考訳(メタデータ) (2020-03-02T05:02:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。