論文の概要: OBC-Prune: Outcome-Based Calibration for Large Reasoning Model Pruning
- arxiv url: http://arxiv.org/abs/2609.17890v1
- Date: Tue, 15 Sep 2026 22:30:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.556072
- Title: OBC-Prune: Outcome-Based Calibration for Large Reasoning Model Pruning
- Title(参考訳): OBC-Prune:大規模推論モデル解析のためのアウトカムベース校正
- Abstract要約: 大きな推論モデルは、答えの前に長い連鎖トレースを生成し、大きな推論オーバーヘッドを生み出します。
最近の作業では、ジェネリックデータセットではなく、モデル自身のロールアウトを校正するが、すべての推論トークンを均一に扱う。
本稿では,このギャップを埋めるために,大規模推論モデルプルーニング(OBC-Prune)のアウトカムベースを提案する。
- 参考スコア(独自算出の注目度): 4.219677071028101
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large reasoning models (LRMs) generate long chain-of-thought traces before answering, creating significant inference overhead. Pruning can reduce this cost, but its effectiveness depends on the calibration data used to estimate parameter importance. Recent work calibrates on the model's own rollouts instead of generic dataset, but treats all reasoning tokens uniformly, regardless of whether they contribute to successful reasoning. As a result, pruning protects weights by statistical salience rather than by their contribution to correct reasoning, so weights behind erroneous computation survive as readily as those behind correct computation. These erroneous patterns then get carried into the pruned model, degrading reasoning quality, producing both lower accuracy and longer reasoning traces. We propose Outcome-Based Calibration for Large Reasoning Model Pruning (OBC-Prune) to close this gap. OBC first constructs difficulty-matched pairs of correct and incorrect rollouts from problems the model answers inconsistently. It then estimates the causal importance of each reasoning sentence through intervention-based analysis, quantifying how removing its influence affects subsequent predictions. These causal importance scores are converted into per-token weights that rescale the calibration activations used by one-shot pruning methods (SparseGPT, Wanda, ALPS), without modifying the underlying pruning algorithms. Experiments on DeepSeek-R1-Distill-Qwen 1.5B, 7B, and 14B models at 40\% and 50\% sparsity demonstrate consistent improvements over state-of-the-art calibration baselines across most model sizes and sparsity levels on MATH500, LiveCodeBench, and AIME 2025. These results indicate that preserving causally important reasoning circuits is a substantially more effective pruning objective than uniformly preserving observed activations.
- Abstract(参考訳): 大きな推論モデル(LRM)は、答えの前に長い連鎖トレースを生成し、大きな推論オーバーヘッドを生み出します。
プルーニングはこのコストを削減できるが、その有効性はパラメータの重要度を推定するために使用されるキャリブレーションデータに依存する。
最近の作業は、ジェネリックデータセットではなく、モデル自身のロールアウトを校正するが、成功した推論に寄与するかどうかに関わらず、すべての推論トークンを均一に扱う。
結果として、プルーニングは正しい推論への貢献よりも統計的なサリエンスによって重みを保護し、誤った計算の裏にある重みは正しい計算の裏にあるものと同じくらい容易に生き残る。
これらの誤パターンはプルーニングモデルに取り込み、推論品質を劣化させ、より低い精度と長い推論トレースを生成する。
本稿では,このギャップを埋めるために,大規模推論モデルプルーニング(OBC-Prune)のためのアウトカムベースキャリブレーションを提案する。
OBCはまず、モデルが矛盾なく答える問題から、整合性のある正しいロールアウトと間違ったロールアウトのペアを構築します。
そして、介入に基づく分析により、各推論文の因果的重要性を推定し、その影響がその後の予測にどのように影響するかを定量化する。
これらの因果的重要性スコアは、基礎となるプルーニングアルゴリズムを変更することなく、ワンショットプルーニング法(SparseGPT, Wanda, ALPS)で使用されるキャリブレーションアクティベーションを再スケールする、トーケン単位の重みに変換される。
DeepSeek-R1-Distill-Qwen 1.5B, 7B, 14Bモデルを40\%, 50\%の間隔で実験したところ、ほとんどのモデルサイズとMATH500, LiveCodeBench, AIME 2025上で、最先端のキャリブレーションベースラインに対して一貫した改善が見られた。
これらの結果は、因果的に重要な推論回路を保存することは、観察された活性化を均一に保存するよりも、かなり効果的なプルーニング目的であることを示している。
関連論文リスト
- Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models [0.0]
CoT推論は精度と信頼性を向上させるために広く用いられている。
タスク固有のしきい値を超えた推論予算の増加は、モデルが体系的に過信される可能性があることを示す。
この振る舞いを説明するために,自己回帰生成に基づく仮説ロックインモデルを提案する。
論文 参考訳(メタデータ) (2026-04-24T04:46:16Z) - Observationally Informed Adaptive Causal Experimental Design [55.998153710215654]
本稿では,観測モデルを基礎的先行として活用する新たなパラダイムであるアクティブ残留学習を提案する。
このアプローチは、実験的な焦点を、目標因果量の学習から、観察バイアスの補正に必要な残差を効率的に推定するへとシフトさせる。
合成および半合成ベンチマークの実験は、R-Designがベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-03-04T06:52:37Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs [9.412828452977553]
既存のアプローチは成功した推論パスを強化し、かなりのキャリブレーションコストを発生させる。
この失敗は、アライメントにおけるモデル崩壊の一形態として特徴づけられている。
推論性能とキャリブレーションを協調的に最適化する訓練目標として,EpiCaRを提案する。
論文 参考訳(メタデータ) (2026-01-11T06:21:13Z) - Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training [11.179110411255708]
トレーニング予算からベンチマークパフォーマンスのスケーリングをモデル化するための直接的なフレームワークを提案する。
その結果, 直接的アプローチは従来提案していた2段階の手順よりも優れていることがわかった。
事前学習損失と下流評価結果の完全なセットを公表する。
論文 参考訳(メタデータ) (2025-12-09T18:33:48Z) - Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models [31.422773877490613]
推論 LLM (Reasoning LLMs) はチェーン・オブ・ソート・ジェネレーションを通じて強力な多段階推論を実現する。
RLMの大きなモデルサイズと長いデコードタイムのアウトプットは、リソース制約のある設定にデプロイするのにコストがかかり、不適当である。
我々は、構造化されたプルーニングフレームワークであるRESPを紹介し、プルーニング決定とモデルの推論力学を一致させる。
論文 参考訳(メタデータ) (2025-12-01T20:27:05Z) - Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models [48.973207827896]
キャリブレーションのための自己生成推論データを使用することで,プルーニング性能を大幅に向上できることを示す。
分析の結果,困難かつ適度に長い自己生成推論データが理想的なキャリブレーションデータであることがわかった。
論文 参考訳(メタデータ) (2025-11-24T08:08:19Z) - Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation [25.195244084313114]
CoPeD (Chain-of-Thought Correctness Perception Distillation) は,学生モデルの推論品質の向上を目的としている。
CoPeDは学生モデルに対して、正しい合理性に基づいて回答を予測し、誤ったときに修正するよう推奨する。
論文 参考訳(メタデータ) (2025-09-06T05:33:17Z) - O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning [98.3430004984531]
精度を維持しながら推論オーバーヘッドを最小限に抑えるため,Longth-Harmonizing Fine-Tuning (O1-Pruner)を提案する。
私たちのコードはもうすぐhttps://github.com/StarDewXXX/O1-Pruner.comで公開されます。
論文 参考訳(メタデータ) (2025-01-22T01:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。