論文の概要: Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model
- arxiv url: http://arxiv.org/abs/2608.14003v1
- Date: Fri, 14 Aug 2026 06:46:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.296879
- Title: Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model
- Title(参考訳): Batch-wise Adaptive Pruning:Language Reasoning Modelのための周期ニューロン活性化型ウェイトプルーニング
- Authors: Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo,
- Abstract要約: LRMにおけるバッチ推論のための学習不要適応型プルーニング法を提案する。
閾値に基づく選択を、集約された重要度スコアよりも周期的なトップk選択に置き換える。
バッチサイズ4の平均精度は39.7ポイント向上した。
- 参考スコア(独自算出の注目度): 41.842373153015586
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Reasoning Models (LRMs) achieve strong performance on complex tasks through extended chain-of-thought generation, but incur substantial computational costs during inference. In production settings, batched inference is essential for high throughput, yet the existing training-free adaptive pruning methods we evaluate severely degrade in this regime. Because a batch must share a single pruning mask, these methods aggregate activations across samples and then apply threshold-based selection; the threshold, calibrated offline on unaggregated activations, no longer matches the aggregated distribution, so the realized sparsity ratio drifts and accuracy on reasoning tasks collapses under batched inference. In this work, we propose a training-free adaptive pruning method designed specifically for batched inference in LRMs, built on two components. First, we replace threshold-based selection with periodic top-k selection over the aggregated importance scores, which is unaffected by the shift that aggregation induces in the activation distribution, and which runs selection once per update period rather than at every token, preserving the speedup. Second, based on the observation that important neurons re-fire periodically during long reasoning generation, we introduce an activation memory that accumulates importance across update phases so that recurring neurons are retained. Experiments on diverse reasoning benchmarks demonstrate that our method outperforms the previous state-of-the-art adaptive pruning method by 39.7 percentage points in average accuracy at batch size 4 with 50% target sparsity on DeepSeek-R1-Distill-Qwen-7B, and reaches 1.40x speedup over dense inference at 50% actual sparsity.
- Abstract(参考訳): 大規模推論モデル(LRM)は、拡張連鎖生成によって複雑なタスクにおいて高い性能を達成するが、推論中にかなりの計算コストを発生させる。
実運用環境では、バッチ推論は高いスループットに不可欠であるが、既存のトレーニング不要適応型プルーニング手法では、この方式では著しく劣化している。
バッチは単一のプルーニングマスクを共有する必要があるため、これらのメソッドはサンプル間でアクティベーションを集約し、しきい値ベースの選択を適用する必要がある。
本研究では,2つのコンポーネント上に構築されたLEMのバッチ推論に特化して設計された学習自由適応型プルーニング手法を提案する。
まず、アクティベーション分布に生じるシフトの影響を受けず、各トークンでではなく、更新期間毎に1回だけ選択を実行することで、スピードアップを保ちながら、閾値ベースの選択を、集約された重要度スコアよりも周期的にトップk選択に置き換える。
第2に、長い推論生成中に重要なニューロンが周期的に再発火する観察に基づいて、更新フェーズ間で重要となるアクティベーションメモリを導入し、繰り返しニューロンが保持されるようにする。
本手法は,DeepSeek-R1-Distill-Qwen-7Bにおいて,バッチサイズ4の平均精度で39.7ポイント向上し,50パーセントの精度で高密度推定よりも1.40倍の高速化を達成した。
関連論文リスト
- Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models [11.158010513386666]
大規模推論モデル(LRM)は、明確な連鎖推論プロセスによって複雑な問題を解くことができる。
LRMはしばしば過大評価に悩まされ、冗長なトークン出力と劣化した精度をもたらす。
本稿では,モデルの推論状態を推定し,生成戦略を適応的に調整するASAGを提案する。
論文 参考訳(メタデータ) (2026-06-13T02:58:29Z) - When Learning Rates Go Wrong: Early Structural Signals in PPO Actor-Critic [1.0518862318418603]
Overfitting-Underfitting Indicator (OUI)は、固定プローブバッチ上のバイナリアクティベーションパターンのバランスを定量化する指標である。
トレーニングの10%で測定されたOUIは、LR体制間で既に差別化されている。
次に、OUIベースのスクリーニングルールを、早いリターン、クリップベース、ばらつきベース、フリップベースの基準に対して、成功したリコールに対して一致したリコールの下で比較する。
論文 参考訳(メタデータ) (2026-03-10T17:46:31Z) - Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning [66.22060690012512]
大規模な推論モデルは、より多くのテストタイム計算で改善されるが、しばしば過大評価され、正確さを向上することなくコストを上昇させる必要のない長い連鎖を生み出す。
本研究は,本質的な貢献に基づいて,ステップ間の長さ短縮を割り当てる,きめ細かいフレームワークであるSWAPを提案する。
論文 参考訳(メタデータ) (2026-02-27T20:23:59Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Activation-Space Uncertainty Quantification for Pretrained Networks [2.001149416674759]
本稿では,ベイズモデリングをウェイトからアクティベーションにシフトさせるポストホック法であるガウス過程活性化(GAPA)を紹介する。
GAPAは標準的な非線形性を、後部平均が元のアクティベーションと正確に一致するアクティベーションに置き換え、構築によるバックボーンのポイント予測を保存する。
現代のアーキテクチャにスケールするために、キャッシュされたトレーニングアクティベーションに対するスパース変分誘導点近似と、ローカルk-アレスト近傍条件の組み合わせを用いる。
論文 参考訳(メタデータ) (2026-02-16T17:17:08Z) - What If We Allocate Test-Time Compute Adaptively? [2.1713977971908944]
テストタイムスケーリングは、推論計算を均一に割り当て、固定されたサンプリング戦略を使用し、再ランク付けにのみ検証を適用する。
本稿では,推論を反復的軌跡生成と選択として扱う検証器誘導適応フレームワークを提案する。
データセット全体にわたって、当社の動的PRMガイダンスアプローチは、テスト時間の直接スケーリングよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-01T07:30:22Z) - Efficient Thought Space Exploration through Strategic Intervention [54.35208611253168]
本稿では,この知見を2つの相乗的コンポーネントを通して操作するHint-Practice Reasoning(HPR)フレームワークを提案する。
フレームワークの中核となる革新は、動的に介入点を識別する分散不整合低減(DIR)である。
算術的および常識的推論ベンチマークによる実験は、HPRの最先端の効率-精度トレードオフを実証している。
論文 参考訳(メタデータ) (2025-11-13T07:26:01Z) - The Lipschitz-Variance-Margin Tradeoff for Enhanced Randomized Smoothing [85.85160896547698]
ディープニューラルネットワークの現実的な応用は、ノイズの多い入力や敵攻撃に直面した場合、その不安定な予測によって妨げられる。
入力にノイズ注入を頼りに、認証された半径を持つ効率的な分類器を設計する方法を示す。
新たな認証手法により、ランダムな平滑化による事前学習モデルの使用が可能となり、ゼロショット方式で現在の認証半径を効果的に改善できる。
論文 参考訳(メタデータ) (2023-09-28T22:41:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。