論文の概要: Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.09008v1
- Date: Sat, 09 May 2026 15:47:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.015753
- Title: Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
- Title(参考訳): 大規模言語モデルにおける推論型構造解析のための相対的速度論的有用性
- Authors: Tianhao Qian,
- Abstract要約: モデルの深さ多様体上での連続的な運動積分に離散的なプルーニングを高める新しい枠組みを提案する。
Qwen-2.5-7B と LLaMA-3-8B の試験により、高スパーシティのシステムの性能は40%向上した。
RKUはGSM8Kで40%の精度で13.34%の精度を達成し、最強のベースラインを上回った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-Thought (CoT) prompting symbolized a huge improvement of reasoning capabilities of Large Language Models (LLMs). However, scaling up test-time computation yields extensive CoT sequences, introducing severe inference latency and key-value (KV) cache memory bottlenecks. While structural pruning offers a fundamental, hardware-aware solution to alleviate static parameter burdens, existing magnitude-based methods may cut off the neurons of CoT: by over-indexing on discrete cross-entropy objectives, these heuristics fall into a \textit{magnitude trap}: they prioritize high-frequency, low-information syntactic tokens and trigger a disappointing reasoning collapse at high sparsities (e.g., 40\%). To overcome this topological phase transition, we propose \textsc{Relative Kinetic Utility} (RKU), a novel theoretical framework that elevates discrete pruning to a continuous kinetic integral over the depth manifold of the model based on Alternating Gradient Flow(AGF). By modifying it with Fisher trace normalization, RKU acts as a lightweight curvature-aware normalization to isolate \textit{kinetic spikes} -- the fundamental structural pathways responsible for high-curvature logical routing. Extensive experiments on Qwen-2.5-7B and LLaMA-3-8B improves performance in the high-sparsity regime around 40\%. RKU attains 13.34\% accuracy on GSM8K at 40\% sparsity, outperforming the strongest baseline, and appears to better preserve reasoning-relevant representations under out-of-distribution evaluation.
- Abstract(参考訳): CoT(Chain-of-Thought)は、LLM(Large Language Models)の推論能力の大幅な向上を象徴するものだ。
しかし、テスト時間計算のスケールアップによりCoTシークエンスが大きくなり、厳しい推論遅延とキー値(KV)キャッシュメモリボトルネックが発生する。
構造的プルーニングは静的パラメータの負担を軽減するための基本的なハードウェア対応のソリューションを提供するが、既存のスケールベースの手法はCoTのニューロンを遮断する: 離散的なクロスエントロピーの目的を過剰にインデクシングすることで、これらのヒューリスティックは \textit{magnitude trap} に分類される。
このトポロジカル位相遷移を克服するために、交代勾配流(AGF)に基づくモデルの深さ多様体上の連続的運動積分に離散的プルーニングを高める新しい理論フレームワークである「textsc{Relative Kinetic Utility}」(RKU)を提案する。
Fisher のトレース正規化で修正することで、RKU は、高曲率論理的ルーティングに責任を持つ基本的な構造経路である \textit{kinetic spikes} を分離するために、軽量な曲率対応正規化として機能する。
Qwen-2.5-7B と LLaMA-3-8B の広範囲な実験により, 高分散状態における性能は 40 % 程度向上した。
RKUはGSM8Kの40倍の精度で13.34倍の精度を達成し、最強のベースラインを上回り、アウト・オブ・ディストリビューション評価の下での推論関連表現をよりよく保存しているように見える。
関連論文リスト
- Unveiling the Mechanism of Continuous Representation Full-Waveform Inversion: A Wave Based Neural Tangent Kernel Framework [52.632217600064344]
フルウェーブフォーム・インバージョン(FWI)は、限られた測定値から波動方程式の物理パラメータを推定する。
FWI法は初期モデルの精度に対する悪名高い感度によって制限されている。
連続表現 FWI (CR-FWI) の最近の進歩は、暗黙的ニューラル表現 (INR) のような座標ベースニューラルネットワークによるパラメータモデルを表現することで、初期モデルへの依存を緩和できることを実証している。
論文 参考訳(メタデータ) (2026-03-23T03:22:33Z) - Alternating Gradient Flow Utility: A Unified Metric for Structural Pruning and Dynamic Routing in Deep Networks [52.153950303594684]
交互勾配流(Alternating Gradient Flow, AGF)に着想を得た非結合型運動パラダイムを提案する。
AGFはネットワークの構造的「運動ユーティリティ」を正確にキャプチャする
我々は、AGFに誘導されるオフライン構造探索を、ゼロコストの物理プリミティブを介してオンライン実行から切り離すハイブリッドルーティングフレームワークを設計する。
論文 参考訳(メタデータ) (2026-03-12T18:19:21Z) - On Multi-Step Theorem Prediction via Non-Parametric Structural Priors [50.16583672681106]
本研究では,インコンテキスト学習(ICL)のレンズによる学習自由な定理予測について検討する。
本稿では,過去の解の時間的依存関係を有向グラフとしてエンコードし,推論中に探索空間を効果的に引き起こす明示的なトポロジ的制約を課すTheorem Precedence Graphsを提案する。
FormalGeo7kベンチマークの実験から,本手法は89.29%の精度を実現し,ICLベースラインを著しく上回り,最先端の教師付きモデルに適合することがわかった。
論文 参考訳(メタデータ) (2026-03-05T06:08:50Z) - Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression [55.63153956934198]
Chain-of-Thought (CoT)推論はLarge Language Models (LLMs)の推論能力をうまく向上させる
既存のCoT圧縮法は、しばしば高い圧縮比で論理的忠実度が著しく低下する。
本稿では,Extra-CoTと呼ばれる新しいEXTreme-RAtio Chain-of-Thought Compressionフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-09T06:57:15Z) - HQP: Sensitivity-Aware Hybrid Quantization and Pruning for Ultra-Low-Latency Edge AI Inference [0.0]
相乗的モデル加速を実現するために設計されたHybrid Quantization and Pruning (HQP)フレームワーク。
HQPフレームワークは3.12倍の推論速度向上と55%のモデルサイズ縮小を実現している。
論文 参考訳(メタデータ) (2026-02-02T18:17:45Z) - Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding [54.05243949024302]
既存の堅牢なMLLMは、視覚エンコーダの一般化にのみ焦点をあてた暗黙のトレーニング/適応に依存している。
本稿では,構造的推論連鎖による視覚的劣化を明示的にモデル化する新しいフレームワークであるRobust-R1を提案する。
提案手法は, (i) 劣化を考慮した推論基盤の微調整, (ii) 劣化パラメータを正確に知覚するための報酬駆動アライメント, (iii) 劣化強度に適応した動的推論深度スケーリングの2つを統合した。
論文 参考訳(メタデータ) (2025-12-19T12:56:17Z) - CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization [5.857877898558651]
CoT(Chain-of-Thought)推論は、大規模言語モデル(LLM)の問題解決能力を高めるが、かなりの推論オーバーヘッドをもたらす。
本稿では、適応的推論要約フレームワークを用いて、異なるスケールとアーキテクチャのモデル間での効率的なCoT転送について検討する。
論文 参考訳(メタデータ) (2025-11-07T22:35:31Z) - RaCoT: Plug-and-Play Contrastive Example Generation Mechanism for Enhanced LLM Reasoning Reliability [12.67288560758937]
本稿では,RaCoT(Retrieval-aware Contrastive-of-Thought)を提案する。
RaCoTは、解答の発散を決定する重要な詳細に積極的に焦点を合わせるようモデルに誘導する。
論文 参考訳(メタデータ) (2025-10-26T15:06:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。