論文の概要: CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning
- arxiv url: http://arxiv.org/abs/2607.17568v1
- Date: Mon, 20 Jul 2026 05:27:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.507003
- Title: CoCurve: Cross-Module Co-Pruning Curvature for Training-Free Structured LLM Pruning
- Title(参考訳): CoCurve:無トレーニング構造LDM成形用クロスモジュール共処理曲線
- Abstract要約: CoCurveはキャリブレーションのみの、微調整なしの手法で、注意とFFNのユニットを共同で刺激する。
これは1つの予算付き二次プログラムに還元され、ラベル、微調整、リカバリを伴わず、共有された注目の下で1ショットで解決される。
- 参考スコア(独自算出の注目度): 47.406985340436925
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Structured pruning compresses large language models (LLMs) by removing whole computational units, such as attention heads and feed-forward (FFN) channel groups. Most training-free methods, however, rank these units independently, implicitly treating the loss from pruning a set as the sum of its individual losses. This view fails for Transformers, whose sublayers are coupled through a shared residual stream. Two individually weak units can thus be jointly indispensable, yet independent scoring is blind to such dependence and removes them together. We introduce CoCurve (Cross-Module Co-Pruning Curvature), a calibration-only, fine-tuning-free method that prunes attention and FFN units jointly. A second-order Taylor expansion of the token-level KL between the frozen model and its masked copy yields a single Fisher matrix whose diagonal is classical node saliency and whose off-diagonal entries are co-pruning curvature edges: the extra damage of removing two units together. Under a single-ablation additivity approximation this matrix reduces to a Gram product of single-unit ablation features, so the full M x M interaction is recovered from M forward passes, with no pairwise sweeps or gradients. Pruning then reduces to one budgeted quadratic program, solved in a single shot under a shared attention--FFN budget, with no labels, fine-tuning, or recovery.
- Abstract(参考訳): 構造化プルーニングは、アテンションヘッドやフィードフォワード(FFN)チャネルグループなどの計算単位全体を除去することで、大きな言語モデル(LLM)を圧縮する。
しかし、ほとんどの訓練なしの手法はこれらの単位を独立にランク付けし、集合をプルーニングすることによる損失を個々の損失の和として暗黙的に扱います。
このビューは、サブレイヤが共有残留ストリームを介して結合されるTransformerにとって失敗する。
したがって、2つの個々の弱い単位は、共同で必要不可欠であるが、独立したスコアリングは、そのような依存に盲目であり、それらを一緒に取り除く。
本稿では,Cross-Module Co-Pruning Curvature(Cross-Module Co-Pruning Curvature)を紹介する。
凍結されたモデルとマスクされたコピーの間のトークンレベルKLの2階テイラー展開は、対角線が古典的なノードサリエンスであり、対角線外成分が曲率エッジを共作している単一のフィッシャー行列を生じる: 2つのユニットを一緒に取り除く余分なダメージである。
単単位加法的近似の下では、この行列は単単位のアブレーション特徴のグラム積に還元されるので、M の前方通過から完全な M x M 相互作用が回復され、一対のスイープや勾配が存在しない。
その後、プルーニングは1つの予算付き二次プログラムに還元され、ラベル、微調整、リカバリを行わず、共有された注目の下で1枚のショットで解決される。
関連論文リスト
- Cryptanalytic Extraction of Isolated Bias-Free GLU Feed-Forward Blocks by Antipodal Separation [6.560534698339666]
ReLUネットワーク、GELUやSiLUなどのコンポーネントアクティベーションを用いたネットワーク、およびTransformerの最終的なプロジェクションマトリックスに対して、クリプトアナリシス抽出が実証されている。
これらの手法は、多くの現代言語モデルで使われているバイアスのないGated Linear Unitフィードフォワードブロックを復元しない。
我々は、孤立バイアスのないGLUブロックに対して、構成的で多段階のフォワードクエリリカバリプリミティブを提供する。
論文 参考訳(メタデータ) (2026-08-06T22:41:40Z) - Certified boundary-magic witness for state-dependent proto-area in a holographic code [0.0]
物質を含む領域と幾何結合の片脚を含む4ビット積-EPRホログラフィックコードについて検討した。
物質制御された結合運動のみが境界エントロピーの2次論理状態依存を導くことを示す。
論文 参考訳(メタデータ) (2026-07-12T09:16:46Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding [3.0708725114491293]
ペア化された$ell$-normalized dual-encoder VLM の結合分布を学習するポストホックアダプタとして textbfGeoFlowVLM を提案する。
整合性の結果, 人口制限下では, トレーニングされたネットワークは, 接合流と両モード条件流を露呈することがわかった。
この単一モデルから2つの量を得る:Fano型境界による決定論的解釈でアレター的曖昧さを定量化する条件付き検索エントロピーと、関節NLLの正確な連鎖ルール分解によって正当化される限界特異性スコアである。
論文 参考訳(メタデータ) (2026-05-13T11:12:18Z) - Operator Spectroscopy of Trained Lattice Samplers [0.0]
訓練されたフィールド空間関数自体を解析する。
適合前に固定された演算子ベースにこれらの関数を投影する。
作用素基底はモデルと対称性に依存しているが、テストは一般的である。
論文 参考訳(メタデータ) (2026-05-11T20:06:15Z) - DDCL: Deep Dual Competitive Learning: A Differentiable End-to-End Framework for Unsupervised Prototype-Based Representation Learning [0.0]
ディープクラスタリングにおける永続的な構造的弱点は、特徴学習とクラスタ割り当ての切り離しである。
本稿では,教師なし表現学習のためのエンドツーエンドフレームワークであるDeep Dual Competitive Learningを紹介する。
論文 参考訳(メタデータ) (2026-04-02T08:02:27Z) - Don't Be Greedy, Just Relax! Pruning LLMs via Frank-Wolfe [61.68406997155879]
State-of-the-art Large Language Model (LLM) プルーニング手法は階層的に動作し、階層ごとのプルーニングエラーを最小限に抑え、完全な再トレーニングを回避する。
既存の手法は、刈り上げ対象の重量相互作用を無視する欲求凸に依存する。
提案手法は, 層ごとのプルーニング誤差を大幅に低減し, 最先端のGPTアーキテクチャにおいて高いベースラインを達成し, メモリ効率を保っている。
論文 参考訳(メタデータ) (2025-10-15T16:13:44Z) - Constrained Edge AI Deployment: Fine-Tuning vs Distillation for LLM Compression [1.85373927927491]
現代のモデルは、エッジデプロイメントの厳密な計算、メモリ、接続制約を満たすために、構造化プルーニングと再トレーニングの組み合わせによって圧縮されることが多い。
我々の焦点は最大圧縮を達成することではなく、再学習損失関数の影響を分離することである。
エッジネットワークに典型的な断続的あるいは否定的な接続シナリオに適したコモンセンスQAのOLMo2-7B-SFTモデル上で両方のパイプラインを評価する。
論文 参考訳(メタデータ) (2025-05-13T19:06:32Z) - Lifting the Convex Conjugate in Lagrangian Relaxations: A Tractable
Approach for Continuous Markov Random Fields [53.31927549039624]
断片的な離散化は既存の離散化問題と矛盾しないことを示す。
この理論を2つの画像のマッチング問題に適用する。
論文 参考訳(メタデータ) (2021-07-13T12:31:06Z) - Competitive Mirror Descent [67.31015611281225]
制約のある競合最適化には、制約の対象となる競合する目的を最小化しようとする複数のエージェントが含まれる。
本稿では, 競合ミラー降下法(CMD)を提案する。
特別の場合として、正の円錐上の問題に対する新しい競合乗法重みアルゴリズムを得る。
論文 参考訳(メタデータ) (2020-06-17T22:11:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。