論文の概要: Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization
- arxiv url: http://arxiv.org/abs/2607.22583v1
- Date: Mon, 08 Jun 2026 09:38:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.976318
- Title: Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization
- Title(参考訳): レイテンシとモデルサイズ最適化のためのLLMの多目的構造解析
- Abstract要約: 大きな言語モデル(LLM)は、強い推論とクエリ応答能力のために広く採用されている。
組み込みおよびエッジコンピューティング環境へのデプロイは、厳格なレイテンシ、メモリ、エネルギー制約のため、依然として困難である。
本稿では,これらの制約に対処するため,ハードウェアを意識した多目的構造化プルーニングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 2.3012967702331313
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have achieved widespread adoption because of their strong reasoning and query-response capabilities. However, deploying them in embedded and edge computing environments remains challenging because of strict latency, memory, and energy constraints. Their large parameter counts and computational demands hinder efficient execution on resource-constrained platforms. Although model pruning has emerged as a viable solution for reducing scale while preserving performance, jointly optimizing layers, attention heads, and Multi-Layer Perceptron (MLP) dimensions remains highly complex. Exhaustively exploring this combined design space is computationally expensive and often leads to local optima or unstable configurations. To address these limitations, we propose a hardware-aware, multi-objective structured pruning framework. The proposed two-stage method explicitly targets latency and model size for efficient deployment on edge devices. In the coarse-grained stage, multi-objective depth pruning removes entire attention and MLP blocks to reduce computational load and memory usage. In the subsequent fine-grained stage, Parallel Bayesian Optimization (PBO) searches for the optimal layer-wise pruning ratios for pruning under latency constraints, while importance-based strategies rank the specific components to be pruned within each layer's allocated budget. Experimental results show that our approach reduces model complexity with minimal impact on commonsense reasoning tasks and zero-shot performance. Our method achieves a favorable trade-off among accuracy, latency, and model size, making it suitable for edge deployment. Across multiple LLMs at 37.5% and 50% pruning ratios, the proposed approach achieves better performance on commonsense reasoning tasks than existing methods while significantly reducing inference cost.
- Abstract(参考訳): 大きな言語モデル(LLM)は、強い推論とクエリ応答能力のために広く採用されている。
しかしながら、組み込みおよびエッジコンピューティング環境へのデプロイは、厳格なレイテンシ、メモリ、エネルギー制約のため、依然として困難である。
彼らの大きなパラメータ数と計算要求は、リソース制約されたプラットフォーム上での効率的な実行を妨げる。
モデルプルーニングは性能を保ちながらスケールを縮小するための有効なソリューションとして現れてきたが、レイヤー、アテンションヘッド、マルチ層パーセプトロン(MLP)次元は依然として非常に複雑である。
この組み合わせ設計空間を徹底的に探索することは計算に高価であり、しばしば局所的な最適あるいは不安定な構成につながる。
これらの制約に対処するために,ハードウェアを意識した多目的構造化プルーニングフレームワークを提案する。
提案手法は,エッジデバイスへの効率的なデプロイのために,レイテンシとモデルサイズを明示的に目標とする。
粗粒度では、多目的深度プルーニングは、計算負荷とメモリ使用量を減らすために、すべての注意とMLPブロックを除去する。
その後の微粒化段階において、パラレルベイズ最適化(PBO)は遅延制約下でのプルーニングに最適なレイヤワイズプルーニング比を探索し、重要度に基づく戦略は各レイヤの割り当てられた予算内でプルーニングすべき特定のコンポーネントをランク付けする。
実験結果から,本手法は,コモンセンス推論タスクとゼロショット性能に最小限の影響を伴って,モデル複雑性を低減することが示唆された。
提案手法は,精度,レイテンシ,モデルサイズにおいて良好なトレードオフを実現し,エッジ展開に適した方法である。
提案手法は,37.5%と50%のプルーニング比の複数のLLMに対して,既存の手法よりもコモンセンス推論タスクの性能を向上し,推論コストを大幅に削減する。
関連論文リスト
- HiAP: A Multi-Granular Stochastic Auto-Pruning Framework for Vision Transformers [3.644142828550762]
ビジョントランスフォーマーは計算資源とメモリ帯域幅を著しく制限し、エッジデバイスへの展開を著しく制限する。
単一エンドツーエンドのトレーニングフェーズにおいて最適なサブネットワークを探索する継続的緩和フレームワークである階層型オートプルーニング(HiAP)を提案する。
HiAPは大きな行列をロードするメモリバウンドオーバーヘッドと計算バウンドな数学的操作の両方に対処する。
論文 参考訳(メタデータ) (2026-03-12T17:45:38Z) - Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models [17.818685759025207]
レイヤーワイズプルーニングは推論コストを軽減するために一般的に使用される戦略である。
本稿では,協調ゲームとしてレイヤープルーニングを定式化するゲーム理論フレームワークを提案する。
大規模な言語モデルに対して、より効率的で効果的なレイヤワイドプルーニングを実現する。
論文 参考訳(メタデータ) (2026-02-08T03:51:36Z) - EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs [0.36050743818632486]
エッジGPU上の推論タスクのための大規模言語モデル(LLM)は、厳格なレイテンシ制約と限られた計算リソースから重要な課題に直面している。
これらの制約をナビゲートするには、推論と非推論アーキテクチャのバランス、適切なモデルサイズの選択、トークン予算の割り当て、テスト時のスケーリング戦略の適用が必要です。
We present EdgeReasoning, a comprehensive study that the deployment of reasoning LLMs on edge GPUs。
論文 参考訳(メタデータ) (2025-10-21T04:18:25Z) - PT$^2$-LLM: Post-Training Ternarization for Large Language Models [52.4629647715623]
大きな言語モデル(LLM)は、様々なタスクにまたがる印象的な機能を示しているが、その大きなメモリと計算能力は、デプロイメントを妨げている。
PT$2$-LLMを提案する。
その中核は2段精製パイプラインを備えた非対称3次量子化器である。
論文 参考訳(メタデータ) (2025-09-27T03:01:48Z) - CSGO: Generalized Optimization for Cold Start in Wireless Collaborative Edge LLM Systems [62.24576366776727]
本稿では,全体の推論遅延を最小限に抑えるために,遅延を考慮したスケジューリングフレームワークを提案する。
提案手法は,ベースライン戦略と比較して,コールドスタート遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-08-15T07:49:22Z) - LOP: Learning Optimal Pruning for Efficient On-Demand MLLMs Scaling [52.1366057696919]
LOPは、ターゲットプルーニング制約から最適なプルーニング戦略を学ぶ、効率的なニューラルプルーニングフレームワークである。
LOPアプローチでは、自動回帰ニューラルネットワーク(NN)を使用して、ターゲットプルーニング制約に適応したレイヤワイズプルーニング戦略を直接予測する。
実験の結果,LOPは最大3桁のスピードアップを達成しつつ,様々な測定値において最先端のプルーニング手法よりも優れていた。
論文 参考訳(メタデータ) (2025-06-15T12:14:16Z) - SPAP: Structured Pruning via Alternating Optimization and Penalty Methods [2.1388885579612804]
大規模言語モデル(LLM)は、しばしば計算とメモリの要求によって制約される。
最適化理論に基づくLLMのための新規かつ効率的な構造化プルーニングフレームワークであるSPAP(Structured Pruning via Alternating Optimization and Penalty Methods)を提案する。
我々の研究は、モデル性能を保ちながらLLMを刈り取るための実用的で最適化駆動のソリューションを提供する。
論文 参考訳(メタデータ) (2025-05-06T09:47:53Z) - LESA: Learnable LLM Layer Scaling-Up [57.0510934286449]
LLM(Large Language Models)をスクラッチからトレーニングするには膨大な計算資源が必要であるため、非常に高価である。
モデルスケーリングアップは、より小さなモデルのパラメータを活用してより大きなモデルを作成することで、有望なソリューションを提供する。
深度スケールアップのための新しい学習方法である textbfLESA を提案する。
論文 参考訳(メタデータ) (2025-02-19T14:58:48Z) - Progressive Binarization with Semi-Structured Pruning for LLMs [36.91249209658632]
半構造化プルーニング(PBS$2$P)によるプログレッシブバイナリ化を提案し,バイナライゼーションと半構造化プルーニングをシームレスに統合する新しいポストトレーニングフレームワークを提案する。
PBS$2$P は,2進法(SOTA) の2進法を複雑度と下流精度の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-02-03T13:30:29Z) - A Multi-Head Ensemble Multi-Task Learning Approach for Dynamical
Computation Offloading [62.34538208323411]
共有バックボーンと複数の予測ヘッド(PH)を組み合わせたマルチヘッドマルチタスク学習(MEMTL)手法を提案する。
MEMTLは、追加のトレーニングデータを必要とせず、推測精度と平均平方誤差の両方でベンチマーク手法より優れている。
論文 参考訳(メタデータ) (2023-09-02T11:01:16Z) - Efficient Micro-Structured Weight Unification and Pruning for Neural
Network Compression [56.83861738731913]
ディープニューラルネットワーク(DNN)モデルは、特にリソース制限されたデバイスにおいて、実用的なアプリケーションに不可欠である。
既往の非構造的あるいは構造化された重量刈り法は、推論を真に加速することはほとんど不可能である。
ハードウェア互換のマイクロ構造レベルでの一般化された重み統一フレームワークを提案し,高い圧縮と加速度を実現する。
論文 参考訳(メタデータ) (2021-06-15T17:22:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。