論文の概要: Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects
- arxiv url: http://arxiv.org/abs/2608.30076v2
- Date: Thu, 03 Sep 2026 14:46:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.18727
- Title: Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects
- Title(参考訳): 単一GPU LLM推論のための予算を考慮した圧縮パイプライン:方法,トレードオフ,結合効果
- Abstract要約: 我々は,現実的な実行下でのプルーニング,量子化,KV-cache圧縮の相互作用を示す。
我々は実用的なパイプラインを構築し、70Bモデルを約33GBに圧縮し、10kトークンプロンプトで約57トークン/秒を持続し、共通および推論ベンチマークで5%以内の絶対精度を維持した。
- 参考スコア(独自算出の注目度): 16.273825996642703
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Single-GPU deployment of 70B-parameter language models on an NVIDIA GPU is constrained by device memory, long-context throughput, and engineering integration cost. We cast single-GPU inference as a budget-aware design problem over these three axes and study how pruning, quantization, and KV-cache compression interact under realistic execution. Controlled ablations show that layer-wise pruning makes weight quantization more robust. KV-cache sparsification complements INT8 KV quantization by reducing memory without hurting decoding speed, while static vector quantizers often conflict with dynamic caching. Guided by these coupling results and explicit budget tracking, we assembled a practical pipeline and compressed a 70B model to about 33 GB, sustained about 57 tokens/s on 10k token prompts on a single A40, and kept absolute accuracy within 5% on common and reasoning benchmarks. We contribute design rules and a reproducible evaluation protocol that jointly report quality, memory, and end-to-end speed, and we provide a foundation for automated pipeline search under realistic single-GPU constraints.
- Abstract(参考訳): NVIDIA GPU上の70Bパラメータ言語モデルのシングルGPU展開は、デバイスメモリ、長期コンテキストスループット、エンジニアリング統合コストによって制限される。
これら3つの軸に対して単GPU推論を予算を考慮した設計問題とし,現実的な実行下でのプルーニング,量子化,KV-cache圧縮の相互作用について検討した。
制御されたアブレーションは、層ワイドプルーニングが重量量子化をより堅牢にすることを示している。
KVキャッシュスペーシフィケーションは、デコード速度を損なうことなくメモリを削減し、INT8 KV量子化を補完するが、静的ベクトル量子化器は動的キャッシュと競合することが多い。
これらの結合結果と明確な予算追跡に導かれ、我々は実用的なパイプラインを組み立て、70Bモデルを約33GBに圧縮し、1つのA40上で約57トークン/秒を10kトークンプロンプトに保持し、共通および推論ベンチマークで5%以内の絶対精度を維持した。
我々は、設計規則と再現可能な評価プロトコルにコントリビュートし、品質、メモリ、エンド・ツー・エンドのスピードを共同で報告し、現実的なシングルGPU制約の下でパイプラインの自動探索の基盤を提供する。
関連論文リスト
- OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models [0.0]
キー値(KV)キャッシュは、大きな言語モデルにおける推論中に重要なメモリボトルネックを示す。
我々は、KVキャッシュ圧縮のためのINT8量子化を実装し、最小の精度で4$times$メモリ削減を実現した。
論文 参考訳(メタデータ) (2026-01-08T08:35:56Z) - SHARe-KAN: Holographic Vector Quantization for Memory-Bound Inference [0.0]
ビジョン・カンはホログラフィック・トポロジーを示しており、情報は特定のエッジに局所化されるのではなく、スプラインの干渉によって分散される。
本稿では,ゲイン形状バイアスベクトル量子化を利用した高密度トポロジーを保ちながら機能的冗長性を利用するフレームワークであるSHARe-KANを提案する。
論文 参考訳(メタデータ) (2025-12-10T04:10:13Z) - XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization [58.92253769255316]
LLM推論はメモリフットプリントと帯域幅の要求のために困難である。
XQuantは、ハードウェアプラットフォームの急速に増加する計算能力を利用して、メモリボトルネックを取り除く。
XQuant-CLは、極端な圧縮のためにX埋め込みの層間類似性を利用する。
論文 参考訳(メタデータ) (2025-08-14T06:52:38Z) - HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs [13.013668526921778]
既存のKVキャッシュ圧縮手法は、メモリが85%以上削減されたときに顕著な性能劣化を示す。
我々は、鍵量子化、値オフロード、動的KV消去を統合した異種アテンションフレームワークであるHCAttentionを提案する。
また,LongBenchベンチマークを用いて,KVキャッシュメモリのフットプリントを25%に縮めながら,本手法が完全アテンションモデルの精度を維持することを示した。
論文 参考訳(メタデータ) (2025-07-26T06:43:14Z) - CommVQ: Commutative Vector Quantization for KV Cache Compression [50.37946553931796]
本稿では,長期LLM推論におけるメモリ使用量を大幅に削減するために,CommVQ(CommVQ)を提案する。
まず、KVキャッシュを圧縮するための軽量エンコーダとコードブックを用いた加算量子化を導入する。
提案手法は,RoPE-commutative codebook を用いた加算量子化と低オーバーヘッド化により高い精度を実現する。
論文 参考訳(メタデータ) (2025-06-23T17:50:11Z) - TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization [21.229296254354878]
生成型大規模言語モデル(LLM)におけるキーバリューキャッシュは、かなりのメモリオーバーヘッドをもたらす。
既存の作業は、KVキャッシュをオフロードまたは圧縮することで、この負担を軽減する。
本稿では,量子化とオフロードをシームレスに統合するハイブリッド圧縮手法であるTailorKVを提案する。
論文 参考訳(メタデータ) (2025-05-26T07:00:04Z) - Compressing 3D Gaussian Splatting by Noise-Substituted Vector Quantization [14.71160140310766]
3D Gaussian Splatting (3DGS) は3次元再構成において顕著な効果を示し, 実時間放射場レンダリングによる高品質な結果を得た。
単一のシーンを再構築するには、通常、59の浮動小数点パラメータで表現された数百万のガウススプラットが必要で、約1GBのメモリが生成される。
具体的には、ノイズ置換ベクトル量子化手法を用いて、コードブックとモデルの特徴を共同でトレーニングし、降下勾配最適化とパラメータ離散化の整合性を確保する。
論文 参考訳(メタデータ) (2025-04-03T22:19:34Z) - HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading [79.38548165722229]
HEADINFERはKVキャッシュをCPURAMにオフロードするが、GPU上のトランスフォーマー層のKVキャッシュを完全に保存する必要はない。
HEADINFERはメモリフットプリントを大幅に削減し,計算効率を向上することを示した。
論文 参考訳(メタデータ) (2025-02-18T06:26:05Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。