論文の概要: Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended
- arxiv url: http://arxiv.org/abs/2605.30728v1
- Date: Fri, 29 May 2026 01:45:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.331115
- Title: Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended
- Title(参考訳): MLのロスレス圧縮によるGPUメモリブートネックの削減 -- 拡張
- Abstract要約: Invariant Bit Packing (IBP)は、機械学習(ML)のデータ転送時間を最小化する新しい圧縮アルゴリズムである。
IBPはテンソルのグループ間で不変ビットを特定し、排除し、GPU最適化圧縮によるスループットを向上させる。
IBPは、平均してGNNトレーニングが74%、DLRM組み込みルックアップが180%、LCM推論が24%高速化されている。
- 参考スコア(独自算出の注目度): 6.884805649204022
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine learning (ML) training and inference often process data sets far exceeding GPU memory capacity, forcing them to rely on PCIe for on-demand tensor transfers, causing critical transfer bottlenecks. Lossy compression has been proposed to relieve bottlenecks but introduces workload-dependent accuracy loss, making it complex or even prohibitive to use in existing ML deployments. We explore lossless compression as an alternative that avoids this deployment complexity. We identify where lossless compression can be integrated into ML pipelines while minimizing interference with GPU execution. Based on our findings, we introduce Invariant Bit Packing (IBP), a novel lossless compression algorithm designed to minimize data transfer time for ML. IBP identifies and eliminates invariant bits across groups of tensors, improving throughput through GPU-optimized decompression that leverages warp parallelism, low-overhead bit operations, and asynchronous PCIe transfers. We provide easy-to-use APIs, showcasing them by adding IBP support to GNN training, as well as DLRM and LLM inference frameworks. IBP achieves, on average, 74% faster GNN training, 180% faster DLRM embedding lookup, and 24% faster LLM inference.
- Abstract(参考訳): 機械学習(ML)トレーニングと推論は、しばしばGPUメモリ容量を超えるデータセットを処理し、オンデマンドのテンソル転送にPCIeを頼らざるを得なくなり、重要な転送ボトルネックを引き起こす。
ボトルネックを軽減するためにLossy圧縮が提案されているが、ワークロード依存の精度損失が発生しており、既存のMLデプロイメントでの使用が複雑または禁止されている。
このデプロイメントの複雑さを回避する代替手段として、ロスレス圧縮を検討します。
ロスレス圧縮をMLパイプラインに統合できる場所を特定し、GPU実行による干渉を最小限にする。
Invariant Bit Packing (IBP) は、MLのデータ転送時間を最小化するために設計された新しいロスレス圧縮アルゴリズムである。
IBPはテンソルのグループ間で不変ビットを特定し、排除し、ワープ並列性、低オーバヘッドビット演算、非同期PCIe転送を活用するGPU最適化圧縮によるスループットを向上させる。
DLRMやLLM推論フレームワークと同様に、GNNトレーニングにIPBサポートを追加することで、使い勝手の良いAPIを提供しています。
IBPは、平均してGNNトレーニングが74%、DLRM組み込みルックアップが180%、LCM推論が24%高速化されている。
関連論文リスト
- LLM Inference in a Flash! [66.43896490006965]
大規模言語モデル(LLM)は、さまざまな自然言語処理タスクで印象的な機能を示している。
我々は、高価な浮動小数点演算をなくすために、エンドツーエンドの整数のみの量子化手法を提案する。
論文 参考訳(メタデータ) (2026-09-14T18:04:30Z) - Communication-Efficient LLM Adaptation over Decentralized GPU Meshes [48.95736135870457]
本稿では,事前学習後適応のための非同期2回路システムを提案する。
高速圧縮トレーニング回路は、パイプライン並列転送と圧縮データ並列同期のためのマスキングアクティベーションを用いたスループットを駆動する。
マスクは,この方法で固定された場合,高い圧縮速度でプレトレーニング後の適応を支援する。
論文 参考訳(メタデータ) (2026-09-13T06:56:50Z) - ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression [19.538318240352424]
ロスレスモデル圧縮は、ビットエクササイズ大言語モデル(LLM)サービスにおけるメモリと帯域幅のボトルネックを軽減するために、非常に有望である。
既存のアプローチは、GPUアーキテクチャと基本的な設計ミスマッチのため、かなり推論が遅くなることが多い。
我々は、効率的なLLM推論のために共同設計されたロスレス圧縮フレームワークZipServを提案する。
論文 参考訳(メタデータ) (2026-03-18T07:21:21Z) - FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models [15.244129138320782]
FlashSVDは、SVD圧縮された大規模言語モデルのためのエンドツーエンドのランクアウェアストリーミング推論フレームワークである。
ピークアクティベーションメモリを最大70.2%削減し、中間のトランジェントメモリを75%削減する。
アップストリームエンコード圧縮法では精度の低下は生じず、低ランクLLMのメモリ制約による展開への実践的な経路を提供する。
論文 参考訳(メタデータ) (2025-08-02T22:06:46Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - EoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank Approximation [84.70637613266835]
EoRAは、圧縮されたLarge Language Modelを低ランク行列で拡張する微調整不要な手法である。
EoRAは、圧縮LDMの精度を回復するために、トレーニングなしの低ランク法よりも一貫して優れている。
論文 参考訳(メタデータ) (2024-10-28T17:59:03Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Accelerating Large Language Model Training with Hybrid GPU-based Compression [3.204387803072905]
MPIライブラリはメッセージサイズを大幅に削減し、相互接続帯域幅を活用することが証明されている。
分散大言語モデル(LLM)学習における圧縮支援型MPI集団の有効性について検討した。
論文 参考訳(メタデータ) (2024-09-04T04:05:30Z) - LoCo: Low-Bit Communication Adaptor for Large-scale Model Training [63.040522637816906]
低ビット通信は、しばしば圧縮情報損失によってトレーニング品質が低下する。
本稿では,ローカルGPUノードを補償するLoCo(Lo-bit Communication Adaptor)を提案する。
実験結果から,Megatron-LMやPyTorchs FSDPといった大規模トレーニングモデルフレームワークの移動により,LoCoは圧縮通信効率を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2024-07-05T13:01:36Z) - Accelerating Communication in Deep Learning Recommendation Model Training with Dual-Level Adaptive Lossy Compression [10.233937665979694]
DLRMは最先端のレコメンデーションシステムモデルであり、様々な業界アプリケーションで広く採用されている。
このプロセスの重大なボトルネックは、すべてのデバイスから埋め込みデータを集めるのに必要な全通信に時間を要することだ。
本稿では,通信データサイズを削減し,DLRMトレーニングを高速化するために,エラーバウンドの損失圧縮を利用する手法を提案する。
論文 参考訳(メタデータ) (2024-07-05T05:55:18Z) - FusionAI: Decentralized Training and Deploying LLMs with Massive
Consumer-Level GPUs [57.12856172329322]
我々は、巨大な未使用のコンシューマレベルのGPUをアンロックする分散システムを構想する。
このシステムは、CPUとGPUメモリの制限、ネットワーク帯域幅の低さ、ピアとデバイスの多様性など、重要な課題に直面している。
論文 参考訳(メタデータ) (2023-09-03T13:27:56Z) - Single-path Bit Sharing for Automatic Loss-aware Model Compression [126.98903867768732]
シングルパスビット共有(SBS)は、計算コストを大幅に削減し、有望な性能を達成する。
SBS圧縮MobileNetV2は、Top-1の精度がわずか0.1%低下した22.6倍ビット演算(BOP)を実現する。
論文 参考訳(メタデータ) (2021-01-13T08:28:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。