論文の概要: FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
- arxiv url: http://arxiv.org/abs/2605.08314v1
- Date: Fri, 08 May 2026 14:20:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.559138
- Title: FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
- Title(参考訳): FlashSVD v1.5:低ランクトランスフォーマー推論を本当に高速にする
- Authors: Wenhao Wu, Zishan Shao, Kangning Cui, Jinhee Kim, Yixiao Wang, Hancheng Ye, Danyang Zhuo, Yiran Chen,
- Abstract要約: SVD圧縮トランスを実現するための統一型推論ランタイムであるFlashSVD v1.5を提案する。
その結果、実際の低ランク加速には圧縮アルゴリズムのみではなく実行時共設計が必要であることが示唆された。
- 参考スコア(独自算出の注目度): 35.53062324649982
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: SVD-based Low-rank compression reduces transformer parameters and nominal FLOPs, but these savings often translate poorly into real LLM serving speedups. We show that this gap is largely a runtime problem: factorized checkpoints fragment execution paths, and the resulting overhead differs substantially between prefill and autoregressive decode. We present FlashSVD v1.5, a unified inference runtime for serving SVD-compressed transformers. FlashSVD v1.5 maps diverse public SVD compression families to a common factorized representation and combines phase-specific kernels with dense-KV decode, packed MLP execution, and per-layer CUDA-graph replay to reorganize the low-rank serving path into a thin runtime. Across representative decoder-serving settings, FlashSVD v1.5 achieves up to 2.55x decode and 2.39x end-to-end speedup, and it attains 1.48x average decode and 1.44x average end-to-end speedup across multiple popular SVD compression families. These results suggest that practical low-rank acceleration requires runtime co-design, not compression algorithms alone. Our code is available at: https://github.com/Zishan-Shao/FlashSVD.
- Abstract(参考訳): SVDベースの低ランク圧縮はトランスフォーマーパラメータと名目FLOPを低減させるが、これらの節約は実際のLLMサービススピードアップにはあまり変換されないことが多い。
分解されたチェックポイントは、フラグメント実行パスを分解し、結果として生じるオーバーヘッドは、プリフィルと自動回帰デコードの間で大きく異なります。
SVD圧縮トランスを実現するための統一型推論ランタイムであるFlashSVD v1.5を提案する。
FlashSVD v1.5は、様々なパブリックSVD圧縮ファミリを共通の因子化表現にマッピングし、フェーズ固有のカーネルを高密度KVデコード、満載のMLP実行、層ごとのCUDA-graphリプレイと組み合わせて、低ランクのサービスパスを薄いランタイムに再編成する。
FlashSVD v1.5は、代表的デコーダ保存設定全体で最大2.55倍のデコードと2.39倍のエンド・ツー・エンド・スピードアップを実現し、複数のSVD圧縮ファミリで平均1.48倍、平均1.44倍のエンド・ツー・エンド・スピードアップを達成した。
これらの結果から,実際の低ランク加速には圧縮アルゴリズムのみではなく,実行時共設計が必要であることが示唆された。
私たちのコードは、https://github.com/Zishan-Shao/FlashSVD.comで利用可能です。
関連論文リスト
- SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving [4.543073806867322]
SplitZipは、KV-cache転送のためのGPUフレンドリーな圧縮機である。
KV活性化の浮動小数点指数の冗長性を利用する。
実際のBF16アクティベーションテンソルでは、SplitZipは613.3GB/s圧縮スループットと2181.8GB/s圧縮スループットを達成する。
論文 参考訳(メタデータ) (2026-05-03T04:22:51Z) - ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression [19.538318240352424]
ロスレスモデル圧縮は、ビットエクササイズ大言語モデル(LLM)サービスにおけるメモリと帯域幅のボトルネックを軽減するために、非常に有望である。
既存のアプローチは、GPUアーキテクチャと基本的な設計ミスマッチのため、かなり推論が遅くなることが多い。
我々は、効率的なLLM推論のために共同設計されたロスレス圧縮フレームワークZipServを提案する。
論文 参考訳(メタデータ) (2026-03-18T07:21:21Z) - ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization [59.481950697968706]
残留ベクトル量子化(RVQ)に基づくコンパクトなプログレッシブ生成画像圧縮(ProGIC)を提案する。
RVQでは、ベクトル量子化器の列がステージごとに残余を符号化し、それぞれが独自のコードブックを持つ。
これを奥行き分離可能な畳み込みと小さな注意ブロックに基づく軽量なバックボーンと組み合わせることで、GPUとCPUのみのデバイスに実用的なデプロイを可能にします。
論文 参考訳(メタデータ) (2026-03-03T11:47:05Z) - FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models [15.244129138320782]
FlashSVDは、SVD圧縮された大規模言語モデルのためのエンドツーエンドのランクアウェアストリーミング推論フレームワークである。
ピークアクティベーションメモリを最大70.2%削減し、中間のトランジェントメモリを75%削減する。
アップストリームエンコード圧縮法では精度の低下は生じず、低ランクLLMのメモリ制約による展開への実践的な経路を提供する。
論文 参考訳(メタデータ) (2025-08-02T22:06:46Z) - DDT: Decoupled Diffusion Transformer [51.84206763079382]
拡散変換器はノイズの多い入力を符号化し、意味成分を抽出し、同じモジュールで高い周波数をデコードする。
textbfcolorddtDecoupled textbfcolorddtTransformer(textbfcolorddtDDT)
textbfcolorddtTransformer(textbfcolorddtDDT)
textbfcolorddtTransformer(textbfcolorddtDDT)
論文 参考訳(メタデータ) (2025-04-08T07:17:45Z) - RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression [25.190765258589707]
トレーニング不要なKVキャッシュ圧縮戦略であるRocketKVについて述べる。
第1段階では、入力シーケンストークンに対して粗粒永久KVキャッシュ消去を行う。
第2段階では、微粒のトップkスパースアテンションを行うために、ハイブリッドスパースアテンション方式を採用する。
論文 参考訳(メタデータ) (2025-02-19T19:12:46Z) - DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training [85.04885553561164]
Diffusion Transformer (DiTs) は高品質なビデオの生成において顕著な性能を示した。
DiTは処理時間の95%を消費し、特別なコンテキスト並列性を要求する。
本稿では,経験的に観察したダイナミックアテンション空間を利用して,DSVによるビデオDiTトレーニングを高速化する手法を提案する。
論文 参考訳(メタデータ) (2025-02-11T14:39:59Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Efficient Encoder-Decoder Transformer Decoding for Decomposable Tasks [53.550782959908524]
エンコーダ・デコーダモデルのための新しい構成を導入し、構造化された出力と分解可能なタスクの効率を改善する。
提案手法は,インプットを一度エンコードして並列にデコードすることで,トレーニングと推論の効率を向上する。
論文 参考訳(メタデータ) (2024-03-19T19:27:23Z) - AlphaVC: High-Performance and Efficient Learned Video Compression [4.807439168741098]
コンディションIフレームをGoPの第1フレームとして導入し、再構成された品質を安定させ、ビットレートを節約する。
第二に,デコーダの複雑さを増大させることなく相互予測の精度を向上させるために,エンコーダ側の画素間動作予測手法を提案する。
第3に,性能向上だけでなく,エントロピー符号化の実行時間を大幅に削減する確率ベースのエントロピースキップ手法を提案する。
論文 参考訳(メタデータ) (2022-07-29T13:52:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。