論文の概要: SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization
- arxiv url: http://arxiv.org/abs/2608.09160v1
- Date: Mon, 10 Aug 2026 06:16:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.101256
- Title: SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization
- Title(参考訳): SwiftQK: クエリキー正規化のための高速かつ通信効率の良いテンソル並列処理
- Authors: Gyudong Kim, Wonjun Han, Young Geun Kim,
- Abstract要約: SwiftQKは、フルベクタAll-Gatherを使用して、標準のTP QK-Normと比較して、QK-Normのレイテンシを81.4--93.9%削減することを示す。
エンドツーエンドのサービスでは、SwiftQKは、All-Gatherベースラインで平均29.5%、最適化されたスカラーアグリゲーション実装で14.3%削減する。
- 参考スコア(独自算出の注目度): 1.9348146993746804
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Query-Key Normalization (QK-Norm) improves the training stability and quality of modern Large Language Models (LLMs). However, under Tensor Parallelism (TP), layerwise QK-Norm introduces additional cross-GPU communication because the normalization factor depends on the full hidden vector. We present SwiftQK, a multi-GPU RMSNorm kernel that exchanges only scalar normalization statistics and overlaps the remaining Peer-to-Peer reduction with independent element-wise computation in a deadlock-safe persistent kernel. Evaluations on recent LLMs show that SwiftQK reduces QK-Norm latency by 81.4--93.9% relative to the standard TP QK-Norm using full-vector All-Gather. In end-to-end serving, SwiftQK reduces TPOT on average by 29.5% over the All-Gather-based baseline and by 14.3% over an optimized scalar-aggregation implementation.
- Abstract(参考訳): クエリキー正規化(QK-Norm)は、現代の大規模言語モデル(LLM)のトレーニング安定性と品質を改善する。
しかし、テンソル並列性(TP)の下では、QK-Normは正規化係数が全隠れベクトルに依存するため、追加のGPU通信を導入する。
我々はマルチGPU RMSNormカーネルであるSwiftQKを紹介し、スカラー正規化統計のみを交換し、残りのPeer-to-Peer還元をデッドロックセーフな永続カーネルにおける独立要素演算と重畳する。
最近のLCMの評価によると、SwiftQKはフルベクターのAll-Gatherを使用して、標準のTP QK-Normと比較して、QK-Normのレイテンシを81.4--93.9%削減している。
エンドツーエンドのサービスでは、SwiftQKは、All-Gatherベースラインで平均29.5%、最適化されたスカラーアグリゲーション実装で14.3%削減する。
関連論文リスト
- QK-Normed MLA: QK normalization without full key caching [65.51862319225098]
QK正規化は、フルキーキャッシュを必要とせずに、MLAモデルの実用的な安定化オプションであることを示す。
最大100Bトークンでトレーニングされた400Mの実行では、QK-Normed MLAはトレーニング損失の低減と、QKクリッピングよりも下流の精度の向上を実現しています。
論文 参考訳(メタデータ) (2026-06-15T07:16:30Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression [4.049313299965171]
この圧縮と加速のギャップによって、我々は測定されたレイテンシーをターゲットとした実用的な順序付きパイプラインを研究した。
我々は、非構造化プルーニング、量子化対応トレーニング(QAT)、知識蒸留(KD)の3つの広く使われている技術を組み合わせている。
すべての設定で、順序付けされたパイプラインは、単一のテクニック単独よりも、より精度の高いレイテンシフロンティアを実現する。
論文 参考訳(メタデータ) (2026-04-05T06:13:47Z) - GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs [3.482440978847644]
BitsAndBytes、AWQ、GPTQなどの量子化技術は、低ビット表現を使用すると精度が低下する。
低ランク補正法はすべてのレイヤを復元し、デコーダブロックにエラー訂正モジュールを挿入する。
本稿では,グループ共有の低ランク近似であるGlowQを提案する。
論文 参考訳(メタデータ) (2026-03-26T12:36:44Z) - Cat: Post-Training Quantization Error Reduction via Cluster-based Affine Transformation [47.791962198275066]
Post-Training Quantization (PTQ)は、フル精度(FP)値を量子化および圧縮データタイプに変換することにより、ディープニューラルネットワークのメモリフットプリントと計算オーバーヘッドを低減する。
PTQはQAT(Quantization-Aware Training)よりもコスト効率が高いが、低ビット量子化条件下での精度劣化に非常に敏感である。
本稿ではクラスタベースのアフィン変換(CAT)を提案する。クラスタ固有のパラメータを用いて,LQ出力をFP出力と整合させる。
論文 参考訳(メタデータ) (2025-09-30T14:00:28Z) - Sub-8-bit quantization for on-device speech recognition: a
regularization-free approach [19.84792318335999]
General Quantizer (GQ) は、自己調整可能なセントロイドを持つ正規化フリーの「ソフトからハード」圧縮機構である。
GQ は RNN-T と Conformer の両方を sub-8-bit に圧縮でき、いくつかの RNN-T 層では高速で正確な推論のために 1-bit に圧縮できる。
論文 参考訳(メタデータ) (2022-10-17T15:42:26Z) - Kernel Quantization for Efficient Network Compression [59.55192551370948]
Kernel Quantization(KQ)は、事前訓練された全精度畳み込みニューラルネットワーク(CNN)モデルを、大幅なパフォーマンス損失のない低精度バージョンに効率的に変換することを目的としている。
重み付けからフィルタプルーニングへの進化に触発され,カーネルレベルと重み付けレベルの両方で定量化することを提案する。
ImageNet分類タスクの実験では、KQはVGGとResNet18でそれぞれ平均1.05ビットと1.62ビットを必要とし、畳み込み層の各パラメータを表す。
論文 参考訳(メタデータ) (2020-03-11T08:00:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。