論文の概要: HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference
- arxiv url: http://arxiv.org/abs/2607.04302v1
- Date: Sun, 05 Jul 2026 13:39:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.886884
- Title: HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference
- Title(参考訳): HiFA4: LLM推論のためのAscend HIF4 NPU上でのトレーニング不要な4ビットフラッシュアテンション
- Abstract要約: HiFA4 は FlashAttention において 4ビット HIF4 Cube GEMM として QKT と PV の両方を実行する。
Smooth-QK は、RoPE の後、Q と K にキャリブレーション-静的なチャネルごとの等価な再スケーリングを適用する。
P順序付けは、高精度な再構成ではなく、PV GEMMで使用されるのと同じ量子化注目重量P_hatからソフトマックス正規化器を蓄積する。
- 参考スコア(独自算出の注目度): 7.694200642758333
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present HiFA4, a post-training operator-level design that executes both QK^T and PV in FlashAttention as 4-bit HIF4 Cube GEMMs for LLM inference on Ascend NPUs, while maintaining the online softmax state in FP16. To our knowledge, HiFA4 is the first Ascend-HIF4-targeted design of this kind evaluated on standard NLP benchmarks. HiFA4 combines two mechanisms. Smooth-QK applies a calibration-static per-channel equivalent rescaling to Q and K after RoPE, transferring quantization difficulty from K to Q without per-tile online reduction at inference. P-Reordering accumulates the softmax normalizer from the same quantized attention weights P_hat used in the PV GEMM, rather than from a higher-precision reconstruction. We show that this inconsistent formulation introduces a coherent output-scaling error, and validate the effect on a Qwen3-8B Layer-0 MMLU trace, where all 3.6M measured attention tiles exhibit net probability-mass loss with median epsilon_bar = -0.064. P-Reordering also allows the normalizer to be fused into the PV Cube GEMM. Across five LLMs, HiFA4 reduces quantization-induced decision drift. On Qwen3-8B, it recovers 37.5% of the accuracy gap introduced by direct HIF4 quantization, narrows the sample-weighted accuracy loss from 1.12 pp to 0.70 pp, reduces BF16-inconsistent MMLU predictions from 16.3% to 8.2%, and cuts MMLU accuracy regressions by 57% (1071 to 465). On Gemma2-9B, mild smoothing keeps HiFA4 within 0.7 pp of BF16 while reducing MMLU regressions by 27%. On LLaMA3.1-8B, Mistral-7B, and Phi-4B, where Smooth-QK is disabled, P-Reordering with the adopted Q-Mean auxiliary still reduces full-set MMLU regressions by 41-52%. A preliminary instruction-scheduling analysis projects a 35.4% critical-path latency reduction relative to BF16 by fusing the softmax normalizer into the PV Cube GEMM; on-hardware validation is left to future work.
- Abstract(参考訳): 我々は,FP16におけるオンラインソフトマックス状態を維持しつつ,FP16におけるLLM推論のための4ビットHIF4キューブGEMMとして,FlashAttentionでQK^TとPVの両方を実行するポストトレーニング演算子レベルのHiFA4を提案する。
私たちの知る限り、HiFA4は標準NLPベンチマークで評価されたこの種のAscend-HIF4ターゲット設計としては初めてのものです。
HiFA4は2つのメカニズムを結合する。
Smooth-QK は、RoPE の後、Q と K にキャリブレーション-静的なチャネルごとの等価な再スケーリングを適用する。
P順序付けは、高精度な再構成ではなく、PV GEMMで使用されるのと同じ量子化注目重量P_hatからソフトマックス正規化器を蓄積する。
この不整合な定式化は、コヒーレントな出力スケーリング誤差を導入し、Qwen3-8B Layer-0 MMLUトレースへの影響を検証する。
P順序付けはまた、正規化器をPVキューブGEMMに融合させることを可能にする。
5つのLDMにわたって、HiFA4は量子化によって引き起こされる決定のドリフトを減少させる。
Qwen3-8Bでは、直接HIF4量子化による精度ギャップの37.5%を回復し、サンプル重み付き精度損失を1.12ppから0.70ppに縮小し、BF16非一貫性のMMLU予測を16.3%から8.2%に削減し、MMLU精度のレグレッションを57%(1071から465)削減する。
Gemma2-9Bでは、HiFA4はBF16の0.7pp以内で、MMLUレグレッションは27%減少する。
LLaMA3.1-8B、Mistral-7B、Phi-4Bでは、Smooth-QKが無効になっているが、採用されているQ-Mean補助装置とのP-並べ替えは、フルセットのMMLUレグレッションを41-52%減少させる。
予備的な命令スケジューリング分析では、Softmax正規化器をPV Cube GEMMに融合させることにより、BF16と比較して35.4%のクリティカルパス遅延削減を予想している。
関連論文リスト
- HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models [9.149747042283197]
本報告では,FP4RLのロールアウトとトレーニングポリシの両方を4ビット精度で動作させる,最初のエンドツーエンドのポストトレーニングについて述べる。
軽量な修正であるRollout-ResQは、ロールアウトの計算フットプリントを膨らませることなく、アウトリア駆動のアンダーフローに損失した精度の大部分を回復する。
論文 参考訳(メタデータ) (2026-07-29T06:28:26Z) - W4A4 Quantization for Inference on Wan2.2-I2V-A14B [23.122181646076882]
サブチャンジは、HiF4またはMXFP4の数値形式の下で、Wan-AI/Wan2.2-I2V-A14B上の4ビットの重量と4ビットの活性化を目標としている。
LLM量子化の2つの相補的アイデア、スパースアクティベーションアウトリアに対するMixQスタイルの混合精度、およびSmoothQuantスタイルのチャネルごとの平滑化に適応する。
公式のVBench I2V測定値では、私たちのパイプラインはFP16の2-3.5パーセント以内で、ほとんどの品質の軸に留まり、動きの滑らかさを改善しています。
論文 参考訳(メタデータ) (2026-06-28T11:12:52Z) - SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference [4.219937026460372]
SharQは、オンラインスパース-デンス分解による活性化空間とFP4量子化を橋渡しする。
スパースFP4 GEMMはバックボーンを処理し、密度の高いFP4 GEMMはマスク誘起活性化損失とスパースパス量子化誤差の両方を補償する。
論文 参考訳(メタデータ) (2026-06-25T04:19:04Z) - ReQAT: Achieving Full-Precision Reasoning Accuracy with 4-bit Floating-Point Quantization-Aware Training [12.549469252572079]
大規模推論モデル(LRM)は、長いチェーン・オブ・シークレットを通じて強力な問題解決を実現する。
LRMは、完全精度推論とKVキャッシュフットプリントの増大によるコストの高い制約を受ける。
3つのコンポーネントを持つ推論中心のFP4トレーニングフレームワークであるReQATを提案する。
論文 参考訳(メタデータ) (2026-06-14T09:00:06Z) - TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization [13.984796236174331]
トレーニング不要なポストトライニング量子化フレームワークとしてTORQ (Two-level Orthogonal Rotation for MXFP4 Quantization)を提案する。
既存の手法と比較して, TORQはMXFP4の活性化量子化の精度を著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-05-19T09:05:47Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training [73.46600457802693]
本稿では,量子化による損失に対応する新しい手法を提案する。
CAGEは、同様の計算コストで、精度の観点から最先端の手法を大幅に改善する。
LlamaモデルのQAT事前トレーニングでは、CAGEは4ビット(W4A4)で達成された精度と事前のベストメソッドとを一致させる。
論文 参考訳(メタデータ) (2025-10-21T16:33:57Z) - Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization [77.67818998672516]
本研究は,MXFP4とNVFP4の学習後量子化に関する総合的研究である。
本稿では,従来のGPTQ量子化アルゴリズムの変種であるMicro-Rotated-GPTQ(MR-GPTQ)を紹介する。
MR-GPTQは最先端の精度で一致または性能が向上することを示す。
論文 参考訳(メタデータ) (2025-09-27T09:22:21Z) - Optimizing Large Language Model Training Using FP4 Quantization [73.55459961002371]
量子化トレーニングは、低ビット演算によるコスト削減を可能にすることで、有望なソリューションを提供する。
この研究は、大規模言語モデル(LLM)のための最初のFP4トレーニングフレームワークを紹介します。
論文 参考訳(メタデータ) (2025-01-28T18:04:50Z) - QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving [52.31791050376249]
量子化は大規模言語モデル(LLM)の推論を加速させる。
4ビット重み、8ビットアクティベーション、4ビットKVキャッシュを備えたW4A8KV4量子化アルゴリズムQoQを導入する。
QServeは、Llama-3-8BをA100で1.2倍、L40Sで1.4倍、Qwen-721.5BをA100で2.4倍、L40Sで3.5倍、達成可能な最大機能を改善する。
論文 参考訳(メタデータ) (2024-05-07T17:59:30Z) - AffineQuant: Affine Transformation Quantization for Large Language Models [58.45460102764]
ポストトレーニング量子化(PTQ)は、その圧縮効率とトレーニングの文脈における費用対効果により、かなりの関心を集めている。
既存の大規模言語モデル(LLM)のPTQ手法は、事前量子化重みと後量子化重みの間の変換のスケーリングに最適化範囲を制限している。
本稿では,PTQ(AffineQuant)における等価アフィン変換を用いた直接最適化を提唱する。
論文 参考訳(メタデータ) (2024-03-19T08:40:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。