論文の概要: QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides
- arxiv url: http://arxiv.org/abs/2607.15810v1
- Date: Fri, 17 Jul 2026 10:21:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.818558
- Title: QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides
- Title(参考訳): QUADS: デュアルサイドでのQUantization-errorアライメントによるMoEのためのNVFP4強化学習の安定化
- Abstract要約: ロールアウト生成は、Mixture-of-Experts(MoE)大規模言語モデルのための強化学習において、大きなボトルネックとなる。
そこで本稿では,NVFP4 RL の安定化を図るため,QUantization-error Alignment across Dual Sides (QUADS)を提案する。
QUIDSはBF16レベルの精度を実現し、NVFP4 RLよりも平均パス@1を21.49ポイント改善し、FP8よりも16%高いロールアウトスループットを提供する。
- 参考スコア(独自算出の注目度): 26.939321070753607
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Rollout generation is a major bottleneck in Reinforcement Learning (RL) for Mixture-of-Experts (MoE) Large Language Models, motivating low-precision rollout acceleration such as FP8. As an emerging low-precision format, NVFP4 combines fine-grained scaling for accuracy preservation with native W4A4 FP4 GEMMs for higher throughput than FP8. However, we find that directly applying NVFP4 to MoE RL rollout is impractical. NVFP4 rollout with BF16 training collapses after roughly 150 steps, accompanied by rapidly growing rollout-trainer log-probability gaps. Through training-inference error analysis and controlled ablations, we identify activation error, rather than weight error, as the dominant source of FP4 RL instability: weights can be synchronized and aligned by a shared quantization-dequantization path, whereas activations are recomputed online and error is amplified by the coarse E2M1 grid. Therefore, to stabilize NVFP4 RL for MoE, we propose QUantization-error Alignment across Dual Sides (QUADS). On the trainer side, we introduce Asymmetric Quantization-Aware Training fake-quantizing weights while keeping activations unquantized for better alignment. On the rollout side, Residual Activation Compensation corrects high-error activation channels while preserving native W4A4 GEMMs. In our MoE RL experiments on several benchmarks, QUADS achieves BF16-level accuracy, improves average pass@1 by 21.49 points over naive NVFP4 RL, and delivers ~16% higher rollout throughput than FP8.
- Abstract(参考訳): ロールアウト生成は、FP8などの低精度ロールアウトアクセラレーションを動機とする、MoE(Mixture-of-Experts)大規模言語モデルのための強化学習(RL)において、大きなボトルネックとなっている。
新たな低精度フォーマットとして、NVFP4は、FP8よりもスループットの高いネイティブW4A4 FP4 GEMMと精度保存のためのきめ細かいスケーリングを組み合わせている。
しかし,NVFP4をMoE RLロールアウトに直接適用することは不可能である。
NVFP4のロールアウトとBF16のトレーニングはおよそ150ステップ後に崩壊し、ロールアウトトレーナーのログ確率の差は急速に増大した。
FP4 RL不安定性の主原因は, 重みを共有量子化量化経路で同期・整合させることができ, 一方, アクティベーションをオンラインで再計算し, 粗いE2M1グリッドで誤差を増幅することができる。
そこで本研究では,NVFP4 RL を MoE に安定化させるため,両面を横断するQUantization-error Alignment (QUADS) を提案する。
トレーナー側では、アライメントを改善するためにアクティベーションを不適切に保ちながら、非対称量子化対応訓練を行う。
ロールアウト側では、Residual Activation CompensationはネイティブのW4A4 GEMMを保持しながらハイエラーアクティベーションチャネルを補正する。
いくつかのベンチマークで行ったMoE RL実験では、QUIDSはBF16レベルの精度を実現し、NVFP4 RLよりも平均パス@1を21.49ポイント改善し、FP8よりも約16%高いロールアウトスループットを提供する。
関連論文リスト
- HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models [9.149747042283197]
本報告では,FP4RLのロールアウトとトレーニングポリシの両方を4ビット精度で動作させる,最初のエンドツーエンドのポストトレーニングについて述べる。
軽量な修正であるRollout-ResQは、ロールアウトの計算フットプリントを膨らませることなく、アウトリア駆動のアンダーフローに損失した精度の大部分を回復する。
論文 参考訳(メタデータ) (2026-07-29T06:28:26Z) - Characterizing the Impact of NVFP4 Quantization for Low-Power Edge AI Deployment [9.460818703756205]
エッジでのエネルギー効率のよいニューラルネットワーク推論では、演算コスト、メモリトラフィック、エネルギ、ストレージオーバーヘッドを削減し、許容できる精度を維持する必要がある。
本稿では,エッジ効率ニューラルネットワークにおけるNVFP4量子化のアブレーションに着目した研究を行う。
論文 参考訳(メタデータ) (2026-06-03T03:09:59Z) - TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization [13.984796236174331]
トレーニング不要なポストトライニング量子化フレームワークとしてTORQ (Two-level Orthogonal Rotation for MXFP4 Quantization)を提案する。
既存の手法と比較して, TORQはMXFP4の活性化量子化の精度を著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-05-19T09:05:47Z) - FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling [38.64059734487925]
強化学習に基づくポストトレーニングは、テキストと画像の拡散モデルと人間の嗜好を整合させるための有望なパラダイムとして現れてきた。
大規模基礎拡散モデル(FLUX.1-12Bなど)のスケールアウトは、計算負荷が大きい。
本稿では,新しいFP4を用いた2段階強化学習フレームワークであるSol-RLを提案する。
論文 参考訳(メタデータ) (2026-04-08T10:14:47Z) - Dissecting Outlier Dynamics in LLM NVFP4 Pretraining [46.10969678564592]
本研究は,NVFP4プレトレーニング中におけるアーキテクチャ内外層力学の経時的解析を行う。
我々は、Softmax Attention (SA) と比較して、Linear Attention (LA) はテンソルあたりの重みを減少させるが、ブロック量子化の下ではブロックレベルのスパイクが持続することを示した。
次に,NVFP4のトレーニングレシピであるCHONを開発し,QK後の操作保護と統合した。
論文 参考訳(メタデータ) (2026-02-02T12:50:27Z) - Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow [48.48936574810267]
本研究は,FP8 RLトレーニングの総合的研究である。
安定かつ堅牢なRL最適化を実現するFP8 RLトレーニングフレームワークであるJet-RLを提案する。
論文 参考訳(メタデータ) (2026-01-20T18:54:31Z) - Pretraining Large Language Models with NVFP4 [53.235038214986865]
我々は,NVFP4フォーマットを用いた大規模言語モデル(LLM)の安定かつ高精度な学習手法を提案する。
本手法は,前方と後方の両方で一貫した表現のための2次元量子化方式を統合する。
以上の結果から,NVFP4をベースとしたプレトレーニング技術を用いてトレーニングしたモデルは,FP8ベースラインに匹敵するトレーニング損失とダウンストリームタスクアキュラシーを達成できることが示唆された。
論文 参考訳(メタデータ) (2025-09-29T17:53:17Z) - Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization [77.67818998672516]
本研究は,MXFP4とNVFP4の学習後量子化に関する総合的研究である。
本稿では,従来のGPTQ量子化アルゴリズムの変種であるMicro-Rotated-GPTQ(MR-GPTQ)を紹介する。
MR-GPTQは最先端の精度で一致または性能が向上することを示す。
論文 参考訳(メタデータ) (2025-09-27T09:22:21Z) - Towards Fully FP8 GEMM LLM Training at Scale [77.97607456493257]
既存のアプローチは、しばしば最適化されたFP8カーネルに依存するか、より高精度な行列乗算に回帰する。
本稿では, トランスブロック内のすべてのGEMMに対して, 前方および後方の両方でFP8計算をサポートする新しいLLMアーキテクチャを提案する。
これにより、特に大規模では、標準的なBF16トレーニングのダウンストリームパフォーマンスにマッチしながら、前例のないスループット向上が可能になる。
論文 参考訳(メタデータ) (2025-05-26T21:04:14Z) - Optimizing Large Language Model Training Using FP4 Quantization [73.55459961002371]
量子化トレーニングは、低ビット演算によるコスト削減を可能にすることで、有望なソリューションを提供する。
この研究は、大規模言語モデル(LLM)のための最初のFP4トレーニングフレームワークを紹介します。
論文 参考訳(メタデータ) (2025-01-28T18:04:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。