論文の概要: Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition
- arxiv url: http://arxiv.org/abs/2604.18128v1
- Date: Mon, 20 Apr 2026 11:47:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.84054
- Title: Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition
- Title(参考訳): Depth Registers W4A4 on SwiGLU: A Reader/Generator Decomposition
- Abstract要約: 我々は,FineWeb-Eduの5Bトークンで学習したSwiGLUデコーダのみの言語モデルにおけるW4A4量子化の訓練後について検討した。
W4A4は、FP16 23.6から1727までの検証難易度を崩壊させる。
DR+sinkをデプロイメント提案ではなく,トレーニングタイムのプローブとして提示する。
- 参考スコア(独自算出の注目度): 2.6382975801439836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study post-training W4A4 quantization in a controlled 300M-parameter SwiGLU decoder-only language model trained on 5B tokens of FineWeb-Edu, and ask which input-activation sites dominate the error. Naive round-to-nearest W4A4 collapses validation perplexity from FP16 23.6 to 1727. A simple residual-axis training-time intervention -- Depth Registers with a register-magnitude hinge loss (DR+sink) -- reduces this to 119 (about 14x) at matched FP16 PPL and matched zero-shot capacity, and composes with SmoothQuant to 39.9 PPL. The residual ~2 PPL gap to FP16 is the diagnostic core. We decompose W4A4 damage by input-activation site: the five trainable linears in a SwiGLU block split into residual-axis readers (qkv, w1, w3) and block-internal generators (o_proj, w2). Elementary norm arguments show residual-axis magnitude control bounds readers tightly but leaves w2's bilinear input bounded only by the trivial product of factor bounds; empirically, DR+sink collapses reader kurtosis while leaving generators essentially unchanged, and the reader-rescued W4A4 residue is flat at ~0.28 nats across three matched checkpoints with Delta-remove(w2) dominating. We present DR+sink as a training-time probe rather than a deployment proposal: a post-hoc alternative (Per-Linear QuaRot) nearly matches it on the reader axis. Full QuaRot -- adding online per-head value Hadamard plus online w2-input rotation -- does not close the gap either, directly testing the prediction that orthogonal rotation cannot bound the bilinear SwiGLU tail. Claims are specific to our 300M, 5B-token, single-seed setting, and our experiments do not isolate the partition from the hinge.
- Abstract(参考訳): 我々は,FineWeb-Eduの5Bトークンで訓練された300MパラメータSwiGLUデコーダのみの言語モデルにおいて,W4A4量子化を後処理し,どの入力活性化サイトがエラーを支配しているかを問う。
W4A4は、FP16 23.6から1727までの検証難易度を崩壊させる。
単純な残差軸トレーニング時間介入 -- レジスタ・マグニチュード・ヒンジロス(DR+シンク)を持つ深さレジスターは、一致するFP16 PPLで119(約14倍)に減らし、ゼロショット容量と一致し、SmoothQuantで39.9 PPLに構成する。
FP16の残りの2PPLギャップは診断コアである。
SwiGLUブロック内の5つのトレーニング可能な線形は、残留軸リーダ(qkv, w1, w3)とブロック内部ジェネレータ(o_proj, w2)に分割される。
基本ノルムの議論では、残留軸大きさの制御は読者を厳しく拘束するが、w2 の双線型入力は因子境界の自明な積によってのみ束縛され、DR+シンクは生成元をそのまま残しながら読み手クルトーシスを崩壊させ、読み手救済された W4A4 残基は、Delta-remove(w2) が支配する3つのマッチしたチェックポイントで ~0.28 Nats で平坦である。
我々は、DR+sinkをデプロイ提案ではなく、トレーニングタイムプローブとして提示する: ポストホックな代替(Per-Linear QuaRot)は、リーダー軸にほぼ一致する。
フルクアロット -- ヘッド当たりのオンライン値にアダマールとオンラインw2インプットローテーションを追加する -- もギャップを埋めておらず、直交回転が双線形SwiGLUテールにバインドできないという予測を直接テストしている。
クレームは300M, 5B-token, single-seed set に特化しており、我々の実験では分断をヒンジから分離していない。
関連論文リスト
- VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention [47.30761996669105]
トレーニング不要な低ビットアテンションフレームワークであるVC-Attentionを提案する。
V-Smoothは、オンラインの軽量クラスタリングによってバリュートークンを再注文するので、融合ハードウェアブロック内のトークンは、共に量子化される。
ログドメインのスコアを直接E4M3確率符号に1つの融合乗算加算でマッピングし、FP32指数関数とフォーマット変換を排除した。
論文 参考訳(メタデータ) (2026-09-14T16:17:35Z) - Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM [0.0]
ミニマ: NVFP4 W4A4は、GDNを含む496のリニア層である。
NVFP4の16要素ブロックのスケーリングが残ストリームの極端な外れ値の局所化の原因を説明する4つのメカニズムの研究がある。
ハイブリッド LLM の繰り返し半分が量子化し易い理由に関する力学的な説明。
論文 参考訳(メタデータ) (2026-09-03T17:04:26Z) - HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models [9.149747042283197]
本報告では,FP4RLのロールアウトとトレーニングポリシの両方を4ビット精度で動作させる,最初のエンドツーエンドのポストトレーニングについて述べる。
軽量な修正であるRollout-ResQは、ロールアウトの計算フットプリントを膨らませることなく、アウトリア駆動のアンダーフローに損失した精度の大部分を回復する。
論文 参考訳(メタデータ) (2026-07-29T06:28:26Z) - QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides [26.939321070753607]
ロールアウト生成は、Mixture-of-Experts(MoE)大規模言語モデルのための強化学習において、大きなボトルネックとなる。
そこで本稿では,NVFP4 RL の安定化を図るため,QUantization-error Alignment across Dual Sides (QUADS)を提案する。
QUIDSはBF16レベルの精度を実現し、NVFP4 RLよりも平均パス@1を21.49ポイント改善し、FP8よりも16%高いロールアウトスループットを提供する。
論文 参考訳(メタデータ) (2026-07-17T10:21:27Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization [0.0]
重みのみの極低ビット量子化に対する共役理論論文の影響を応用する。
BBTspectralはWikitext-2の難易度をW2A16のバニラオートラウンドと比較して58%削減することを示した。
論文 参考訳(メタデータ) (2026-05-24T18:05:37Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization [47.19478866645546]
そこで我々は,DuQuantをMXFP4フォーマットに適応させるDuQuant++を提案する。
MXFP4 W4A4量子化の下でのLLaMA-3ファミリーの実験は、DuQuant++が一貫して最先端のパフォーマンスを実現していることを示している。
論文 参考訳(メタデータ) (2026-04-20T04:27:28Z) - When Flat Minima Fail: Characterizing INT4 Quantization Collapse After FP32 Convergence [0.0]
後学習量子化は、よく収束したモデルが量子化対応モデルであると仮定する。
この仮定は構造化され、測定可能で、以前は達成できなかった方法で失敗することを示す。
論文 参考訳(メタデータ) (2026-04-16T15:46:36Z) - Auxiliary Finite-Difference Residual-Gradient Regularization for PINNs [0.0]
本研究では,PDE残差が保たれるハイブリッド設計について検討するが,有限差分は弱い補助項にのみ現れる。
FD項は、PDE残基自体を置き換えることなく残留体を正則化する。
種子0-5と100kのエポック全体で、最も信頼性の高い試験はクルコウタス・ベタ政権下での固定殻重量5e-4である。
論文 参考訳(メタデータ) (2026-04-15T23:09:19Z) - Dissecting Outlier Dynamics in LLM NVFP4 Pretraining [46.10969678564592]
本研究は,NVFP4プレトレーニング中におけるアーキテクチャ内外層力学の経時的解析を行う。
我々は、Softmax Attention (SA) と比較して、Linear Attention (LA) はテンソルあたりの重みを減少させるが、ブロック量子化の下ではブロックレベルのスパイクが持続することを示した。
次に,NVFP4のトレーニングレシピであるCHONを開発し,QK後の操作保護と統合した。
論文 参考訳(メタデータ) (2026-02-02T12:50:27Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z) - SpinQuant: LLM quantization with learned rotations [49.07335692298487]
重み、アクティベーション、KVキャッシュに適用された後トレーニング量子化(PTQ)技術は、大規模言語モデル(LLM)のメモリ使用量、レイテンシ、消費電力を大幅に削減する。
我々は、量子化精度を高めつつ、完全精度のトランスフォーマーアーキテクチャにおいて同一の出力をもたらす、適用可能な回転パラメータ化の集合を同定する。
本研究では,学習した回転行列を最適な量子化ネットワーク精度に組み込む新しい手法であるSpinQuantを提案する。
論文 参考訳(メタデータ) (2024-05-26T02:15:49Z) - QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs [72.26197676852958]
ローテーションに基づく新しい量子化方式であるQuaRotを紹介する。
QuaRotは、すべての重み、アクティベーション、KVキャッシュを含むエンドツーエンドを4ビットで量子化する。
我々の4ビット量子化LLaMa2-70Bモデルは、少なくとも0.47 WikiText-2パープレキシティが失われ、ゼロショット性能の99%を維持している。
論文 参考訳(メタデータ) (2024-03-30T19:20:06Z) - Calibration of Drive Non-Linearity for Arbitrary-Angle Single-Qubit
Gates Using Error Amplification [43.97138136532209]
キュービットドライブラインコンポーネントの非線形性は、単一キュービットゲートの忠実性に制限を与える。
我々は、コヒーレンス制限エラーが2~4ドル、リークが6~5ドル以下の任意の角度のシングルキュービットゲートを実証する。
論文 参考訳(メタデータ) (2022-12-02T10:34:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。