論文の概要: The Quantization Benefits of Residual-Free Transformers
- arxiv url: http://arxiv.org/abs/2605.25880v1
- Date: Mon, 25 May 2026 14:06:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:20.247568
- Title: The Quantization Benefits of Residual-Free Transformers
- Title(参考訳): 残留自由変換器の量子化効果
- Abstract要約: 残差接続は、訓練中に変圧器の活性化をガウス性から遠ざけることを示す。
言語タスクでは、完全な性能の低下は少ないが、これらのモデルはガウス近傍の活性化を保持し、低ビット量子化に対するロバスト性を大幅に向上させる。
- 参考スコア(独自算出の注目度): 32.749359970205695
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-scale transformer training and deployment are increasingly constrained by the transfer of activations, gradients, and optimizer states across accelerators. Low-bit quantization offers a natural remedy, but transformer activations are often heavy-tailed and outlier-dominated, making simple quantization highly lossy. We show that this difficulty is not only a property of the quantizer, but also of the architecture. Specifically, residual connections can drive transformer activations away from Gaussianity during training. Using controlled comparisons between residual and residual-free transformers, we demonstrate that this effect leads to substantially higher quantization error and accuracy degradation at low precision in residual models. We explain the phenomenon through an excess kurtosis analysis, showing that residual mixing can amplify non-Gaussianity, whereas dense mixing in residual-free contracts non-Gaussianity. We then show that residual-free transformers can be made trainable using orthogonal initialization, spectral or second-order optimization, and depth-aware scaling of attention temperature. In language tasks, while there is a small drop in full precision performance, these models retain near-Gaussian activations and exhibit significantly improved robustness to low-bit quantization. Our results identify an accuracy--compressibility trade-off in transformer design and motivate architecture-level approaches to quantization-friendly foundation models.
- Abstract(参考訳): 大規模トランスフォーマーのトレーニングと展開は、アクティベーション、勾配、加速器間のオプティマイザ状態の移動によってますます制限される。
低ビット量子化は自然に緩和するが、トランスフォーマーの活性化はしばしば重尾と外縁が支配的であり、単純な量子化は極めて損失が大きい。
この困難さは、量子化器の特性だけでなく、アーキテクチャの性質でもあることを示す。
具体的には、残留接続は、トレーニング中に変圧器の活性化をガウス性から遠ざけることができる。
残差のない変圧器と残差のない変圧器の制御比較により、この効果が残差モデルの低精度での量子化誤差と精度劣化を著しく向上させることを示した。
この現象を過剰なカルトシス解析により説明し, 残留混合が非ガウス性を増幅するのに対し, 非ガウス性は高密度混合であることを示した。
次に, 直交初期化, スペクトルおよび2次最適化, 及び注意温度の深さ対応スケーリングを用いて, 残差のない変圧器を訓練可能であることを示す。
言語タスクでは、完全な性能の低下は少ないが、これらのモデルはガウス近傍の活性化を保持し、低ビット量子化に対するロバスト性を大幅に向上させる。
以上の結果から, 変圧器設計における精度-圧縮性トレードオフを特定し, 量子化フレンドリな基礎モデルへのアーキテクチャレベルのアプローチを動機づけた。
関連論文リスト
- Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory [77.27772368491698]
Muonのようなスペクトルは、最近、大規模な言語モデルトレーニングにおいて、強い経験的パフォーマンスを示している。
我々はこの問題を線形連想記憶問題を通して研究する。
また,Muonの貯蔵能力はSGDよりも有意に高いことがわかった。
論文 参考訳(メタデータ) (2026-03-27T16:13:18Z) - QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification [67.15451442018258]
拡散変換器は素晴らしいビデオ生成能力を示すが、その計算とメモリの禁止コストは実際の展開を妨げる。
モデル量子化とアテンションスパシフィケーションは圧縮に有望な2つの方向であるが、それぞれがアグレッシブ圧縮の下で深刻な性能劣化を被っている。
モデル量子化と注意散布を統合した統合フレームワークである textbfQuantSparse を提案する。
論文 参考訳(メタデータ) (2025-09-28T06:49:44Z) - Oscillations Make Neural Networks Robust to Quantization [0.16385815610837165]
量子化アウェアトレーニング(QAT)における振動は,STE(Straight-Through Estimator)によって引き起こされる望ましくない人工物であることを示す。
量子化を改善するために振動を誘導する新しい正則化法を提案する。
論文 参考訳(メタデータ) (2025-02-01T16:39:58Z) - DopQ-ViT: Towards Distribution-Friendly and Outlier-Aware Post-Training Quantization for Vision Transformers [31.791935689364866]
視覚変換器(ViT)のためのDopQ-ViTを提案する。
第一に、DopQ-ViTはTan Quantizer (TanQ)を導入している。
第2に、DopQ-ViT は MAD-Guided Optimal Scaling Factor (MOSF) を提示する。
論文 参考訳(メタデータ) (2024-08-06T16:40:04Z) - Learning on Transformers is Provable Low-Rank and Sparse: A One-layer Analysis [63.66763657191476]
低ランク計算としての効率的な数値学習と推論アルゴリズムはトランスフォーマーに基づく適応学習に優れた性能を持つことを示す。
我々は、等級モデルが適応性を改善しながら一般化にどのように影響するかを分析する。
適切なマグニチュードベースのテストは,テストパフォーマンスに多少依存している,と結論付けています。
論文 参考訳(メタデータ) (2024-06-24T23:00:58Z) - RepQuant: Towards Accurate Post-Training Quantization of Large
Transformer Models via Scale Reparameterization [8.827794405944637]
ポストトレーニング量子化(PTQ)は、大きなトランスモデルを圧縮するための有望な解である。
既存のPTQメソッドは、通常、非自明な性能損失を示す。
本稿では、量子化推論デカップリングパラダイムを備えた新しいPTQフレームワークRepQuantを提案する。
論文 参考訳(メタデータ) (2024-02-08T12:35:41Z) - Teacher Intervention: Improving Convergence of Quantization Aware
Training for Ultra-Low Precision Transformers [17.445202457319517]
量子化対応トレーニング(QAT)は、実装コストとエネルギー消費を減らすための有望な方法である。
本研究は,超高精度事前学習型変圧器の高速収束QATのための,TI(Teacher Intervention)と呼ばれる能動的知識蒸留法を提案する。
論文 参考訳(メタデータ) (2023-02-23T06:48:24Z) - HEAT: Hardware-Efficient Automatic Tensor Decomposition for Transformer
Compression [69.36555801766762]
本稿では,分解可能な指数空間を効率的に探索できるハードウェア対応テンソル分解フレームワークHEATを提案する。
ハードウェア対応のBERT変異体は, エネルギー遅延を5.7倍に低減し, 精度が1.1%以下であることを示す。
論文 参考訳(メタデータ) (2022-11-30T05:31:45Z) - NoisyQuant: Noisy Bias-Enhanced Post-Training Activation Quantization
for Vision Transformers [53.85087932591237]
NoisyQuantは、視覚変換器のトレーニング後のアクティベーション量子化性能に対する量子化器に依存しない拡張である。
理論的な洞察に基づいて、NoisyQuantは重い尾の活性化分布を積極的に変化させる最初の成功を達成している。
NoisyQuantは、最小の計算オーバーヘッドで視覚変換器のトレーニング後の量子化性能を大幅に改善する。
論文 参考訳(メタデータ) (2022-11-29T10:02:09Z) - Understanding and Overcoming the Challenges of Efficient Transformer
Quantization [17.05322956052278]
トランスフォーマーベースのアーキテクチャは、幅広い自然言語処理タスクのデファクト標準モデルとなっている。
しかしながら、メモリフットプリントと高いレイテンシは、リソース制限されたデバイスへの効率的なデプロイメントと推論を禁止している。
変換器にはユニークな量子化の課題があり、すなわち、低ビットの固定点フォーマットで表すのが難しいハイダイナミックなアクティベーション範囲があることが示される。
論文 参考訳(メタデータ) (2021-09-27T10:57:18Z) - Post-Training Quantization for Vision Transformer [85.57953732941101]
本稿では,視覚変換器のメモリ記憶量と計算コストを削減するための学習後量子化アルゴリズムを提案する。
約8ビット量子化を用いて、ImageNetデータセット上でDeiT-Bモデルを用いて81.29%のトップ-1の精度を得ることができる。
論文 参考訳(メタデータ) (2021-06-27T06:27:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。