論文の概要: NS-ATTENTION: Newton-Schulz Transformations of Attention Outputs in Vision Transformers
- arxiv url: http://arxiv.org/abs/2609.27735v2
- Date: Thu, 24 Sep 2026 16:36:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.360296
- Title: NS-ATTENTION: Newton-Schulz Transformations of Attention Outputs in Vision Transformers
- Title(参考訳): NS-ATTENTION:視覚変換器における注意出力のニュートン-シュルツ変換
- Abstract要約: 本稿では,各アテンションヘッドの出力に適用されるパラメータフリー変換であるNewton-Schulz Attention (NS-Attn.)を紹介する。
NS-Attn.は、マッチしたシードのすべての比較において、0.25-0.83ポイントの平均利得で最終エポックの精度を向上する。
- 参考スコア(独自算出の注目度): 12.696836631262826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Newton-Schulz (NS) iteration has recently been used in the Muon optimizer to transform update matrices during the training of large language models. Motivated by its spectral effect, we investigate applying NS directly to Transformer attention representations. We introduce Newton-Schulz Attention (NS-Attn.), a parameter-free transformation applied to the output of each attention head. Each head output is arranged as a feature-by-token matrix and normalized by its Frobenius norm. We then apply a finite NS polynomial step and restore the original norm. The objective is to reduce spectral concentration and increase effective rank before standard head merging and output projection. Across ViT and Swin on CIFAR-10 and CIFAR-100, NS-Attn. improves final-epoch accuracy in all 12 matched-seed comparisons, with mean gains of 0.25--0.83 percentage points. ViT ablations show higher mean accuracy with one iteration than with two. Spectral analysis further shows reduced leading-eigenvalue concentration and increased effective rank. These gains incur additional inference latency.
- Abstract(参考訳): Newton-Schulz (NS) イテレーションは、最近、大規模な言語モデルのトレーニング中に更新行列を変換するために、Muonオプティマイザで使用されている。
スペクトル効果により、トランスフォーマーのアテンション表現にNSを直接適用することを検討する。
本稿では,各アテンションヘッドの出力に適用されるパラメータフリー変換であるNewton-Schulz Attention (NS-Attn.)を紹介する。
各ヘッド出力は特徴量行列として配置され、フロベニウスノルムによって正規化される。
次に、有限NS多項式ステップを適用し、元のノルムを復元する。
本研究の目的は,標準頭頂部マージおよび出力投射前におけるスペクトル濃度の低減と有効ランクの増大である。
Across ViT and Swin on CIFAR-10 and CIFAR-100, NS-Attn.
マッチした12種類の比較で最終エポックの精度が向上し、平均利得は0.25-0.83ポイントである。
ViTアブレーションは2回より1回で平均精度が高かった。
スペクトル分析により、先行固有値濃度が減少し、有効ランクが上昇した。
これにより、追加の推論遅延が発生する。
関連論文リスト
- Spectral Scaling Laws of Muon [0.0]
運動量行列の特異値スペクトルがトレーニング中にどのように振る舞うかを考察する。
77Mから2.8Bパラメータのモデルにおいて、運動量バッファの特異値の量子化を追跡する。
我々の法則は、実践者に対して、重要な方向を直交する最小のNS構成を選択するための、原則化されたレイヤー対応のレシピを提供します。
論文 参考訳(メタデータ) (2026-06-02T11:31:21Z) - Delving into Muon and Beyond: Deep Analysis and Extensions [8.297062899157664]
We study Muon as the p = 0 end of a family of a spectrum transformations of form U boldsymbolp V'。
RMS正規化更新は、最初のモーメント更新よりも安定した最適化をもたらす。
この結果から,Muonはスペクトル正規化の有効な形式として理解されているのがよいが,汎用的に優れた最適化手法ではないことが示唆された。
論文 参考訳(メタデータ) (2026-02-04T15:40:47Z) - Neural Attention: A Novel Mechanism for Enhanced Expressive Power in Transformer Models [0.0]
トランスフォーマーモデルは通常、ドット製品を使用して注意行列を計算する。
本稿では,ドット製品をフィードフォワードネットワークに置き換える手法であるNeural Attentionを提案する。
このアプローチは、行列次元を保ちながら注意行列計算のみを変更する。
論文 参考訳(メタデータ) (2025-02-24T14:39:40Z) - Soft Augmentation for Image Classification [68.71067594724663]
本稿では,変分変換による拡張の一般化とソフト拡張を提案する。
ソフトターゲットは、より攻撃的なデータ拡張を可能にすることを示す。
また,ソフト拡張が自己教師付き分類タスクに一般化されることも示している。
論文 参考訳(メタデータ) (2022-11-09T01:04:06Z) - Softmax-free Linear Transformers [90.83157268265654]
視覚変換器(ViT)は、視覚知覚タスクの最先端を推し進めている。
既存の手法は理論的に欠陥があるか、視覚認識に経験的に効果がないかのいずれかである。
我々はSoftmax-Free Transformers (SOFT) のファミリーを提案する。
論文 参考訳(メタデータ) (2022-07-05T03:08:27Z) - Paraformer: Fast and Accurate Parallel Transformer for
Non-autoregressive End-to-End Speech Recognition [62.83832841523525]
そこで我々はParaformerと呼ばれる高速かつ高精度な並列トランスを提案する。
出力トークンの数を正確に予測し、隠れた変数を抽出する。
10倍以上のスピードアップで、最先端のARトランスフォーマーに匹敵するパフォーマンスを実現することができる。
論文 参考訳(メタデータ) (2022-06-16T17:24:14Z) - GradViT: Gradient Inversion of Vision Transformers [83.54779732309653]
我々は,視力変換器(ViT)の勾配に基づく逆攻撃に対する脆弱性を実証する。
自然に見える画像にランダムノイズを最適化するGradViTという手法を提案する。
元の(隠された)データに対する前例のない高い忠実さと近接性を観察する。
論文 参考訳(メタデータ) (2022-03-22T17:06:07Z) - Tom: Leveraging trend of the observed gradients for faster convergence [0.0]
TomはAdamの新しい変種であり、ニューラルネットワークによって渡される損失の風景の勾配の傾向を考慮に入れている。
Tomは両方の精度でAdagrad、Adadelta、RMSProp、Adamを上回り、より早く収束する。
論文 参考訳(メタデータ) (2021-09-07T20:19:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。