論文の概要: ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers
- arxiv url: http://arxiv.org/abs/2607.20214v1
- Date: Wed, 22 Jul 2026 14:34:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.11367
- Title: ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers
- Title(参考訳): ELSAA:訓練用変圧器の高効率低ランク・スパース注意近似
- Abstract要約: 本稿では,効率のよい低ランクかつスパースな注目度近似であるemphelSAAを提案する。
スパース分岐は選択された高相似性相互作用をキャプチャし、ローランク分岐は拡散グローバル相互作用を要約する。
これにより、フル2次スコア行列を具体化せずに、低ランクでスパースなアテンション出力を構築するための実践的な枠組みが提供される。
- 参考スコア(独自算出の注目度): 12.266057437036906
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The quadratic $N\times N$ attention score matrix remains a central obstacle to extending Transformers to longer input lengths. Existing efficient attention methods usually reduce this bottleneck by either imposing sparsity, so that each query attends to only a small subset of keys, or by using low-rank/kernel sketches, so that global interactions are compressed into a lower-dimensional representation. We propose \emph{ELSAA}, an efficient low-rank and sparse approximation of attention. Importantly, ELSAA does \emph{not} decompose the learned projection or output matrices of the Transformer into sparse and low-rank factors. Instead, after dense projections produce $Q,K,V$, ELSAA approximates the induced attention score operator itself: a sparse branch captures selected high-similarity interactions, while a low-rank branch summarizes diffuse global interactions. Since the two branches can be normalized over supports with very different denominator mass, ELSAA introduces a denominator-aware fusion term that scales the sparse branch according to its estimated attention mass relative to the low-rank branch. This gives a practical framework for constructing low-rank and sparse attention outputs without materializing the full quadratic score matrix, aiming to enable longer-context training while preserving both sharp token-level interactions and broad contextual mixing.
- Abstract(参考訳): 二次的な$N\times N$ attention score matrixは、Transformerを長い入力長に拡張する中心的な障害である。
既存の効率的なアテンション手法は、通常、このボトルネックを軽減するために、各クエリがキーの小さなサブセットにのみ出席するようにし、ローランク/カーネルのスケッチを使用することで、グローバルな相互作用を低次元の表現に圧縮する。
本稿では,注目度を効率よく近似し,低ランクかつスパースに近似した「emph{ELSAA}」を提案する。
重要なのは、ESSAAは、学習したトランスフォーマーの射影または出力行列をスパースおよびローランクの要素に分解する。
代わりに、高密度射影が$Q,K,V$を生成すると、ESSAAは誘導されたアテンションスコア演算子自体を近似し、スパース分岐は選択された高相似性相互作用をキャプチャし、ローランク分岐は拡散したグローバル相互作用を要約する。
2つの枝は、非常に異なる分母質量を持つ支持体で正規化できるため、ESSAAは、低ランクの枝に対して推定される注意質量に応じてスパース枝をスケールする分母対応融合項を導入する。
これにより、2次スコア行列を具体化せずに低ランクおよびスパースアテンション出力を構築するための実践的なフレームワークが提供され、鋭いトークンレベル相互作用と広いコンテキスト混合を保ちながら、より長いコンテキストトレーニングを可能にする。
関連論文リスト
- Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers [36.26426380985327]
Diffusion Transformers (DiTs) は、視覚生成における技術の状態を設定しているが、その二次的な自己注意コストは、長いトークンシーケンスへのスケーリングを制限している。
最近のTop-Kスパースアテンションアプローチは、トークンをブロックワイズ表現に圧縮することで、DiTの計算を減らす。
極長トークン列に対するトレーニング可能なスパースアテンション機構であるログ線形スパースアテンション(LLSA)を導入する。
論文 参考訳(メタデータ) (2025-12-18T14:53:12Z) - Sparse Attention Post-Training for Mechanistic Interpretability [55.030850996535776]
本稿では,トランスフォーマーの注意を犠牲にすることなく,簡易なポストトレーニング手法を提案する。
制約された余剰目的の下でフレキシブルな空間規則化を適用することで、1Bパラメータまでのモデルで、初期トレーニング損失を抑えつつ、注意接続性を$approx 0.3 %に抑えることができることを示す。
論文 参考訳(メタデータ) (2025-12-05T16:40:08Z) - Nexus: Higher-Order Attention Mechanisms in Transformers [82.07756094886552]
トランスフォーマーは、依存関係をキャプチャするための自己アテンションに依存して、さまざまなドメインで大きな成功を収めています。
本稿では,再帰フレームワークによる表現力向上を目的とした新しいアーキテクチャであるNexusを提案する。
我々は,本手法が標準注意の線形ボトルネックを突破することを示す理論的解析を行った。
論文 参考訳(メタデータ) (2025-12-03T02:25:38Z) - OmniSAT: Compact Action Token, Faster Auto Regression [70.70037017501357]
我々は、コンパクトで転送可能なアクション表現を学ぶOmni Swift Action Tokenizerを紹介する。
その結果、離散トークン化はトレーニングシーケンスを6.8$times$に短縮し、ターゲットエントロピーを低下させる。
論文 参考訳(メタデータ) (2025-10-08T03:55:24Z) - ToMA: Token Merge with Attention for Diffusion Models [8.079656935981193]
拡散モデルは高忠実度画像生成において優れるが、トランスフォーマーの二次的注意複雑さによる拡張性に限界がある。
本稿では,GPU整列効率のトークン削減を否定する市販のToMA(Token Merge with Attention)を提案する。
ToMAはSDXL/Flux生成遅延を24%/23%削減する(DINO $Delta 0.07$)。
論文 参考訳(メタデータ) (2025-09-13T17:35:00Z) - SEA: Sparse Linear Attention with Estimated Attention Mask [51.22399593954608]
長い連続性は、注意操作の二次的な複雑さのために問題を引き起こす。
従来の研究は、注意行列をスパース化または線形に近似することで複雑さを低下させることを目的としていた。
推定アテンションマスクを用いたSparse linear attentionを提案する。
論文 参考訳(メタデータ) (2023-10-03T03:56:26Z) - Diffuser: Efficient Transformers with Multi-hop Attention Diffusion for
Long Sequences [16.066338004414092]
textitDiffuserはシーケンシャル・ツー・シーケンス・モデリングのための新しい効率的なトランスフォーマーである。
低い計算とメモリコストを維持しながら、すべてのトークンインタラクションを1つの注意層に組み込む。
スペクトルの観点からグラフ展開特性を解析することにより、全アテンションを近似する能力を示す。
論文 参考訳(メタデータ) (2022-10-21T08:13:34Z) - CloudAttention: Efficient Multi-Scale Attention Scheme For 3D Point
Cloud Learning [81.85951026033787]
この作業にトランスフォーマーをセットし、それらを形状分類と部分およびシーンセグメンテーションのための階層的なフレームワークに組み込む。
また、各イテレーションにおけるサンプリングとグループ化を活用して、効率的でダイナミックなグローバルなクロスアテンションを計算します。
提案した階層モデルは,最先端の形状分類を平均精度で達成し,従来のセグメンテーション法と同等の結果を得る。
論文 参考訳(メタデータ) (2022-07-31T21:39:15Z) - Combiner: Full Attention Transformer with Sparse Computation Cost [142.10203598824964]
計算の複雑さを低く保ちつつ、各注目ヘッドにフルアテンション機能を提供するコンバインダを提案する。
既存のスパース変圧器で使用されるスパースアテンションパターンのほとんどは、そのような分解設計をフルアテンションに刺激することができることを示す。
自己回帰的タスクと双方向シーケンスタスクの両方に関する実験的評価は、このアプローチの有効性を示す。
論文 参考訳(メタデータ) (2021-07-12T22:43:11Z) - $O(n)$ Connections are Expressive Enough: Universal Approximability of
Sparse Transformers [71.31712741938837]
注意層ごとに$O(n)$接続しか持たないスパース変換器は、$n2$接続を持つ高密度モデルと同じ関数クラスを近似できることを示す。
また、標準NLPタスクにおいて、異なるパターン・レベルの違いを比較検討する。
論文 参考訳(メタデータ) (2020-06-08T18:30:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。