論文の概要: Preconditioned Attention: Enhancing Efficiency in Transformers
- arxiv url: http://arxiv.org/abs/2603.27153v1
- Date: Sat, 28 Mar 2026 06:30:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.816578
- Title: Preconditioned Attention: Enhancing Efficiency in Transformers
- Title(参考訳): 事前条件付注意:トランスフォーマーの効率を高める
- Authors: Hemanth Saratchandran,
- Abstract要約: 我々は,各注意頭に条件行列を組み込む新しいアプローチである,事前条件付注意を導入する。
理論的解析により,本手法は注意行列の条件数を大幅に減少させることが示された。
各種変圧器応用に適用したプレコンディショニングの有効性を検証した。
- 参考スコア(独自算出の注目度): 8.138855360808657
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Central to the success of Transformers is the attention block, which effectively models global dependencies among input tokens associated to a dataset. However, we theoretically demonstrate that standard attention mechanisms in transformers often produce ill-conditioned matrices with large condition numbers. This ill-conditioning is a well-known obstacle for gradient-based optimizers, leading to inefficient training. To address this issue, we introduce preconditioned attention, a novel approach that incorporates a conditioning matrix into each attention head. Our theoretical analysis shows that this method significantly reduces the condition number of attention matrices, resulting in better-conditioned matrices that improve optimization. Conditioned attention serves as a simple drop-in replacement for a wide variety of attention mechanisms in the literature. We validate the effectiveness of preconditioned attention across a diverse set of transformer applications, including image classification, object detection, instance segmentation, long sequence modeling and language modeling.
- Abstract(参考訳): Transformersの成功の中心は、データセットに関連する入力トークン間のグローバル依存関係を効果的にモデル化する、アテンションブロックである。
しかし, 変圧器の標準的な注意機構は, 条件数が大きい不条件行列をしばしば生成することを示した。
この条件付けは勾配に基づくオプティマイザにとってよく知られた障害であり、非効率なトレーニングに繋がる。
この問題に対処するために,各アテンションヘッドに条件行列を組み込んだ新しいアプローチである事前条件付アテンションを導入する。
理論的解析により,本手法は注目行列の条件数を大幅に削減し,最適化を向上する良条件行列が得られた。
条件付き注意は、文学における様々な注意機構の簡易的な代替手段として機能する。
画像分類,オブジェクト検出,インスタンスセグメンテーション,ロングシーケンスモデリング,言語モデリングなど,多種多様なトランスフォーマーアプリケーションに適用した事前条件付きアテンションの有効性を検証する。
関連論文リスト
- Spectral Conditioning of Attention Improves Transformer Performance [32.435722001652174]
本稿では,ジャコビアン条件数を削減するために,各注目層のスペクトル特性を変化させる手法を提案する。
この改良されたヤコビ条件付けが実際に性能の向上につながることを実証的に示す。
我々のアプローチはシンプルで広く適用でき、様々な注意機構のドロップイン代替として容易に統合できる。
論文 参考訳(メタデータ) (2026-03-07T11:52:48Z) - Transformers Learn Faster with Semantic Focus [57.97235825738412]
学習性と一般化の観点からスパース変圧器について検討する。
入力依存のスパースアテンションモデルは、標準アテンションモデルよりも早く収束し、より一般化しているように見える。
論文 参考訳(メタデータ) (2025-06-17T01:19:28Z) - Enhancing Transformers Through Conditioned Embedded Tokens [32.435722001652174]
本研究では,アテンションブロックの条件付けと埋め込みトークン化データの条件付けの直接的な関係を確立する理論的枠組みを開発する。
本研究では,アテンション機構のコンディショニングを改善するために,組込みトークンを体系的に修正するコンディショニングトークンを導入する。
我々の分析は、このアプローチが不調を著しく軽減し、より安定かつ効率的な訓練につながることを示している。
論文 参考訳(メタデータ) (2025-05-19T07:21:53Z) - FAST: Factorizable Attention for Speeding up Transformers [1.3637227185793512]
本稿では,スペーシフィケーションを伴わずに,注目行列の完全な表現を維持する線形スケールアテンション機構を提案する。
その結果、我々の注意機構は堅牢な性能を示し、自己注意が使用される多様なアプリケーションに対して大きな可能性を秘めていることが示唆された。
論文 参考訳(メタデータ) (2024-02-12T18:59:39Z) - Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation [51.14107156747967]
弱教師付きセマンティックセマンティックセマンティクス(WSSS)は、完全な教師付きアプローチよりもアノテーションが少ないため、かなりの注目を集めている。
本研究では,非学際的な過密化に対する深い注意を抑えるための適応的再活性化機構 (AReAM) を提案する。
AReAMは既存のWSSS手法と比較してセグメンテーション性能を大幅に改善し、ノイズを低減し、関連するセマンティック領域に焦点を絞る。
論文 参考訳(メタデータ) (2023-05-04T19:11:33Z) - How Much Does Attention Actually Attend? Questioning the Importance of
Attention in Pretrained Transformers [59.57128476584361]
本稿では,入力依存型アテンション行列を一定値に置き換える新しい探索手法PAPAを紹介する。
入力依存の注意を払わずに、全てのモデルが競争性能を達成できることがわかった。
より弱いモデルよりも、我々の手法を適用することでより良い性能のモデルが失われることが示され、入力依存の注意機構の利用がその成功の要因である可能性が示唆された。
論文 参考訳(メタデータ) (2022-11-07T12:37:54Z) - Combiner: Full Attention Transformer with Sparse Computation Cost [142.10203598824964]
計算の複雑さを低く保ちつつ、各注目ヘッドにフルアテンション機能を提供するコンバインダを提案する。
既存のスパース変圧器で使用されるスパースアテンションパターンのほとんどは、そのような分解設計をフルアテンションに刺激することができることを示す。
自己回帰的タスクと双方向シーケンスタスクの両方に関する実験的評価は、このアプローチの有効性を示す。
論文 参考訳(メタデータ) (2021-07-12T22:43:11Z) - Attention that does not Explain Away [54.42960937271612]
Transformerアーキテクチャに基づくモデルは、大規模なタスクに対して競合するアーキテクチャに基づくモデルよりも精度が高い。
Transformerのユニークな特徴は、任意の距離で自由な情報の流れを可能にする自己認識機構の普遍的な応用である。
本稿では,実装が簡単で,"説明的回避"効果を避けるための理論的保証を提供する,二重正規化アテンション方式を提案する。
論文 参考訳(メタデータ) (2020-09-29T21:05:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。