論文の概要: Higher Order Linear Transformer
- arxiv url: http://arxiv.org/abs/2010.14816v1
- Date: Wed, 28 Oct 2020 08:48:23 GMT
- ステータス: 処理完了
- システム内更新日: 2022-10-02 05:47:56.358429
- Title: Higher Order Linear Transformer
- Title(参考訳): 高次線形変圧器
- Authors: Jean Mercat
- Abstract要約: 注意機構の線形複雑性を生成するトリックを再使用し、ソフトマックス正規化の2階近似に拡張する。
注意機構の線形複雑性を生成するトリックを再使用し、ソフトマックス正規化の2階近似に拡張する。
- 参考スコア(独自算出の注目度): 0.7832189413179361
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Following up on the linear transformer part of the article from Katharopoulos
et al., that takes this idea from Shen et al., the trick that produces a linear
complexity for the attention mechanism is re-used and extended to a
second-order approximation of the softmax normalization.
- Abstract(参考訳): Katharopoulosらによる記事の線形変圧器部分について、Shenらからこのアイデアを引用し、注意機構の線形複雑性を生み出すトリックを再使用し、ソフトマックス正規化の2階近似まで拡張する。
関連論文リスト
- Linear Transformers are Versatile In-Context Learners [21.444440482020994]
任意の線形変圧器が暗黙の線形モデルを維持していることを証明し、事前条件付き勾配勾配の変種として解釈できる。
また、異なるレベルのノイズでトレーニングデータが破損する難易度シナリオにおける線形変圧器の使用についても検討する。
論文 参考訳(メタデータ) (2024-02-21T23:45:57Z) - Recurrent Transformers with Dynamic Halt [76.62673276574668]
本研究では, 変圧器の繰り返し機構を付加する2つの主要な手法の帰納バイアスについて検討する。
本稿では,これらの手法を拡張し,組み合わせるための新しい手法を提案し,検討する。
論文 参考訳(メタデータ) (2024-02-01T19:47:31Z) - On the Convergence of Encoder-only Shallow Transformers [62.639819460956176]
エンコーダのみの浅部変圧器のグローバル収束理論を現実的な条件下で構築する。
我々の結果は、現代のトランスフォーマー、特にトレーニング力学の理解を深める道を開くことができる。
論文 参考訳(メタデータ) (2023-11-02T20:03:05Z) - Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。
最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文 参考訳(メタデータ) (2023-10-20T12:45:12Z) - Tangent Transformers for Composition, Privacy and Removal [74.86340153047534]
本稿では,一階展開計算により得られる線形変換器の微調整手法であるTangent Attention Fine-Tuning(TAFT)を紹介する。
線形化から生じるヤコビアン・テイラー積は、1つの前方通過で効率的に計算できることを示す。
下流の様々な視覚的分類タスクに適用すると、TAFTで微調整されたTangent Transformerは、元の非線形ネットワークを微調整して可逆的に動作できることが示される。
論文 参考訳(メタデータ) (2023-07-16T18:31:25Z) - Approximation Rate of the Transformer Architecture for Sequence Modeling [21.461856598336464]
非線型関係のクラスを考察し、トランスフォーマーのジャクソン型近似率推定を明示するために、複雑性尺度の新たな概念を同定する。
この速度はトランスフォーマーの構造特性を明らかにし、それが近似に最も適しているシーケンシャルな関係のタイプを示唆する。
論文 参考訳(メタデータ) (2023-05-29T10:56:36Z) - Momentum Transformer: Closing the Performance Gap Between Self-attention
and Its Linearization [31.28396970291575]
効率の良い変圧器は、変圧器の二次的な複雑さを減らすために提案されているが、精度は著しく低下している。
まず、勾配降下ステップとして注目マップの計算における線形注意と残差接続を解釈する。
次に、これらの成分に運動量を導入し、線形メモリと計算複雑性を維持しつつ、線形変圧器の精度を向上させるために運動量を利用するエンファンモーメント変換器を提案する。
論文 参考訳(メタデータ) (2022-08-01T02:37:49Z) - Dual-Flattening Transformers through Decomposed Row and Column Queries
for Semantic Segmentation [50.321277476317974]
本稿では,高解像度出力を実現するためにDual-Flattening Transformer (DFlatFormer)を提案する。
ADE20KおよびCityscapesデータセットの実験は、提案された2重平坦トランスアーキテクチャの優位性を実証している。
論文 参考訳(メタデータ) (2022-01-22T22:38:15Z) - Asymptotic Singular Value Distribution of Linear Convolutional Layers [19.471693124432022]
畳み込みニューラルネットワークでは、線形畳み込みを伴う畳み込み層の線形変換は2倍のToeplitzブロックを持つブロック行列である。
円形近似の精度を向上した単純な特異値近似法を開発した。
また,スペクトルノルム上限上限はResNetの一般化性能向上に有効なスペクトル正規化器であることを示す。
論文 参考訳(メタデータ) (2020-06-12T12:21:08Z) - The Convolution Exponential and Generalized Sylvester Flows [82.18442368078804]
本稿では,線形変換の指数関数を取り入れ,線形フローを構築する新しい手法を提案する。
重要な洞察として、指数関数は暗黙的に計算できるため、畳み込み層を使用することができる。
畳み込み指数はCIFAR10上の生成フローにおいて他の線形変換よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-06-02T19:43:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。