Fugu-MT 論文翻訳(概要): Higher Order Linear Transformer

論文の概要: Higher Order Linear Transformer

arxiv url: http://arxiv.org/abs/2010.14816v1
Date: Wed, 28 Oct 2020 08:48:23 GMT
ステータス: 翻訳完了
システム内更新日: 2022-10-02 05:47:56.358429
Title: Higher Order Linear Transformer
Title（参考訳）: 高次線形変圧器
Authors: Jean Mercat
Abstract要約: 注意機構の線形複雑性を生成するトリックを再使用し、ソフトマックス正規化の2階近似に拡張する。注意機構の線形複雑性を生成するトリックを再使用し、ソフトマックス正規化の2階近似に拡張する。
参考スコア（独自算出の注目度）: 0.7832189413179361
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Following up on the linear transformer part of the article from Katharopoulos et al., that takes this idea from Shen et al., the trick that produces a linear complexity for the attention mechanism is re-used and extended to a second-order approximation of the softmax normalization.
Abstract（参考訳）: Katharopoulosらによる記事の線形変圧器部分について、Shenらからこのアイデアを引用し、注意機構の線形複雑性を生み出すトリックを再使用し、ソフトマックス正規化の2階近似まで拡張する。

関連論文リスト

Entropic Mirror Descent for Linear Systems: Polyak's Stepsize and Implicit Bias [55.72269695392027]
本稿では,線形系を解くためにエントロピックミラー降下を適用することに焦点を当てる。収束解析の主な課題は、領域の非有界性に起因する。制限的な仮定を課さずにこれを克服するために、Polyak型階段の変種を導入する。
論文参考訳（メタデータ） (2025-05-05T12:33:18Z)
In-Context Learning of Linear Dynamical Systems with Transformers: Error Bounds and Depth-Separation [16.748746646611412]
本稿では,雑音の線形力学系群を表す変圧器の文脈内学習能力の近似論的側面について検討する。最初の理論的結果は、タスク間で一様に定義された$L2$-testing損失に対して、多層変圧器の近似誤差の上限を確立する。 2つ目の結果は、単層線形変圧器のクラスに対する近似誤差の非最小化下界を確立することである。
論文参考訳（メタデータ） (2025-02-12T05:40:11Z)
Increasing transformer token length with a Maximum Entropy Principle Method [0.0]
トランスフォーマーは、処理されたシーケンスの長さに対する二次的依存の計算オーバーヘッドに悩まされる。本稿では, 変圧器の自己回帰長を延ばすトレーニングと推論/生成の中間段階を付加する3つの手法を提案する。
論文参考訳（メタデータ） (2024-08-17T15:47:39Z)
Parallelizing Linear Transformers with the Delta Rule over Sequence Length [49.88826673324244]
この研究は、デルタ則で線形変圧器を訓練するためのハードウェア効率の良いアルゴリズムについて述べる。我々は100Bトークンに対して1.3Bモデルをトレーニングし、最近の線形時間ベースラインよりも優れていることを発見した。
論文参考訳（メタデータ） (2024-06-10T17:24:42Z)
Your Transformer is Secretly Linear [7.935853865895353]
連続層間の埋め込み変換を解析し, ほぼ完全な線形関係を明らかにする。変換器の最も線形なブロックのいくつかを除去あるいは線形に近似することは、損失やモデル性能に大きな影響を与えないことを示す。より小さなモデルに対する事前学習実験では, 層状リニアリティの低減を目的としたコサイン類似性に基づく正則化を導入する。
論文参考訳（メタデータ） (2024-05-19T22:44:00Z)
Linear Transformers are Versatile In-Context Learners [19.988368693379087]
線形変圧器の各層が負の線形回帰問題に対する重みベクトルを維持していることを示す。また、異なるレベルのノイズでトレーニングデータが破損する難易度シナリオにおける線形変圧器の使用についても検討する。ここでは,線形変圧器が複雑かつ高効率な最適化アルゴリズムを発見することを実証する。
論文参考訳（メタデータ） (2024-02-21T23:45:57Z)
Investigating Recurrent Transformers with Dynamic Halt [64.862738244735]
本研究では, 変圧器の繰り返し機構を付加する2つの主要な手法の帰納バイアスについて検討する。提案手法を拡張・結合する新しい手法を提案し,検討する。
論文参考訳（メタデータ） (2024-02-01T19:47:31Z)
On the Convergence of Encoder-only Shallow Transformers [62.639819460956176]
エンコーダのみの浅部変圧器のグローバル収束理論を現実的な条件下で構築する。我々の結果は、現代のトランスフォーマー、特にトレーニング力学の理解を深める道を開くことができる。
論文参考訳（メタデータ） (2023-11-02T20:03:05Z)
Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文参考訳（メタデータ） (2023-10-20T12:45:12Z)
Tangent Transformers for Composition, Privacy and Removal [58.280295030852194]
TAFT(Tangent Attention Fine-Tuning)は、線形変換器の微調整方法である。 TAFT(Tangent Attention Fine-Tuning)は、線形変換器の微調整方法である。
論文参考訳（メタデータ） (2023-07-16T18:31:25Z)
Approximation Rate of the Transformer Architecture for Sequence Modeling [18.166959969957315]
非線型関係のクラスを考察し、トランスフォーマーのジャクソン型近似率推定を明示するために、複雑性尺度の新たな概念を同定する。この速度はトランスフォーマーの構造特性を明らかにし、それが近似に最も適しているシーケンシャルな関係のタイプを示唆する。
論文参考訳（メタデータ） (2023-05-29T10:56:36Z)
Dual-Flattening Transformers through Decomposed Row and Column Queries for Semantic Segmentation [50.321277476317974]
本稿では,高解像度出力を実現するためにDual-Flattening Transformer (DFlatFormer)を提案する。 ADE20KおよびCityscapesデータセットの実験は、提案された2重平坦トランスアーキテクチャの優位性を実証している。
論文参考訳（メタデータ） (2022-01-22T22:38:15Z)
Asymptotic Singular Value Distribution of Linear Convolutional Layers [19.471693124432022]
畳み込みニューラルネットワークでは、線形畳み込みを伴う畳み込み層の線形変換は2倍のToeplitzブロックを持つブロック行列である。円形近似の精度を向上した単純な特異値近似法を開発した。また,スペクトルノルム上限上限はResNetの一般化性能向上に有効なスペクトル正規化器であることを示す。
論文参考訳（メタデータ） (2020-06-12T12:21:08Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。