論文の概要: Universal interpolation for deep residual self-attention networks
- arxiv url: http://arxiv.org/abs/2610.01981v1
- Date: Thu, 01 Oct 2026 16:25:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.279765
- Title: Universal interpolation for deep residual self-attention networks
- Title(参考訳): 深部自己注意ネットワークに対する普遍的補間
- Abstract要約: この研究では、深い自己意識モデルに焦点を当て、代わりに二重の体制を考える。
予め定義された有限個のパラメータの集合を見つけることができ、それぞれが注意ブロックを定義することができるかどうかを問う。
また、因果マスクによる規制を特徴付け、対応する普遍的保証を確立する。
- 参考スコア(独自算出の注目度): 31.311590172673494
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Universal approximation is a necessary qualitative property of learning architectures to benefit from scaling laws. While it is generically verified on a variety of neural architectures and random feature models, it typically involves infinite width limits. In this work, we focus on deep self-attention models and consider instead the `dual' regime, where approximation power is enabled entirely by depth, and featuring strong parameter sharing across layers, motivated by recent models such as the Looped Transformers. More specifically, we ask whether one can find a predefined finite set of parameters, each defining an attention block, such that the resulting finite set of transformations can map any collection of $N$ sequences of $n$ tokens to any other collection of $N$ sequences of $n$ tokens. Crucially, these transformations are \emph{fixed independently of the input and output} collections: only the order in which the blocks are applied, their signs, and their durations depend on the particular interpolation task. Our main result establishes it for residual softmax attention using only two frozen single-head blocks with Gaussian-initialized projection matrices. The result holds at both continuous and finite depth. We also characterize the restrictions imposed by causal masking and establish corresponding universal interpolation guarantees.
- Abstract(参考訳): 普遍近似は、法則のスケーリングの恩恵を受けるために、学習アーキテクチャの質的な性質である。
様々なニューラルアーキテクチャやランダムな特徴モデルで汎用的に検証されているが、通常は無限の幅制限を伴う。
本研究では,深層自己注意モデルに着目し,その代わりに近似パワーを全深度で実現し,Looped Transformerなどの最近のモデルによって動機付けられた,層間での強力なパラメータ共有を特徴とする「デュアル」レジームを考察する。
より具体的には、それぞれ注意ブロックを定義し、結果として生じる有限集合の変換が、$N$トークンの任意のコレクションを$n$トークンの任意のコレクションに$n$トークンの任意のコレクションをマッピングできるように、事前に定義された有限集合を見つけることができるかどうかを問う。
重要なことに、これらの変換は入力と出力のコレクションとは独立に \emph{fixed であり、ブロックが適用される順序、それらの記号、およびそれらの持続時間は特定の補間タスクに依存する。
我々の主な成果は、ガウス初期化射影行列を持つ2つの凍った単頭ブロックのみを用いて、残差ソフトマックスアテンションを確立することである。
結果は連続深さと有限深さの両方で成り立つ。
また、因果マスクによる制限を特徴付け、対応する普遍的補間保証を確立する。
関連論文リスト
- SQUARE: Structured Quantum Representation Adapters as Compact Quadratic Feature Maps for Frozen Language Models [50.300302932452006]
凍結言語モデル(LM)は、下流の再ランク付け、スコアリング、嗜好モデリングのための固定された特徴抽出器として、ますます使われている。
本稿では、ボトルネックベクトルを振幅符号化し、パラメータ化量子回路を適用し、その結果の状態を測定する構造量子表現アダプタを提案する。
各基底確率関数は、ちょうどボトルネック座標における正規化された二次形式であり、追加のPauli$Z$読み出しはそれらの確率の線形結合であることを示す。
論文 参考訳(メタデータ) (2026-09-29T09:38:29Z) - Universality and Generalization of Causal Transformers Across Context Lengths [29.587685183870775]
固定された正規化水平線をサンプリングする任意の長さの列に対して因果トークン・ツー・トケンマップを均一に近似できるかを検討した。
分解能間の連続性の概念は、長さに依存しないパラメータを持つ単一変圧器により、コンパクトな入力クラスに一様近似を許容する因果族を特徴づける。
物理時系列の実験は、データセット依存の適応指数を持つ観測スケールでのHlder-regularトークンモデルをサポートし、テキスト入力の埋め込みは対照的なケースを提供する。
論文 参考訳(メタデータ) (2026-09-28T12:50:27Z) - A Compositional Theory of Causally Masked Transformers [50.88598486616582]
モデルが実装した力学から直接表現性を導出する形式化を開発する。
各アテンションヘッドは、レイヤ内で独立して自身の状態を更新する。
修正されたソフトアテンションは、不可逆なチェックリストのような状態をサポートする。
論文 参考訳(メタデータ) (2026-07-29T14:47:19Z) - Exact Sequence Interpolation with Transformers [0.0]
変換器は, 有限入力列のデータセットを$mathbbRd$, $dgeq 2$で正確に補間できることを示す。
具体的には、$mathbbRd$の任意の長さの$N$シーケンスと$m1, dots, mN in MathcalN$の出力シーケンスを与えられた場合、$mathcalO(sum_j=1N mj)$ブロックと$で変換器を構築する。
論文 参考訳(メタデータ) (2025-02-04T12:31:00Z) - Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers [54.20763128054692]
我々は,2層変換器が$n$-gramのマルコフ連鎖データ上でICLを実行するためにどのように訓練されているかを検討する。
クロスエントロピー ICL 損失に対する勾配流が極限モデルに収束することを証明する。
論文 参考訳(メタデータ) (2024-09-09T18:10:26Z) - Universal Representation of Permutation-Invariant Functions on Vectors
and Tensors [11.345796608258434]
我々の研究の主な対象は、様々な大きさの入力に対する多元関数、すなわち置換不変関数である。
citezaheer 2017deepによって提案されたDeep Setsは、和分解可能なモデルを通じてスカラー上の連続的多重集合関数の指数表現を提供する。
普遍表現は連続かつ不連続な多重集合函数に対して保証されるが、潜在空間次元は$O(ND)$である。
論文 参考訳(メタデータ) (2023-10-20T22:00:59Z) - Shuffled Autoregression For Motion Interpolation [53.61556200049156]
この作業は、モーションタスクのためのディープラーニングソリューションを提供することを目的としている。
本稿では,自己回帰を任意の(シャッフルされた)順序で生成するために拡張する,emphShuffled AutoRegressionと呼ばれる新しいフレームワークを提案する。
また,3つのステージを終端から終端の時空間運動変換器に組み込んだ依存グラフの構築手法を提案する。
論文 参考訳(メタデータ) (2023-06-10T07:14:59Z) - Generalization Bounds for Stochastic Gradient Descent via Localized
$\varepsilon$-Covers [16.618918548497223]
本稿では,SGDの軌道に局在する新しい被覆手法を提案する。
このローカライゼーションは、境界数によって測定されるアルゴリズム固有のクラスタリングを提供する。
これらの結果は様々な文脈で導き出され、既知の最先端のラベルレートが向上する。
論文 参考訳(メタデータ) (2022-09-19T12:11:07Z) - Combiner: Full Attention Transformer with Sparse Computation Cost [142.10203598824964]
計算の複雑さを低く保ちつつ、各注目ヘッドにフルアテンション機能を提供するコンバインダを提案する。
既存のスパース変圧器で使用されるスパースアテンションパターンのほとんどは、そのような分解設計をフルアテンションに刺激することができることを示す。
自己回帰的タスクと双方向シーケンスタスクの両方に関する実験的評価は、このアプローチの有効性を示す。
論文 参考訳(メタデータ) (2021-07-12T22:43:11Z) - $O(n)$ Connections are Expressive Enough: Universal Approximability of
Sparse Transformers [71.31712741938837]
注意層ごとに$O(n)$接続しか持たないスパース変換器は、$n2$接続を持つ高密度モデルと同じ関数クラスを近似できることを示す。
また、標準NLPタスクにおいて、異なるパターン・レベルの違いを比較検討する。
論文 参考訳(メタデータ) (2020-06-08T18:30:12Z) - Non-Euclidean Universal Approximation [4.18804572788063]
ニューラルネットワークの入力層と出力層の修正は、多くの場合、最も実践的な学習タスクの特異性を満たすために必要である。
アーキテクチャの連続関数をコンパクトな上で一様に近似する能力を保った特徴写像と読み出し写像を記述した一般的な条件を示す。
論文 参考訳(メタデータ) (2020-06-03T15:38:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。