論文の概要: Training-Free Universal Approximation by Prompting Random Transformers
- arxiv url: http://arxiv.org/abs/2608.09558v1
- Date: Mon, 10 Aug 2026 12:57:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.277643
- Title: Training-Free Universal Approximation by Prompting Random Transformers
- Title(参考訳): ランダム変換器のプロンプティングによる学習自由なユニバーサル近似
- Abstract要約: ランダムで訓練されていない重みを持つソフトマックスアテンションネットワークは、適切なソフトプロンプトで操るとき、コンパクト多様体上の任意のハルダー関数を近似することができることを示す。
さらに、構築されたソフトプロンプトトークンのノルム、プロンプト長さ、隠された次元のトレードオフを明らかにすることで、プロンプトのコストを定量化する。
- 参考スコア(独自算出の注目度): 48.556633593447465
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: How expressive is prompting a transformer? Answering this question is important for separating the roles of prompting, architecture, and pretraining in transformer models, and for determining whether task-specific behavior must be stored in model weights or can instead be induced at inference time through the prompt. We show, in an approximation-theoretic sense, that pretraining is optional: a single-layer softmax attention network with random, untrained weights can approximate any Hölder function on a compact manifold when steered by an appropriate soft prompt. Guided by the connection between softmax attention and kernel methods, we construct explicit soft prompts (a prompt per target function, independent of the query) as solutions to linear systems matching attention logits to Gaussian kernel exponents, under which the frozen transformer emulates the classical Nadaraya-Watson kernel estimator. The construction requires only a mild rank condition on the weights, which we show holds almost surely under Gaussian initialization. The prompted network inherits the theoretical guarantees of kernel regression, leading to universal approximation theorems with minimax-optimal rates that depend on the intrinsic dimension. We further quantify the cost of prompting, exposing a tradeoff between the norm of the constructed soft prompt tokens, prompt length, and hidden dimension. Numerical experiments corroborate the constructions and predicted rates.
- Abstract(参考訳): 変圧器はどれくらい表現力が高いか。
この疑問に答えることは、トランスフォーマーモデルにおけるプロンプト、アーキテクチャ、事前訓練の役割を分離し、タスク固有の振る舞いをモデルウェイトに格納するか、代わりにプロンプトを通じて推論時に誘導するかを決定するために重要である。
ランダムで訓練されていない重みを持つ単層ソフトマックスアテンションネットワークは、適切なソフトプロンプトによって操られたとき、コンパクト多様体上の任意のヘルダー関数を近似することができる。
ソフトマックスアテンションとカーネルメソッドの接続により、ガウスのカーネル指数に注目ロジットに一致する線形システムの解として、明示的なソフトプロンプト(ターゲット関数毎のプロンプト、クエリに依存しない)を構築し、凍結したトランスフォーマーが古典的なナダラヤ・ワトソンカーネル推定器をエミュレートする。
この構成はウェイトに対して緩やかなランク条件しか必要とせず、ガウスの初期化の下でほぼ確実に成り立つことを示す。
誘導されたネットワークは、カーネル回帰の理論的な保証を継承し、内在次元に依存する極小最大速度の普遍近似定理を導いた。
さらに、構築されたソフトプロンプトトークンのノルム、プロンプト長さ、隠された次元のトレードオフを明らかにすることで、プロンプトのコストを定量化する。
数値実験は建設と予測率を相関させる。
関連論文リスト
- A Compositional Theory of Causally Masked Transformers [50.88598486616582]
モデルが実装した力学から直接表現性を導出する形式化を開発する。
各アテンションヘッドは、レイヤ内で独立して自身の状態を更新する。
修正されたソフトアテンションは、不可逆なチェックリストのような状態をサポートする。
論文 参考訳(メタデータ) (2026-07-29T14:47:19Z) - LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel [27.87296519831803]
ソフトマックスアテンションの二次的複雑さは、トランスフォーマーを高解像度の視覚タスクにスケーリングする上で大きな障害となる。
ソフトマックスの代わりにラプラシアンカーネルを用いるトランスフォーマー変種であるラプラシアンフォーマーを提案する。
ImageNetの実験では、LaplacianFormerは高いパフォーマンスと効率のトレードオフを実現し、注意力を高めている。
論文 参考訳(メタデータ) (2026-04-22T09:04:54Z) - From Shortcut to Induction Head: How Data Diversity Shapes Algorithm Selection in Transformers [67.02076505996284]
本研究では, 事前学習したデータ分布の選択が, 浅層変圧器を一方の行動に向ける方法について検討する。
その結果,事前学習したトランスフォーマーのアルゴリズム的バイアスに光を当て,学習行動のデータ駆動制御に関する概念的ガイドラインを提供することができた。
論文 参考訳(メタデータ) (2025-12-21T08:10:26Z) - Theoretical Foundations of Prompt Engineering: From Heuristics to Expressivity [0.0]
本研究では,トランスフォーマーのバックボーンをエグゼキュータとして固定し,プロンプトのみを変化させることで得られる機能群について検討する。
一つの固定されたバックボーンがプロンプトだけで対象の行動の幅広いクラスを近似できることを示す。
論文 参考訳(メタデータ) (2025-12-14T13:42:20Z) - Scalable Gaussian Processes with Low-Rank Deep Kernel Decomposition [7.532273334759435]
カーネルはガウス過程(GP)モデルにおいて、事前の信念とデータ構造を符号化する鍵である。
ディープカーネル学習は、標準的なパラメトリック形式を適用する前に、ニューラルネットワークを介して入力を入力することで、カーネルの柔軟性を向上させる。
我々は、ニューラルネットワークが直接低ランクカーネルを表現する、完全にデータ駆動でスケーラブルなディープカーネル表現を導入する。
論文 参考訳(メタデータ) (2025-05-24T05:42:11Z) - Prompting a Pretrained Transformer Can Be a Universal Approximator [105.59562522323274]
従来考えられていたよりもはるかに小さな事前学習モデルでは,プレフィックスの場合には普遍近似が可能であることを示す。
また、関数を所望の精度に近似するのに必要なプレフィックスの長さにジャクソン型境界を与える。
論文 参考訳(メタデータ) (2024-02-22T18:12:48Z) - Universality and Limitations of Prompt Tuning [65.8354898840308]
トランスフォーマーアーキテクチャにおけるソフトプロンプトチューニングの役割を理解するための最初のステップの1つを取り上げる。
連続値関数に対する有限深度事前学習型変圧器を用いて、普遍性と制限のレンズからの即時チューニングを解析する。
この結果は、リプシッツ関数の集合における任意の列列列関数を近似するプロンプトを持つ強変換器の存在を保証する。
論文 参考訳(メタデータ) (2023-05-30T06:47:07Z) - Statistically Meaningful Approximation: a Case Study on Approximating
Turing Machines with Transformers [50.85524803885483]
本研究は,統計的学習性を示すために近似ネットワークを必要とする統計有意(SM)近似の形式的定義を提案する。
回路とチューリングマシンの2つの機能クラスに対するSM近似について検討する。
論文 参考訳(メタデータ) (2021-07-28T04:28:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。