論文の概要: Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling
- arxiv url: http://arxiv.org/abs/2609.08981v2
- Date: Fri, 11 Sep 2026 00:07:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.453564
- Title: Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling
- Title(参考訳): インコンテキストサンプリング器としてのトランスフォーマー:クローズドフォーム拡散から推定自由サンプリングへ
- Abstract要約: 凍結変圧器はコンテキスト内サンプルから反復的なサンプルをシミュレートできることを示す。
まず, クローズドフォームおよびスムーズなクローズドフォーム拡散サンプリングが実現可能であることを示す。
そして、変換器がエネルギーベースのサンプリング器を近似し、同じU字形エネルギーを層全体に構築できることを証明した。
- 参考スコア(独自算出の注目度): 20.11728693585654
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A growing body of work establishes that large language models are not mere statistical memorizers, but are capable of in-context learning: performing inference at test time using only examples provided in the prompt, without any parameter updates. Prior theoretical work has shown that this capability extends to supervised learning tasks such as linear regression. We prove that in-context learning extends further to \emph{data generation}: frozen transformers can simulate iterative generative samplers from in-context samples. We first show that transformers can realize closed-form and smoothed closed-form diffusion samplers. The construction identifies a concrete generative role for softmax attention: it computes responsibility weights and weighted empirical averages, while feedforward layers implement Euler updates. To empirically relate these constructions to pretrained language models, we study \emph{semantic-topic sampling}: prompts consisting of words drawn from a common semantic category, such as animals, foods, or cities. Across transformer layers, the normalized hidden states exhibit a two-stage geometry: they move toward a uniform spherical reference in intermediate layers and then return to structured, topic-dependent representations near the output. We further measure an interacting-particle energy on these hidden-state clouds and observe the same U-shape pattern. We then prove that transformers can approximate an energy-based sampler, constructing the same U-shape energy across the layers.
- Abstract(参考訳): 大きな言語モデルは単なる統計的記憶器ではなく、文脈内での学習が可能であることを証明している。
これまでの理論的研究により、この能力は線形回帰のような教師付き学習タスクにまで拡張されていることが示されている。
In-context Learning extends to \emph{data generation}: frozen transformer cansimulated repeaterative generative sampleer from in-context sample。
まず, クローズドフォームおよびスムーズなクローズドフォーム拡散サンプリングが実現可能であることを示す。
この構造は、責任重みと重み付けされた経験的平均を計算し、フィードフォワード層はEuler更新を実装している。
これらの構造を事前訓練された言語モデルに実証的に関連付けるために,動物,食品,都市などの共通意味カテゴリーから抽出された単語からなるプロンプトである「emph{semantic-topic sample}」について検討する。
変圧器層を横切ると、正規化された隠れ状態は2段階の幾何学を示し、中間層における均一な球面参照に向かって移動し、出力の近くで構造化されたトピック依存表現に戻る。
さらに、これらの隠れ状態の雲上で相互作用する粒子エネルギーを測定し、同じU字型パターンを観測する。
そして、変換器がエネルギーベースのサンプリング器を近似し、同じU字形エネルギーを層全体に構築できることを証明した。
関連論文リスト
- Inverting Data Transformations via Diffusion Sampling [33.6473603169954]
一般リー群上の変換反転問題について検討する。
目標は、元のデータ分布にマップする逆変換を復元することだ。
確率論的視点をとり、ボルツマン分布として後方変換をモデル化する。
論文 参考訳(メタデータ) (2026-02-09T04:58:34Z) - QLENS: Towards A Quantum Perspective of Language Transformers [14.34282709638159]
本稿では、Transformer生成プロセスにおける物理に基づく視点開発のための新しい試みであるQLENSを紹介する。
QLENSの下では、Transformerはモデルの出力単位から派生したヒルベルト空間の潜在活性化を状態ベクトルに変換することによって研究される。
モデルの最終確率分布は、特定の測定演算子を用いてボルン則を終状態に適用することにより得られる。
論文 参考訳(メタデータ) (2025-10-13T21:53:05Z) - ExPLAIND: Unifying Model, Data, and Training Attribution to Study Model Behavior [39.590138981646696]
ポストホックの解釈可能性のメソッドは、通常、モデルの振る舞いをそのコンポーネント、データ、または独立した訓練軌跡に関連付ける。
これらの観点をすべて統合した統合フレームワークであるExPLAINDを紹介します。
論文 参考訳(メタデータ) (2025-05-26T14:53:11Z) - Unsupervised Representation Learning from Sparse Transformation Analysis [79.94858534887801]
本稿では,潜在変数のスパース成分への変換を分解し,シーケンスデータから表現を学習することを提案する。
入力データは、まず潜伏活性化の分布として符号化され、その後確率フローモデルを用いて変換される。
論文 参考訳(メタデータ) (2024-10-07T23:53:25Z) - In-Context Learning with Representations: Contextual Generalization of Trained Transformers [66.78052387054593]
In-context Learning (ICL) は、事前訓練された大規模言語モデルの能力を指し、推論中にいくつか例を挙げると、新しいタスクを学習できる。
本稿では,非線形回帰タスクのレンズによる勾配降下による変圧器のトレーニングダイナミクスについて検討する。
論文 参考訳(メタデータ) (2024-08-19T16:47:46Z) - What Secrets Do Your Manifolds Hold? Understanding the Local Geometry of Generative Models [17.273596999339077]
本研究では,学習多様体の局所幾何学とその生成結果との関係について検討する。
筆者らは,与えられた潜伏像対に対して,局所記述子は生成モデルによる生成美学,多様性,記憶の指標であることを示す定量的および定性的な証拠を提供する。
論文 参考訳(メタデータ) (2024-08-15T17:59:06Z) - Probabilistic Transformer: A Probabilistic Dependency Model for
Contextual Word Representation [52.270712965271656]
本稿では,文脈表現の新しいモデルを提案する。
モデルのグラフは変換器に似ており、依存関係と自己意識の対応性がある。
実験により,本モデルが小型・中型データセットのトランスフォーマーと競合することを示す。
論文 参考訳(メタデータ) (2023-11-26T06:56:02Z) - Grokking of Hierarchical Structure in Vanilla Transformers [72.45375959893218]
トランスフォーマー言語モデルでは,極端に長い訓練期間を経て階層的に一般化できることが示される。
中間深度モデルは、非常に深い変圧器と非常に浅い変圧器の両方よりも良く一般化される。
論文 参考訳(メタデータ) (2023-05-30T04:34:13Z) - Inverse Dynamics Pretraining Learns Good Representations for Multitask
Imitation [66.86987509942607]
このようなパラダイムを模倣学習でどのように行うべきかを評価する。
本稿では,事前学習コーパスがマルチタスクのデモンストレーションから成り立つ環境について考察する。
逆動力学モデリングはこの設定に適していると主張する。
論文 参考訳(メタデータ) (2023-05-26T14:40:46Z) - DIFFormer: Scalable (Graph) Transformers Induced by Energy Constrained
Diffusion [66.21290235237808]
本稿では,データセットからのインスタンスのバッチを進化状態にエンコードするエネルギー制約拡散モデルを提案する。
任意のインスタンス対間の対拡散強度に対する閉形式最適推定を示唆する厳密な理論を提供する。
各種タスクにおいて優れた性能を有する汎用エンコーダバックボーンとして,本モデルの適用性を示す実験を行った。
論文 参考訳(メタデータ) (2023-01-23T15:18:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。