Fugu-MT 論文翻訳(概要): Transformers Learn Latent Mixture Models In-Context via Mirror Descent

論文の概要: Transformers Learn Latent Mixture Models In-Context via Mirror Descent

arxiv url: http://arxiv.org/abs/2604.10848v1
Date: Sun, 12 Apr 2026 22:45:43 GMT
ステータス: 翻訳完了
システム内更新日: 2026-04-14 20:13:16.246454
Title: Transformers Learn Latent Mixture Models In-Context via Mirror Descent
Title（参考訳）: 変圧器は鏡の輝きを通して文脈内における潜時混合モデルを学習する
Authors: Francesco D'Angelo, Nicolas Flammarion,
Abstract要約: シーケンスモデリングでは、過去のトークンがコンテキストとその重要性から因果関係があるかを判断する必要がある。遷移分布の混合に基づくフレームワークを導入し、遅延変数が過去のトークンが次に与える影響を決定する。コンテクストからこれらの重みを学習するために、トランスフォーマーがMirror Descentを実装することを実証する。
参考スコア（独自算出の注目度）: 36.758716760573215
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Sequence modelling requires determining which past tokens are causally relevant from the context and their importance: a process inherent to the attention layers in transformers, yet whose underlying learned mechanisms remain poorly understood. In this work, we formalize the task of estimating token importance as an in-context learning problem by introducing a framework based on Mixture of Transition Distributions, where a latent variable determines the influence of past tokens on the next. The distribution over this latent variable is parameterized by unobserved mixture weights that transformers must learn in-context. We demonstrate that transformers can implement Mirror Descent to learn these weights from the context. Specifically, we give an explicit construction of a three-layer transformer that exactly implements one step of Mirror Descent and prove that the resulting estimator is a first-order approximation of the Bayes-optimal predictor. Corroborating our construction and its learnability via gradient descent, we empirically show that transformers trained from scratch learn solutions consistent with our theory: their predictive distributions, attention patterns, and learned transition matrix closely match the construction, while deeper models achieve performance comparable to multi-step Mirror Descent.
Abstract（参考訳）: シーケンスモデリングでは、過去のトークンがコンテキストとそれらの重要性から因果関係があるかを判断する必要がある: トランスフォーマーの注意層に固有のプロセスだが、その基盤となる学習メカニズムは理解されていないままである。本研究では,遷移分布の混合に基づくフレームワークを導入することにより,トークンの重要度を文脈内学習問題として推定するタスクを定式化する。この潜伏変数上の分布は、トランスフォーマーが文脈内で学ばなければならない未観測混合重みによってパラメータ化される。コンテクストからこれらの重みを学習するために、トランスフォーマーがMirror Descentを実装することを実証する。具体的には、ミラーDescentの一ステップを正確に実装した3層変圧器を明示的に構築し、その結果の推定器がベイズ最適予測器の1次近似であることを証明する。より深いモデルでは複数ステップのミラーDescentに匹敵する性能を達成する一方で、予測分布、注意パターン、学習された遷移行列といった、スクラッチから訓練された学習ソリューションから学習したトランスフォーマーが構造と密接に一致することを実証的に示す。

関連論文リスト

Incremental Learning of Sparse Attention Patterns in Transformers [29.54151079577767]
本稿では,複数の過去の位置からの情報を変換器がどのように統合するかを検討するために,高次マルコフ連鎖タスクを提案する。我々は、頭が最も統計的に支配的なパターンに収束する競争から、異なるパターンを専門とする協調へと、学習力学のシフトを特定する。
論文参考訳（メタデータ） (2026-02-22T12:16:06Z)
Diffusion-Inspired Reconfiguration of Transformers for Uncertainty Calibration [52.017716672255524]
プレトレーニングトランスにおける不確実性校正は、リスクに敏感なアプリケーションへの信頼性の高い展開において重要である。本稿では,各特徴変換ブロックを確率的写像としてモデル化したトランスフォーマの拡散インスピレーションによる再構成を提案する。本手法は既存の不確実性認識変換器と比較してキャリブレーションと予測精度が優れている。
論文参考訳（メタデータ） (2026-02-09T17:24:47Z)
Selective Induction Heads: How Transformers Select Causal Structures In Context [50.09964990342878]
因果構造を扱うトランスフォーマーの能力を示す新しいフレームワークを提案する。我々のフレームワークは、遷移確率を固定しつつ、ラグの異なるマルコフ鎖をインターリーブすることで因果構造を変化させる。この設定は、コンテクスト内で正しい因果構造を選択できる新しい回路である選択誘導ヘッド(Selective induction Heads)を形成する。
論文参考訳（メタデータ） (2025-09-09T23:13:41Z)
On the Robustness of Transformers against Context Hijacking for Linear Classification [26.1838836907147]
Transformer-based Large Language Models (LLM) は、強力なコンテキスト内学習能力を実証している。それらは、コンテキストハイジャックとして知られる、事実的に正しいコンテキストによって破壊される。十分に訓練された深部変圧器は、経験的観測と整合した高い強靭性を実現することができることを示す。
論文参考訳（メタデータ） (2025-02-21T17:31:00Z)
A Theoretical Analysis of Self-Supervised Learning for Vision Transformers [66.08606211686339]
マスク付きオートエンコーダ(MAE)とコントラスト学習(CL)は異なる種類の表現をキャプチャする。我々は,MAEとCLの両目的に対して,一層ソフトマックス型視覚変換器(ViT)のトレーニングダイナミクスについて検討した。
論文参考訳（メタデータ） (2024-03-04T17:24:03Z)
In-Context Convergence of Transformers [63.04956160537308]
勾配降下法により訓練したソフトマックスアテンションを有する一層変圧器の学習力学について検討した。不均衡な特徴を持つデータに対しては、学習力学が段階的に収束する過程をとることを示す。
論文参考訳（メタデータ） (2023-10-08T17:55:33Z)
ExpPoint-MAE: Better interpretability and performance for self-supervised point cloud transformers [7.725095281624494]
マスク付き自動符号化の有効性を事前学習方式として評価し,代替手段としてMomentum Contrastを探索する。我々は,トランスフォーマーが意味論的に意味のある領域への参加を学ぶことを観察し,事前学習が基礎となる幾何学の理解を深めることを示す。
論文参考訳（メタデータ） (2023-06-19T09:38:21Z)
XAI for Transformers: Better Explanations through Conservative Propagation [60.67748036747221]
変換器の勾配は局所的にのみ関数を反映しており、入力特徴の予測への寄与を確実に識別できないことを示す。我々の提案は、よく確立されたLPP法のトランスフォーマーへの適切な拡張と見なすことができる。
論文参考訳（メタデータ） (2022-02-15T10:47:11Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。