論文の概要: Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks
- arxiv url: http://arxiv.org/abs/2607.11875v2
- Date: Tue, 14 Jul 2026 17:06:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 14:59:31.900747
- Title: Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks
- Title(参考訳): 帰納的推論課題における変換子の不変学習ダイナミクス
- Abstract要約: 文献で知られているいくつかの合成タスクを統一する帰納的タスクのクラスについて検討する。
低次元力学現象として回路形成を鋳造することにより、トランスフォーマーの学習方法に関する予測理論へと進む。
- 参考スコア(独自算出の注目度): 50.79340930913805
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a theoretical framework to explain the emergence of inductive reasoning abilities in Transformer language models. While previous works on Transformer learning dynamics have so far been mostly tied to specific tasks, we study a generalized class of inductive tasks that unifies several synthetic tasks known in the literature, including in-context n-grams and multi-hop reasoning. In this class, we theoretically prove that the training dynamics of attention models can be confined to a highly interpretable, low-dimensional invariant manifold. On this manifold, the learning dynamics are captured by a handful of interpretable coordinates rather than millions of parameters, making both theoretical and empirical analysis more tractable. Using this framework, we characterize how data statistics govern the competition between in-context and in-weights learning, we study how random initializations determine the `winning' circuit when multiple solutions are possible, and we demonstrate that the coordinate frame associated with the manifold can be used to automatically detect which circuits have been learned in trained models. By casting circuit formation as a low-dimensional dynamical phenomenon, we take a step toward a predictive theory of how Transformers learn.
- Abstract(参考訳): 本稿では,トランスフォーマー言語モデルにおける帰納的推論能力の出現を説明する理論的枠組みを提案する。
これまでのTransformer Learning dynamicsの研究は、主に特定のタスクに結びついているが、本研究では、テキスト内n-gramやマルチホップ推論など、文献で知られているいくつかの合成タスクを統合する、一般化された帰納的タスクのクラスについて研究している。
このクラスでは、注意モデルのトレーニング力学が高度に解釈可能な低次元不変多様体に限定できることを理論的に証明する。
この多様体上では、学習力学は数百万のパラメータではなく、少数の解釈可能な座標によって捉えられ、理論的および経験的解析の両方がより魅力的である。
このフレームワークを用いて、データ統計が文脈内学習と重み付き学習の競合をどのように支配するかを特徴付けるとともに、複数の解が可能である場合にランダム初期化が「勝利」回路を決定する方法について検討し、この多様体に付随する座標フレームを用いて、トレーニングされたモデルでどの回路が学習されたかを自動的に検出できることを実証する。
低次元力学現象として回路形成を鋳造することにより、トランスフォーマーの学習方法に関する予測理論へと進む。
関連論文リスト
- Incremental Learning of Sparse Attention Patterns in Transformers [29.54151079577767]
本稿では,複数の過去の位置からの情報を変換器がどのように統合するかを検討するために,高次マルコフ連鎖タスクを提案する。
我々は、頭が最も統計的に支配的なパターンに収束する競争から、異なるパターンを専門とする協調へと、学習力学のシフトを特定する。
論文 参考訳(メタデータ) (2026-02-22T12:16:06Z) - Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers [59.472505916020936]
コンテクスト内の例から,トランスフォーマーがモダリティ間で情報を関連づけることを学ぶ方法について検討する。
現代変圧器におけるユニモーダルICLの原理を再考する。
メカニスティック分析では、両方の設定は、ラベルをマッチするインコンテキストの例からコピーするインダクションスタイルのメカニズムに依存している。
論文 参考訳(メタデータ) (2026-01-28T17:37:28Z) - Beyond Induction Heads: In-Context Meta Learning Induces Multi-Phase Circuit Emergence [28.260455480198047]
トランスフォーマーベースの言語モデルは、文脈に基づいて適応的に予測を行うICL(In-Context Learning)を示す。
このようなメタ学習能力は、トレーニング中にモデルの回路のダイナミクスを解析することによってどのように得られるのかを実験的に明らかにする。
論文 参考訳(メタデータ) (2025-05-22T13:59:30Z) - Interpreting Affine Recurrence Learning in GPT-style Transformers [54.01174470722201]
インコンテキスト学習により、GPTスタイルのトランスフォーマーは、重みを変更することなく推論中に一般化できる。
本稿では,ICLタスクとしてアフィンの再発を学習し,予測する能力に着目する。
実験的手法と理論的手法の両方を用いてモデルの内部動作を分析する。
論文 参考訳(メタデータ) (2024-10-22T21:30:01Z) - Strengthening Structural Inductive Biases by Pre-training to Perform Syntactic Transformations [75.14793516745374]
中間学習によりトランスフォーマーの構造的帰納バイアスを強化することを提案する。
実験の結果,チャンキングなどの構文的タスクのわずかな学習に有効であることが確認された。
分析の結果,中間的事前学習は,どのトークンにシナティクス変換を適用する必要があるかを追尾する注意を喚起することが明らかとなった。
論文 参考訳(メタデータ) (2024-07-05T14:29:44Z) - Dynamical Mean-Field Theory of Self-Attention Neural Networks [0.0]
トランスフォーマーベースのモデルは、様々な領域で例外的な性能を示している。
動作方法や期待されるダイナミクスについてはほとんど分かっていない。
非平衡状態における非対称ホップフィールドネットワークの研究に手法を用いる。
論文 参考訳(メタデータ) (2024-06-11T13:29:34Z) - Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning [80.44084021062105]
本稿では,非方向エッジで連結された2つの潜在結合変数を特徴とする,多モーダルデータに対する新しい潜在部分因果モデルを提案する。
特定の統計的仮定の下では、多モーダル・コントラッシブ・ラーニングによって学習された表現が、自明な変換までの潜在結合変数に対応することを示す。
事前トレーニングされたCLIPモデルの実験は、非絡み合った表現を具現化し、数ショットの学習を可能にし、さまざまな現実世界のデータセットにわたるドメインの一般化を改善する。
論文 参考訳(メタデータ) (2024-02-09T07:18:06Z) - In-Context Convergence of Transformers [63.04956160537308]
勾配降下法により訓練したソフトマックスアテンションを有する一層変圧器の学習力学について検討した。
不均衡な特徴を持つデータに対しては、学習力学が段階的に収束する過程をとることを示す。
論文 参考訳(メタデータ) (2023-10-08T17:55:33Z) - Transformers as Algorithms: Generalization and Implicit Model Selection
in In-context Learning [23.677503557659705]
In-context Learning (ICL) は、トランスフォーマーモデルが一連の例で動作し、オンザフライで推論を行うプロンプトの一種である。
我々は,このトランスモデルを学習アルゴリズムとして扱い,推論時別のターゲットアルゴリズムを実装するためのトレーニングを通じて専門化することができる。
変換器は適応学習アルゴリズムとして機能し、異なる仮説クラス間でモデル選択を行うことができることを示す。
論文 参考訳(メタデータ) (2023-01-17T18:31:12Z) - Learning stochastic dynamics and predicting emergent behavior using
transformers [0.0]
ニューラルネットワークは,システムの1つの動的軌跡を観察することにより,システムの動的規則を学習可能であることを示す。
我々はモデルの1つの軌道上でトランスフォーマーと呼ばれるニューラルネットワークを訓練する。
変換器は、速度の明示的な列挙や構成空間の粗粒化なしに観察から動的規則を学習する柔軟性を持つ。
論文 参考訳(メタデータ) (2022-02-17T15:27:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。