論文の概要: Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.15893v2
- Date: Mon, 20 Jul 2026 09:15:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.765463
- Title: Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models
- Title(参考訳): 両方の方向の誘導:マスク拡散言語モデルにおける文脈内学習の力学解析
- Authors: Andy Catruna, Emilian Radoi,
- Abstract要約: 本研究では,拡散言語モデル(DLM)が,文脈内学習のメカニズムである帰納的帰納的学習を実現する方法について検討する。
DLMは双方向誘導回路を学習し、前兆と次 token の頭が局所的コンテキストを残差ストリームに書き込む。
DLMがマスク付きトークンのグローバルな割合を計算し、暗黙の時間ステップとして使用するという因果的証拠を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While the internal mechanisms of autoregressive (AR) transformers have been studied extensively, much less is known about diffusion language models (DLMs), an emerging alternative that generates text by iterative denoising. In this work, we study how DLMs implement induction, a mechanism behind in-context learning in which the model finds a repeated context and copies the token that followed it. Our analysis compares attention-only AR models and absorbing-mask DLMs with matched architectures. We find that DLMs learn a bidirectional induction circuit, where previous-token and next-token heads write local context into the residual stream and later induction heads use it to find and copy the answer from the matching source position. The circuit is direction-symmetric, working whether the source appears in the past or in the future. When only left context is visible, matching what an AR model sees, the DLM does not outperform its AR counterpart in induction capabilities. However, we observe it has stronger induction when both sides of the masked token are visible, pointing to bidirectional context access rather than a stronger one-sided mechanism. Beyond induction, we provide causal evidence that DLMs compute the global fraction of masked tokens and use it as an implicit timestep, even though they are given no explicit timestep embedding.
- Abstract(参考訳): 自己回帰変換器の内部メカニズムは広く研究されているが、拡散言語モデル(DLM)についてはあまり知られていない。
本研究では,DLMが帰納的学習(context learning)のメカニズムである帰納的学習(in-context learning)をどのように実装するかを検討する。
本分析では,注目のみのARモデルと吸収マスクDLMを一致したアーキテクチャと比較する。
DLMは双方向誘導回路を学習し、前兆と次トーケンヘッドは局所的なコンテキストを残差ストリームに書き込む。
回路は方向対称であり、ソースが過去でも未来でも動作する。
左のコンテキストのみが可視であり、ARモデルが見ているものと一致する場合、DLMは誘導能力においてARよりも優れていない。
しかし、マスクされたトークンの両面が見えれば、より強い一方的なメカニズムではなく、双方向のコンテキストアクセスを指して、より強い誘導が期待できる。
帰納法以外にも、DLMがマスクされたトークンのグローバルな割合を計算し、暗黙の時間ステップとして使用するという因果的証拠を提供する。
関連論文リスト
- Subliminal Clocks: Latent Time Modelling in Diffusion Language Models [19.412917551000742]
Diffusion Language Models (DLMs) は自己回帰モデルに代わる有望な代替品として登場した。
本稿では, DLM が残留ストリーム内の拡散時間ステップに関連する潜時表現を符号化していることを示す。
さらに、推定時間ステップに付随する低次元部分空間に沿ってモデルをステアリングすることで、デノゲーションプログレスの概念を体系的に調整できることを実証する。
論文 参考訳(メタデータ) (2026-07-02T06:45:42Z) - Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment [46.75006425771645]
拡散言語モデル(DLM)は、最近、標準自己回帰(AR)モデルを補完する機能を実証した。
我々は,AR-to-DLM変換中に,次点予測によって学習した内部表現幾何を明示的に保存できるかを問う。
本稿では,事前訓練されたARモデルから表現を再利用するために,双方向マスク拡散モデルを適用する表現アライメント対象であるREPR-ALIGNを紹介する。
論文 参考訳(メタデータ) (2026-05-07T19:35:48Z) - Diffusion-CAM: Faithful Visual Explanations for dMLLMs [8.78213424930081]
Diffusion-CAMは、dMLLMに特化された最初の解釈可能性法である。
バックボーンの中間表現を微分して生の活性化マップを導出する。
実験の結果,Diffusion-CAMは局所化精度と視覚的忠実度の両方でSoTA法よりも優れていた。
論文 参考訳(メタデータ) (2026-04-13T05:14:18Z) - Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs [100.02824137397464]
難易度が増大する入力に遭遇した場合,大規模言語モデルが内部表現をどのように適応するかを検討する。
タスクの難易度が増大するにつれて、LLMの最後の隠れ状態は実質的にスペーサーとなる。
この空間性-微分的関係は、様々なモデルや領域で観測可能である。
論文 参考訳(メタデータ) (2026-03-03T18:48:15Z) - Activation Steering for Masked Diffusion Language Models [1.0980666029958932]
マスケ拡散言語モデルは反復的復調過程を通じてテキストを生成する。
本稿では,MDLMのためのアクティベーションステアリングフレームワークを提案する。
LLaDA-8B-Instructの実験では、高レベル属性の信頼性変調が示されている。
論文 参考訳(メタデータ) (2025-12-30T11:10:52Z) - Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models [82.87985794856803]
大規模言語モデル(LLM)は、幅広い自然言語処理(NLP)タスクにおいて最先端のパフォーマンスを達成した。
最近、Diffusion Language Models (DLM) が有望な代替アーキテクチャとして登場した。
論文 参考訳(メタデータ) (2025-10-05T10:50:52Z) - LatentQA: Teaching LLMs to Decode Activations Into Natural Language [72.87064562349742]
自然言語におけるモデルアクティベーションに関するオープンな疑問に答えるタスクであるLatentQAを紹介する。
本稿では,アクティベーションと関連する質問応答ペアのデータセット上で,デコーダLLMを微調整するLatent Interpretation Tuning (LIT)を提案する。
我々のデコーダはまた、ステレオタイプ付き文のモデルのデバイアス化や世代ごとの感情制御など、モデルを制御するために使用する差別化可能な損失も規定している。
論文 参考訳(メタデータ) (2024-12-11T18:59:33Z) - AR-Diffusion: Auto-Regressive Diffusion Model for Text Generation [138.98095392584693]
本稿では,自己回帰拡散(AR-Diffusion)を導入し,自然言語の固有な逐次特性について考察する。
AR拡散は、右のトークンの生成が左の生成されたトークンに依存することを保証します。
様々なテキスト生成タスクに関する一連の実験において、AR-Diffusionは既存の拡散言語モデルよりも優れていることを示した。
論文 参考訳(メタデータ) (2023-05-16T15:10:22Z) - Reflective Decoding: Beyond Unidirectional Generation with Off-the-Shelf
Language Models [63.808843089941405]
大規模な事前訓練された言語モデル(LM)は、顕著な品質のテキストを生成するが、左から右へ連続的にしか生成しない。
非順序タスクへの一方向LMの直接適用を可能にする新しい教師なしアルゴリズムであるReflective Decodingを提案する。
2段階のアプローチでは、監視もパラレルコーパスも必要ありません。
論文 参考訳(メタデータ) (2020-10-16T18:02:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。