論文の概要: Shared Weights, Selected Computations: How Looped Transformers Route What Each Loop Does
- arxiv url: http://arxiv.org/abs/2609.39892v1
- Date: Wed, 30 Sep 2026 14:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.951449
- Title: Shared Weights, Selected Computations: How Looped Transformers Route What Each Loop Does
- Title(参考訳): 共有ウェイト、選択した計算:ループ変換器がどのループで何をするか
- Abstract要約: ループトランスフォーマーは繰り返し同じトランスフォーマー層を適用し、遅延計算の繰り返しアーキテクチャを提供する。
それぞれのループが実際に同じことを繰り返すのか、そうでなければ、どの共有パラメータを異なる操作にルーティングするのか?
凍結したループは、その入射した隠れ状態を変更することで、異なる遷移に向けて操れることを示す。
- 参考スコア(独自算出の注目度): 40.71142599085565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped Transformers repeatedly apply the same set of Transformer layers, giving them a recurrent architecture for latent computation. Their strong performance on iterative reasoning and length-generalization tasks suggests an appealing explanation: recurrence may provide an inductive bias that lets the model reuse a learned algorithm across loops. However, weight sharing alone does not imply that every loop performs the same operation. This raises a basic question: is each loop actually repeating the same computation, and if not, what routes the shared parameters to different operations? We study this question using graph walks as a test case. In the model's native trajectories, decoded predictions can advance by different numbers of graph steps or remain at a reached target, showing that recurrent progress need not follow a fixed one-loop-one-step pattern. We then show that a frozen loop can be steered toward different transitions by modifying its entering hidden state: a learned linear layer $J$ selects the desired transition without changing the shared Transformer layers. To test how this steering works, we use activation patching and find that attention patterns can recover its effects and switch the selected transition. Across five matched pairs of graph models, changing intermediate supervision during backbone training changes which transitions $J$ can induce. This suggests that $J$ selects computations learned by the backbone rather than creating new algorithms. Together, these results show that the hidden state can control shared computation, with attention routing as a causal pathway.
- Abstract(参考訳): ループトランスフォーマーは繰り返し同じトランスフォーマー層を適用し、遅延計算の繰り返しアーキテクチャを提供する。
反復は帰納的バイアスを与え、モデルが学習したアルゴリズムをループを越えて再利用できるようにする。
しかし、ウェイトシェアリングだけでは、全てのループが同じ操作を行うという意味ではない。
それぞれのループが実際に同じ計算を繰り返しているのか、そうでなければ、どの共有パラメータを異なる操作にルーティングするのか?
テストケースとしてグラフウォークを用いて,この問題について検討する。
モデルのネイティブトラジェクトリでは、デコードされた予測は、異なる数のグラフステップで進行したり、到達したターゲットに留まり、繰り返し進行は固定された1ループ1ステップパターンに従う必要はないことを示す。
学習された線形層$J$は、共有トランスフォーマー層を変更することなく、所望の遷移を選択する。
このステアリングがどのように機能するかをテストするために、アクティベーションパッチを使用し、アテンションパターンがその効果を回復し、選択した遷移を切り替えることができることを確かめる。
5組のグラフモデルが一致し、バックボーントレーニング中の中間監督が変更され、J$の遷移が引き起こされる。
これは、$J$が新しいアルゴリズムを作成するのではなく、バックボーンによって学習された計算を選択することを示唆している。
これらの結果から、隠れ状態は、注意経路を因果経路として、共有計算を制御できることが分かる。
関連論文リスト
- Looped Diffusion Transformer [126.10100109922593]
分割ステップ毎に共有トランスフォーマーブロックを繰り返し実行することで、計算をスケールする別の方法を模索する。
ナイーブループは 画像の質を 常に向上させません
ループ型拡散変換器(Looped Diffusion Transformer, Looped-DiT)を提案する。
論文 参考訳(メタデータ) (2026-09-30T17:52:08Z) - Looped Actor: Depth-Recurrent Reasoning Models for Reinforcement Learning [46.34681410689956]
ループ推論モデルは、パラメータの共有セットを繰り返し適用し、モデルのサイズを増大させることなく、より多くの計算を可能にします。
近年の言語モデリングおよび推論におけるループ変換器の成功により,動的ループ化がシーケンシャルな意思決定に有用かどうかを考察した。
共有計算ブロックを用いて固定点に対する潜在表現を洗練するトランスフォーマーベースのポリシーであるLooped Actorを導入する。
論文 参考訳(メタデータ) (2026-09-29T12:57:04Z) - Looped Transformers as Optimizers [39.57587942081881]
Looped Transformerは、共有Transformerブロックを繰り返し適用することで、深さスケーリングに対するパラメータ効率のよいアプローチを提供する。
最近の推論モデルは、より長い計算によってテスト時間計算をスケールする価値を強調している。
ループした隠された状態は、深さを通して更新される高速な重みと見なす。
ループ遷移を局所的な勾配に基づく更新として定式化し、各深さで暗黙的な目標を予測できるブロックを繰り返す。
論文 参考訳(メタデータ) (2026-09-29T12:31:51Z) - Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping [56.14767235650558]
共有トランスブロックを繰り返し適用するLooped Transformerは、可変長の計算タスクに自然に適合するアーキテクチャである。
この差分を、列長とループ数の間の単純なアルゴリズムタスクにおける突発的相関に追従する。
私たちの研究は、"停止する時"は単なる推論時間割当ルールではなく、トレーニング設計の選択として扱われるべきであることを示唆しています。
論文 参考訳(メタデータ) (2026-06-29T08:58:09Z) - LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation [9.943277041891788]
可変長トラジェクタで訓練されたループ変換器であるLoopFormerを導入し、予算条件の推論を可能にする。
私たちのコアコントリビューションは、異なる長さの軌跡を整列するショートカット一貫性トレーニングスキームです。
LoopFormerは、アグレッシブな計算制約下でさえ、言語モデリングと推論ベンチマークで堅牢なパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-02-11T23:58:28Z) - Step-resolved data attribution for looped transformers [15.546254897542113]
本研究では,各学習例がループ変換器の内部計算をどう形成するかを検討する。
我々は、TracInを長さ$$$影響軌道に分解する textStep-De Influence (Sketch) を導入する。
ループ型GPTスタイルモデルとアルゴリズムタスクの実験により、SDIは優れたスケールを示し、フルグレートなベースラインと低いエラーにマッチし、潜在推論プロセスへのステップ毎の洞察を伴う幅広いデータ属性および解釈可能性タスクをサポートする。
論文 参考訳(メタデータ) (2026-02-10T18:57:53Z) - Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning [47.06427150903487]
CoT(Chain-of-Thought)プロンプトは、言語モデルの推論能力を高めるための強力なテクニックとして登場した。
ループ変換器は目覚ましい長さの一般化能力を有するが、その限定的な一般化と適応性により、自己回帰解の代替として機能することができない。
ループ変換器の強度をよりよく活用するためのRELAYを提案する。
論文 参考訳(メタデータ) (2025-02-12T15:17:04Z) - Learning to (Learn at Test Time) [66.49955140542654]
2つのネストループで学習する学習として教師あり学習の問題を再構築する。
内ループは最終予測の前に各インスタンスで自己スーパービジョンで学習する。
外ループは、内部ループが使用する自己教師付きタスクを学習し、最終的な予測が改善する。
論文 参考訳(メタデータ) (2023-10-20T20:42:00Z) - Transformers Learn Shortcuts to Automata [52.015990420075944]
低深度変換器は任意の有限状態オートマトンを計算できる。
我々は,$O(log T)$レイヤを持つ変換器が,長さ$T$の入力シーケンス上で,オートマトンを正確に再現可能であることを示す。
さらに、これらの解の脆性について検討し、潜在的な緩和を提案する。
論文 参考訳(メタデータ) (2022-10-19T17:45:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。