論文の概要: T^2MLR: Transformer with Temporal Middle-Layer Recurrence
- arxiv url: http://arxiv.org/abs/2607.15178v2
- Date: Fri, 17 Jul 2026 05:00:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.571305
- Title: T^2MLR: Transformer with Temporal Middle-Layer Recurrence
- Title(参考訳): T^2MLR: 一時中層再帰変圧器
- Abstract要約: 我々は,キャッシュされた中間層表現を前者のトークンから直接,現在のトークン位置の前のレイヤに融合させる,トランスフォーマーベースの潜時推論アーキテクチャを開発した。
ローカライズされた中間層ブロックのみ(ネットワークの20%以下)にリカレンスを適用すると、フルレイヤのリカレンスを上回ることがしばしばある。
これらの結果は、トランスフォーマーの効果的な潜伏推論は、以前の作業のように全てのレイヤをループする必要はなく、ターゲットとなる中層再発からより強く現れることを示唆している。
- 参考スコア(独自算出の注目度): 28.818755729513793
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer reasoning is limited by autoregressive decoding, which repeat edly compresses rich hidden computation through token space and makes it difficult for intermediate reasoning states to persist across time. We in troduce Transformers with Temporal Middle-Layer Recurrence (T2MLR), a transformers-based latent reasoning architecture that fuses a cached middle layer representation from the previous token directly into an earlier layer of the current token position, enabling abstract intermediate computation to persist across decoding steps with little inference overhead. Across natural-language pretraining and multi-hop reasoning finetuning, T2MLR consistently outperforms data- and parameter-matched Transformer base lines. Moreover, applying recurrence to only a localized middle-layer block (as little as 20% of the network) often outperforms full-layer recurrence. Im portantly, T2MLR does not require pretraining from scratch: retrofitting the recurrent pathway into an existing pretrained 1.7B Transformer and briefly finetuning substantially improves math reasoning, lowering the barrier to practical adoption. These results suggest that effective latent reasoning in Transformers does not require looping over all layers as in previous works, but can instead emerge more strongly from targeted middle-layer recurrence.
- Abstract(参考訳): トランスフォーマー推論は自己回帰復号化によって制限され、トークン空間を通じてリッチな隠れ計算を反復的に圧縮し、中間的推論状態が時間にわたって持続することが困難になる。
我々は、トランスフォーマーベースの潜時推論アーキテクチャであるT2MLR(T2MLR)で、キャッシュされた中間層表現を前トークンから直接現在のトークン位置の前のレイヤに融合させ、抽象的な中間計算を推論オーバーヘッドの少ない復号ステップで継続できるようにする。
自然言語の事前学習とマルチホップ推論の微調整を通じて、T2MLRはデータとパラメータマッチングされたTransformerベースラインを一貫して上回っている。
さらに、局部的な中間層ブロック(ネットワークの20%以下)のみに再発を施すと、全層再発よりも良くなる。
T2MLRは、既存の1.7Bトランスフォーマーに再帰経路を復元し、短時間の微調整によって数学の推論が大幅に改善され、実用化への障壁が低下する。
これらの結果は、トランスフォーマーの効果的な潜伏推論は、以前の作業のように全てのレイヤをループする必要はなく、ターゲットとなる中層再発からより強く現れることを示唆している。
関連論文リスト
- Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Transformers with Selective Access to Early Representations [6.554898376530473]
Selective Access Transformer(SATFormer)を導入し、コンテキスト依存ゲートによるアクセスを制御しながら、第1層の値経路を保存する。
SATFormerは静的値とTransformerベースラインに対するバリデーション損失とゼロショット精度を一貫して改善する。
ゲート分析は、スパース、ディープ依存、ヘッド固有、カテゴリー依存のアクセスパターンを示唆する。
論文 参考訳(メタデータ) (2026-05-05T16:38:29Z) - The Recurrent Transformer: Greater Effective Depth and Efficient Decoding [48.9323408950142]
Recurrent Transformerは、各レイヤがそれぞれのアクティベーションから計算されたキーと値のペアに付随する、シンプルなアーキテクチャ変更である。
このアーキテクチャは, (i) 従来のトランスフォーマーと (ii) トークン・ツー・グレッシブ・リカレント更新の両方を軽度な仮定でエミュレートできることを示す。
論文 参考訳(メタデータ) (2026-04-23T02:12:58Z) - DeepCoT: Deep Continual Transformers for Real-Time Inference on Data Streams [63.27233749591346]
トランスフォーマーベースのモデルは、ますます複雑なタスクに取り組むために、そのサイズとパラメータ数を劇的に増加させてきた。
ストリームデータ推論は通常、スライディング時間ウィンドウ上で実行され、非常に冗長な計算に繋がる。
提案するDeep Continual Transformer(DeepCoT)は冗長性のないエンコーダのみのモデルであり,最小限の変更で既存のディープエンコーダアーキテクチャに適用できる。
論文 参考訳(メタデータ) (2025-11-21T16:15:43Z) - TNT: Improving Chunkwise Training for Test-Time Memorization [62.78875147721906]
タイタンスやTTTのような深いテストタイム記憶モジュールを持つリカレントニューラルネットワーク(RNN)は、トランスフォーマーとは異なる有望で線形にスケールするパラダイムである。
TNTは,2段階のプロセスを通じて,推論性能からトレーニング効率を分離する,新たなトレーニングパラダイムである。
TNTはトレーニング速度を最も正確なベースライン構成の17倍に高速化する。
論文 参考訳(メタデータ) (2025-11-10T17:45:09Z) - Intra-Layer Recurrence in Transformers for Language Modeling [0.03320194947871346]
ILR(Intra-Layer Recurrence)は、単一のフォワードパス内の個々の層に選択的に反復するアプローチである。
実験により、より多くのイテレーションを以前のレイヤに割り当てると、最適な結果が得られます。
論文 参考訳(メタデータ) (2025-05-03T16:16:55Z) - Finetuning Pretrained Transformers into RNNs [81.72974646901136]
トランスフォーマーは自然言語生成においてリカレントニューラルネットワーク(RNN)を上回っている。
線形複雑リカレント変種は自己回帰生成に適していることが証明されている。
この研究は、事前訓練された変換器を効率の良い再帰変換器に変換することを目的としている。
論文 参考訳(メタデータ) (2021-03-24T10:50:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。