論文の概要: Rethinking Expressivity and Efficiency in Test-Time Training
- arxiv url: http://arxiv.org/abs/2608.21308v2
- Date: Wed, 26 Aug 2026 18:41:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.52492
- Title: Rethinking Expressivity and Efficiency in Test-Time Training
- Title(参考訳): テストタイムトレーニングにおける表現性と効率の再考
- Authors: Zeyun Zhong, Joya Chen, Manuel Martin, Frederik Diederichs, Juergen Gall, Juergen Beyerer,
- Abstract要約: テストタイムトレーニング(TTT)は、推論中に継続的に重みを更新することで、長時間のコンテキスト処理を可能にする。
チャンクワイズ近似のハードウェア効率とトーケン毎の更新ダイナミクスの表現率のバランスをとるために,E$2$-TTTを提案する。
E$2$-TTTは効率的なチャンクワイド手法のトレーニングスループットと一致し、表現率と効率を効果的に調整することを示した。
- 参考スコア(独自算出の注目度): 26.484618002837635
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-Time Training (TTT) enables long-context processing via continuous weight updates during inference, but current methods struggle to balance the expressivity of per-token update dynamics with the hardware efficiency of chunk-wise approximations. We propose E$^2$-TTT (Expressive and Efficient TTT) to bridge this gap. Under the standard approximation of taking gradients at the chunk-start weights, we derive a closed-form state transition that exactly reproduces the chunk-end fast-weight and momentum states of the per-token recurrence. This enables fully parallelized chunk-level training while preserving the temporal structure of the update rule that prior chunk-wise methods discard. We validate E$^2$-TTT by training models up to 1.3B parameters from scratch. It performs on par with previous TTT and hybrid attention baselines in language modeling while outperforming them on in-context retrieval. Its advantage is most pronounced in length extrapolation: on the standard ``Needle in a Haystack'' passkey test, it retains over 90% accuracy at $8\times$ the training context length. Meanwhile, E$^2$-TTT can match the training throughput of efficient chunk-wise methods, demonstrating that it effectively reconciles expressivity with efficiency. The code is available at https://github.com/zeyun-zhong/E2-TTT.
- Abstract(参考訳): テストタイムトレーニング(TTT)は、推論中の連続的な重み付け更新による長期コンテキスト処理を可能にするが、現在の手法では、トーケン毎の更新ダイナミクスとチャンクワイズ近似のハードウェア効率のバランスをとるのに苦労している。
本稿では,このギャップを埋めるためにE$^2$-TTT(Expressive and Efficient TTT)を提案する。
チャンクスタート重みでの勾配の標準的な近似の下で、チャンクエンドの高速重みと運動量状態を正確に再現する閉形式状態遷移を導出する。
これにより、以前のチャンクワイドメソッドが破棄した更新ルールの時間構造を維持しながら、完全に並列化されたチャンクレベルのトレーニングが可能になる。
E$^2$-TTTを1.3Bのパラメータをスクラッチからトレーニングすることで検証する。
従来のTTや言語モデリングにおけるハイブリットアテンションベースラインと同等に動作し、コンテクスト内での検索では優れています。
標準的な ``Needle in a Haystack'' パスキーテストでは、トレーニングコンテキスト長に対して8\times の精度が90%以上保持されている。
一方、E$^2$-TTTは効率的なチャンクワイド手法のトレーニングスループットと一致し、表現率と効率を効果的に調整することを示した。
コードはhttps://github.com/zeyun-zhong/E2-TTTで公開されている。
関連論文リスト
- Self-Guided Test-Time Training for Long-Context LLMs [16.160114043456215]
長いコンテキスト処理は、大規模言語モデルにとってますます重要になっている。
入力の長さが大きくなると、精度が劣化することが多く、モデルが疑問に最も関係のある証拠を特定し、利用するのに苦労していることを示している。
長期利用を改善するための有望な方法はテスト時間トレーニング(TTT)であり、テストコンテキストをインスタンス固有のパラメータ適応のトレーニング例として扱う。
本稿では,学習すべきエビデンスを識別するセルフガイドTT(S-TTT)を提案する。
論文 参考訳(メタデータ) (2026-07-10T13:45:56Z) - End-to-End Test-Time Training for Long Context [98.3930777591529]
アーキテクチャ設計よりも継続学習における問題として,長文言語モデリングを定式化する。
我々のモデルは、与えられたコンテキストの次から次までの予測を通じてテスト時に学習を続け、読み込んだコンテキストを重みに圧縮します。
全体として、テストタイムトレーニング(TTT)の一形態であるE2E(End-to-End)は、テスト時(次世代の予測)とトレーニング時(メタラーニング)の両方である。
論文 参考訳(メタデータ) (2025-12-29T18:30:14Z) - TNT: Improving Chunkwise Training for Test-Time Memorization [62.78875147721906]
タイタンスやTTTのような深いテストタイム記憶モジュールを持つリカレントニューラルネットワーク(RNN)は、トランスフォーマーとは異なる有望で線形にスケールするパラダイムである。
TNTは,2段階のプロセスを通じて,推論性能からトレーニング効率を分離する,新たなトレーニングパラダイムである。
TNTはトレーニング速度を最も正確なベースライン構成の17倍に高速化する。
論文 参考訳(メタデータ) (2025-11-10T17:45:09Z) - Test time training enhances in-context learning of nonlinear functions [51.56484100374058]
テストタイムトレーニング(TTT)は、各予測に先立って指定されたパラメータを明示的に更新することで、モデル性能を向上させる。
本研究では,TTTとテキスト内学習(ICL)の組み合わせについて検討する。
論文 参考訳(メタデータ) (2025-09-30T03:56:44Z) - Test-Time Training Done Right [61.8429380523577]
テスト時間トレーニング(TTT)モデルは、推論中にモデルの重みの一部を適応させることによってコンテキストをモデル化する。
既存のTT手法は、長文データを扱う上で有効性を示すのに苦労した。
我々は,大規模チャンクテストタイムトレーニング(LaCT)を開発し,ハードウェア利用率を桁違いに向上させる。
論文 参考訳(メタデータ) (2025-05-29T17:50:34Z) - The Surprising Effectiveness of Test-Time Training for Few-Shot Learning [59.309477460893916]
言語モデル(LM)は、トレーニングディストリビューション内のタスクにおいて印象的なパフォーマンスを示しているが、しばしば構造的に新しいタスクで苦労している。
LMの推論と少数ショット学習能力を改善するメカニズムとして,テストタイムトレーニング(TTT)の有効性を検討する。
本研究は,新しいタスクにおける文脈内学習の限界を強調し,言語モデルの適応性を高めるためのテストタイムトレーニングの可能性を示した。
論文 参考訳(メタデータ) (2024-11-11T18:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。