論文の概要: Modular TTT: Rethinking Test-Time Training as Composable Modules
- arxiv url: http://arxiv.org/abs/2608.07110v1
- Date: Fri, 07 Aug 2026 11:11:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.48037
- Title: Modular TTT: Rethinking Test-Time Training as Composable Modules
- Title(参考訳): Modular TTT: テストタイムトレーニングを構成可能なモジュールとして再考
- Abstract要約: テストタイムトレーニング(TTT)は、内部学習ルールによって高速ウェイトが更新されるオンライン学習問題としてシーケンスモデリングを考察する。
既存のアプローチは通常、各変種を個別にハードコードする。
本稿では,内部学習者を有向非巡回グラフとして表現するフレームワークであるModular TTTを提案する。
- 参考スコア(独自算出の注目度): 35.87120372962587
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-time training (TTT) views sequence modeling as an online learning problem in which fast weights are updated by an internal learning rule. Despite the growing number of TTT variants, existing approaches typically hard-code each variant separately, which makes it difficult to design new TTT methods and to isolate the role of each component. To address this, we propose Modular TTT, a framework that represents the inner learner as a directed acyclic graph and exposes the fast-weight network, loss function, learning rate, weight decay, and normalization as explicit design dimensions. Modular TTT automatically composes primitive-level train-view forward, train-view backward, and causal query-view rules into the full graph-level TTT computation, including the fast-weight state transition. Using Modular TTT, we systematically ablate the components of TTT and find that small learning-rate initialization, weight decay, and a single-layer nonlinearity improve performance, while MSE and inner-product losses perform similarly. Deeper fast-weight networks and normalization tend to hurt performance because they induce excessively large activations, while residual connections and gating provide little measurable benefit. Guided by these findings, we train the best resulting variant as 410M- and 1.45B-parameter models on 100B tokens, and observe training loss and benchmark performance comparable to Gated DeltaNet.
- Abstract(参考訳): テストタイムトレーニング(TTT)は、内部学習ルールによって高速ウェイトが更新されるオンライン学習問題としてシーケンスモデリングを考察する。
TTTの変種が増えているにもかかわらず、既存のアプローチは通常、各変種を個別にハードコードするので、新しいTTメソッドを設計し、各コンポーネントの役割を分離することは困難である。
そこで本研究では,内部学習者を有向非巡回グラフとして表現し,高速なネットワーク,損失関数,学習速度,重量減衰,正規化を明示的な設計次元として公開するフレームワークであるModular TTTを提案する。
Modular TTTは、プリミティブレベルのトレインビューフォワード、トレインビューバック、因果的なクエリビュールールを、高速な状態遷移を含む完全なグラフレベルのTTT計算に自動的に構成する。
Modular TTT を用いて,TTT の成分を体系的に吸収し,学習速度の初期化,体重減少,単層非線形性により性能が向上し,MSE と内積損失も同様に改善した。
より高速なネットワークと正規化は、過度に大きなアクティベーションを引き起こすためパフォーマンスを損なう傾向にあり、残りの接続やゲーティングは測定可能な利益をほとんど得られない。
これらの知見に導かれ、100Bトークン上で410Mと1.45Bパラメータモデルとして最高の結果を得たモデルをトレーニングし、Gated DeltaNetに匹敵するトレーニング損失とベンチマークパフォーマンスを観察した。
関連論文リスト
- In-Place Test-Time Training [32.521599123691026]
In-Place Test-Time Training (In-Place TTT)は、テスト時間トレーニングを備えた大規模言語モデルをシームレスに提供するフレームワークである。
In-Place TTTは、ユビキタスブロックの最終射影行列を適応可能な高速ウェイトとして扱う。
我々は,TTTの汎用的な再構築目標を,次世代のToken-Predictionタスクに合わせた,理論的に整った目標に置き換える。
論文 参考訳(メタデータ) (2026-04-07T17:59:44Z) - Test-Time Training with KV Binding Is Secretly Linear Attention [30.99606181109631]
KVバインディングをシーケンスモデリング層とするテストタイムトレーニング(TTT)は、オンラインメタ学習の一形態として一般的に解釈される。
学習された線形アテンション演算子の形式として,TTTアーキテクチャの幅広いクラスを表現できることが示される。
論文 参考訳(メタデータ) (2026-02-24T18:59:30Z) - TNT: Improving Chunkwise Training for Test-Time Memorization [62.78875147721906]
タイタンスやTTTのような深いテストタイム記憶モジュールを持つリカレントニューラルネットワーク(RNN)は、トランスフォーマーとは異なる有望で線形にスケールするパラダイムである。
TNTは,2段階のプロセスを通じて,推論性能からトレーニング効率を分離する,新たなトレーニングパラダイムである。
TNTはトレーニング速度を最も正確なベースライン構成の17倍に高速化する。
論文 参考訳(メタデータ) (2025-11-10T17:45:09Z) - Test time training enhances in-context learning of nonlinear functions [51.56484100374058]
テストタイムトレーニング(TTT)は、各予測に先立って指定されたパラメータを明示的に更新することで、モデル性能を向上させる。
本研究では,TTTとテキスト内学習(ICL)の組み合わせについて検討する。
論文 参考訳(メタデータ) (2025-09-30T03:56:44Z) - Test-Time Training Provably Improves Transformers as In-context Learners [49.09821664572445]
テキスト内学習のための勾配に基づくTTTアルゴリズムについて検討する。
テストプロンプトで提供されるコンテキスト内デモに対して,トランスフォーマーモデルをトレーニングする。
経験的貢献として,TabPFNに対するTTTの有用性について検討した。
論文 参考訳(メタデータ) (2025-03-14T20:06:37Z) - Enhancing Plasticity for First Session Adaptation Continual Learning [20.62749699589017]
クラスインクリメンタルラーニング(PLASTIC)における塑性強化テスト時間適応の導入
PLASTICはモデル安定性を維持しながら可塑性をCILに再蓄積する。
従来型と最先端のPTMベースのCILアプローチを一貫して上回ります。
論文 参考訳(メタデータ) (2023-10-17T13:06:39Z) - Test-Time Training on Video Streams [66.63237260332984]
以前の作業では、テスト時にトレーニングされたモデルをさらに改善するための一般的なフレームワークとして、テスト時間トレーニング(TTT)が確立されていた。
TTTをストリーミング設定に拡張し、複数のテストインスタンスが時間順に到着します。
オンラインTTTは、現実世界の3つのデータセット上で、4つのタスクで固定モデルベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2023-07-11T05:17:42Z) - Decouple Graph Neural Networks: Train Multiple Simple GNNs Simultaneously Instead of One [60.5818387068983]
グラフニューラルネットワーク(GNN)は、深刻な非効率性に悩まされている。
我々は,より効率的なトレーニングを行うために,多層GNNを複数の単純なモジュールとして分離することを提案する。
提案するフレームワークは,合理的な性能で高い効率性を示す。
論文 参考訳(メタデータ) (2023-04-20T07:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。