論文の概要: SR-TTT: Surprisal-Aware Residual Test-Time Training
- arxiv url: http://arxiv.org/abs/2603.06642v1
- Date: Thu, 26 Feb 2026 01:54:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-15 16:38:22.469373
- Title: SR-TTT: Surprisal-Aware Residual Test-Time Training
- Title(参考訳): SR-TTT:サプライズ対応残差テストタイムトレーニング
- Authors: Swamynathan V P,
- Abstract要約: テストタイムトレーニング(TTT)言語モデルは、O(1)メモリフットプリントを持つ理論的に無限のコンテキストウィンドウを実現する。
純粋なTTアーキテクチャは、正確なリコールタスクで破滅的な失敗を被る。
本稿では,TTTバックボーンをロスゲートスパースメモリ機構で増強することにより,このリコール障害を解消するSR-TTTを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-Time Training (TTT) language models achieve theoretically infinite context windows with an O(1) memory footprint by replacing the standard exact-attention KV-cache with hidden state ``fast weights'' W_fast updated via self-supervised learning during inference. However, pure TTT architectures suffer catastrophic failures on exact-recall tasks (e.g., Needle-in-a-Haystack). Because the fast weights aggressively compress the context into an information bottleneck, highly surprising or unique tokens are rapidly overwritten and forgotten by subsequent token gradient updates. We introduce SR-TTT (Surprisal-Aware Residual Test-Time Training), which resolves this recall failure by augmenting the TTT backbone with a loss-gated sparse memory mechanism. By dynamically routing only incompressible, highly surprising tokens to a traditional exact-attention Residual Cache, SR-TTT preserves O(1) memory for low-entropy background context while utilizing exact attention exclusively for critical needles. Our complete implementation, training scripts, and pre-trained weights are open-source and available at: https://github.com/swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training.
- Abstract(参考訳): テスト時間トレーニング(TTT)言語モデルは、標準の正確な注意点KV-cacheを、推論中に自己教師付き学習によって更新された隠れ状態 ' `fast weights'' のW_fastに置き換えることで、O(1)メモリフットプリントで理論的に無限のコンテキストウインドウを実現する。
しかし、純粋なTTアーキテクチャは、正確なリコールタスク(例えば、Needle-in-a-Haystack)で破滅的な失敗を被る。
高速な重み付けがコンテキストを積極的に情報ボトルネックに圧縮するため、非常に驚くべきトークンやユニークなトークンは急速に上書きされ、その後のトークン勾配更新によって忘れ去られる。
SR-TTT(Surprisal-Aware Residual Test-Time Training)を導入し,TTTバックボーンにロスゲートスパース記憶機構を付加することにより,このリコール障害を解決する。
SR-TTTは、非圧縮性、非常に驚くべきトークンを従来の正確なアテンショナルキャッシュに動的にルーティングすることで、O(1)メモリを低エントロピー背景コンテキストに保存し、クリティカルニードルのみに正確な注意を払っている。
私たちの完全な実装、トレーニングスクリプト、トレーニング済みのウェイトはオープンソースで、https://github.com/swamynathanvp/Surprisal-Aware-Residual-Test-Time-Trainingで利用可能です。
関連論文リスト
- When to Ponder: Adaptive Compute Allocation for Code Generation via Test-Time Training [0.0]
我々は,テストタイムトレーニング更新を選択的にトリガするために,TTT層の自己教師型再構築損失を用いたゲーティング戦略であるポンダーTTTを提案する。
コード言語モデリングにおける GPT-2 モデル (124M から 1.5B ) を用いた実験により,この信号が推論に相容れないことを示した。
論文 参考訳(メタデータ) (2025-12-31T14:49:54Z) - Trellis: Learning to Compress Key-Value Memory in Attention Models [48.12167339402521]
本稿では,有界メモリを備えた新しいトランスフォーマーアーキテクチャであるTrellisを紹介する。
Trellisは標準のKVキャッシュを固定サイズのメモリに置き換え、新しいキーと値をメモリに格納する2パスのリカレント圧縮機構を訓練する。
言語モデリング、常識推論、リコール集約タスク、時系列に関する実験は、提案されたアーキテクチャが強力なベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-29T20:32:10Z) - TTT3R: 3D Reconstruction as Test-Time Training [69.51086319339662]
テストタイムトレーニングの観点から3次元再構築基盤モデルを再考する。
メモリ状態と受信した観測値のアライメントの信頼性を利用して、クローズドフォーム学習率を導出する。
この訓練のない介入はTTT3Rと呼ばれ、長さの一般化を大幅に改善する。
論文 参考訳(メタデータ) (2025-09-30T17:59:51Z) - Fast Quiet-STaR: Thinking Without Thought Tokens [51.79231070632772]
Fast Quiet STaRは、より効率的な推論フレームワークであり、計算コストを削減しながらトークンレベルの推論の利点を保存する。
本手法では,段階的に思考トークン数を減少させるカリキュラムベースの学習戦略を導入する。
Mistral 7BとQwen2.5 7Bによる4つのベンチマークデータセットの実験では、Fast Quiet-STaRが平均精度でQuiet-STaRを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2025-05-23T11:14:12Z) - REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training [58.33728862521732]
Diffusion Transformer (DiTs)は最先端の画像品質を提供するが、訓練は依然として遅い。
最近の治療 -- DiT の隠された特徴と非生成的教師(例えば DINO)の特徴とを一致させる表現アライメント(REPA) -- は、初期のエポックを劇的に加速させるが、その後パフォーマンスを低下させる。
生成学習者が共同データ分布をモデル化し始めると、教師の低次元埋め込みと注意パターンがガイドではなくストラトジャケットになる。
HASTEを紹介する
論文 参考訳(メタデータ) (2025-05-22T15:34:33Z) - Test-Time Training on Video Streams [66.63237260332984]
以前の作業では、テスト時にトレーニングされたモデルをさらに改善するための一般的なフレームワークとして、テスト時間トレーニング(TTT)が確立されていた。
TTTをストリーミング設定に拡張し、複数のテストインスタンスが時間順に到着します。
オンラインTTTは、現実世界の3つのデータセット上で、4つのタスクで固定モデルベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2023-07-11T05:17:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。