論文の概要: Learning What to Remember: Test-Time Training via Context Distillation
- arxiv url: http://arxiv.org/abs/2608.01672v1
- Date: Mon, 03 Aug 2026 04:06:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.324766
- Title: Learning What to Remember: Test-Time Training via Context Distillation
- Title(参考訳): 覚えるべきことを学ぶ:コンテキスト蒸留によるテスト時間トレーニング
- Abstract要約: テストタイムトレーニング(TTT)は、長期コンテキストモデリングのためのオンラインパラメータ更新を実行する魅力的なアプローチである。
textbfTest-textbfTime textbfContext textbfDistillation (TTCD)を提案する。
- 参考スコア(独自算出の注目度): 72.10421333095852
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Effective long-context modeling is not merely about retaining more of the past, but about preserving the information that may prove relevant later. Test-time training (TTT) is an appealing approach that performs online parameter updates for long-context modeling, yet existing TTT methods only optimize either reconstruction or online adaptation objectives without considering the future utility of retained information. In this work, we propose \textbf{T}est-\textbf{T}ime \textbf{C}ontext \textbf{D}istillation (TTCD), a TTT framework that introduces a self-supervised objective for allocating limited memory capacity for future use. Specifically, TTCD uses a long-window teacher to supervise the fast weights of a short-window student, where the hidden-state discrepancy between them offers a dense, self-supervised signal guiding the model to memorize the contextual information crucial for future token predictions. We focus on an in-place variant: In-Place TTCD (IP-TTCD), which uses the existing MLP parameters as the fast weights. Experiments on long-context language modeling tasks show IP-TTCD consistently outperforms DeltaNet, Gated DeltaNet, sliding-window attention, and TTT when pre-trained from scratch. Furthermore, IP-TTCD allows pre-trained transformer models to adapt their parameters during inference through continual pre-training, gaining long-context capabilities with only a lightweight architectural augmentation. Our results position TTCD as a step toward architectural continual learning.
- Abstract(参考訳): 効果的なロングコンテキストモデリングは、単に過去の情報を多く保持するだけでなく、後から意味のある情報を保存することである。
テストタイムトレーニング(TTT)は、長期コンテキストモデリングのためのオンラインパラメータ更新を行う魅力的なアプローチであるが、既存のTTTメソッドは、保持情報の将来の有用性を考慮せずに、再構築またはオンライン適応の目的を最適化するのみである。
本稿では, TTT フレームワークである \textbf{T}est-\textbf{T}ime \textbf{C}ontext \textbf{D}istillation (TTCD) を提案する。
具体的には、TTCDは、長い窓の教師を使って、短い窓の学生の太さを監督する。そこでは、それら間の隠れた状態の相違が、将来のトークン予測に不可欠なコンテキスト情報を記憶するための、密集した自己教師付き信号を提供する。
In-Place TTCD (IP-TTCD) は既存のMPPパラメータを高速ウェイトとして用いる。
長文言語モデリングタスクの実験は、IP-TTCDがゼロから事前訓練された場合、DeltaNet、Gated DeltaNet、スライディングウィンドウアテンション、TTを一貫して上回っていることを示している。
さらに、IP-TTCDは、トレーニング済みのトランスフォーマーモデルに対して、連続的な事前トレーニングを通じて推論中にパラメータを適応させることを可能にし、軽量なアーキテクチャ拡張のみで長いコンテキスト能力を得ることができる。
この結果から,TTCDをアーキテクチャ連続学習の一歩と位置づけた。
関連論文リスト
- Self-Guided Test-Time Training for Long-Context LLMs [16.160114043456215]
長いコンテキスト処理は、大規模言語モデルにとってますます重要になっている。
入力の長さが大きくなると、精度が劣化することが多く、モデルが疑問に最も関係のある証拠を特定し、利用するのに苦労していることを示している。
長期利用を改善するための有望な方法はテスト時間トレーニング(TTT)であり、テストコンテキストをインスタンス固有のパラメータ適応のトレーニング例として扱う。
本稿では,学習すべきエビデンスを識別するセルフガイドTT(S-TTT)を提案する。
論文 参考訳(メタデータ) (2026-07-10T13:45:56Z) - In-Place Test-Time Training [32.521599123691026]
In-Place Test-Time Training (In-Place TTT)は、テスト時間トレーニングを備えた大規模言語モデルをシームレスに提供するフレームワークである。
In-Place TTTは、ユビキタスブロックの最終射影行列を適応可能な高速ウェイトとして扱う。
我々は,TTTの汎用的な再構築目標を,次世代のToken-Predictionタスクに合わせた,理論的に整った目標に置き換える。
論文 参考訳(メタデータ) (2026-04-07T17:59:44Z) - Test time training enhances in-context learning of nonlinear functions [51.56484100374058]
テストタイムトレーニング(TTT)は、各予測に先立って指定されたパラメータを明示的に更新することで、モデル性能を向上させる。
本研究では,TTTとテキスト内学習(ICL)の組み合わせについて検討する。
論文 参考訳(メタデータ) (2025-09-30T03:56:44Z) - Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models [64.02612380298228]
最近の研究は、テストタイムトレーニング(TTT)として知られる特定のタスクに対して、テストタイムでモデルをトレーニングし続けるというアイデアを探求している。
本稿では,TTTがグローバルトレーニングよりもはるかに小さな分布内テスト誤差を達成できるモデルを提案する。
我々は、ImageNet上でスパースオートエンコーダをトレーニングすることで、モデルの主要な仮定を実証的に検証する。
論文 参考訳(メタデータ) (2025-09-29T09:24:52Z) - CTA: Cross-Task Alignment for Better Test Time Training [10.54024648915477]
テストタイムトレーニング(TTT)は、モデルロバスト性を高める効果的な方法として登場した。
CTA(Cross-Task Alignment)は,TTTを改善するための新しいアプローチである。
いくつかのベンチマークデータセット上で、最先端技術よりもロバスト性や一般化が大幅に向上したことを示す。
論文 参考訳(メタデータ) (2025-07-07T17:33:20Z) - Test-Time Training Provably Improves Transformers as In-context Learners [49.09821664572445]
テキスト内学習のための勾配に基づくTTTアルゴリズムについて検討する。
テストプロンプトで提供されるコンテキスト内デモに対して,トランスフォーマーモデルをトレーニングする。
経験的貢献として,TabPFNに対するTTTの有用性について検討した。
論文 参考訳(メタデータ) (2025-03-14T20:06:37Z) - Test-Time Training on Graphs with Large Language Models (LLMs) [68.375487369596]
グラフニューラルネットワーク(GNN)をトレーニングするための有望なアプローチとして,TTT(Test-Time Training)が提案されている。
テキスト分散グラフ(TAG)上でのLLM(Large Language Models)の優れたアノテーション能力に着想を得て,LLMをアノテータとしてグラフ上でのテスト時間トレーニングを強化することを提案する。
2段階のトレーニング戦略は、限定的でノイズの多いラベルでテストタイムモデルを調整するように設計されている。
論文 参考訳(メタデータ) (2024-04-21T08:20:02Z) - Deja vu: Contrastive Historical Modeling with Prefix-tuning for Temporal Knowledge Graph Reasoning [16.408149489677154]
ChapTERは、テンポラル推論のためのプレフィックスチューニングを備えたコントラスト歴史モデリングフレームワークである。
我々は4つのトランスダクティブと3つの数ショットインダクティブTKGRベンチマークでChapTERを評価した。
論文 参考訳(メタデータ) (2024-03-25T17:25:40Z) - Test-Time Training on Video Streams [66.63237260332984]
以前の作業では、テスト時にトレーニングされたモデルをさらに改善するための一般的なフレームワークとして、テスト時間トレーニング(TTT)が確立されていた。
TTTをストリーミング設定に拡張し、複数のテストインスタンスが時間順に到着します。
オンラインTTTは、現実世界の3つのデータセット上で、4つのタスクで固定モデルベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2023-07-11T05:17:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。