論文の概要: Self-Guided Test-Time Training for Long-Context LLMs
- arxiv url: http://arxiv.org/abs/2607.09415v1
- Date: Fri, 10 Jul 2026 13:45:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.854749
- Title: Self-Guided Test-Time Training for Long-Context LLMs
- Title(参考訳): 長期LLMのためのセルフガイドテストタイムトレーニング
- Abstract要約: 長いコンテキスト処理は、大規模言語モデルにとってますます重要になっている。
入力の長さが大きくなると、精度が劣化することが多く、モデルが疑問に最も関係のある証拠を特定し、利用するのに苦労していることを示している。
長期利用を改善するための有望な方法はテスト時間トレーニング(TTT)であり、テストコンテキストをインスタンス固有のパラメータ適応のトレーニング例として扱う。
本稿では,学習すべきエビデンスを識別するセルフガイドTT(S-TTT)を提案する。
- 参考スコア(独自算出の注目度): 16.160114043456215
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context processing has become increasingly important for large language models (LLMs), but simply extending the context window does not guarantee effective utilization of long inputs. As input length grows, accuracy often degrades, indicating that models still struggle to identify and use the evidence most relevant to a question. A promising way to improve long-context utilization is test-time training (TTT), which treats the test context as a training example for instance-specific parameter adaptation. However, applying TTT to the entire long context is prohibitively expensive, while adapting on randomly sampled spans introduces severe noise. Because most spans in a long context are irrelevant to the specific question, training on them may even degrade the base model's performance. Our preliminary study shows that TTT is highly sensitive to training-span quality: on LongBench-v2, TTT on randomly sampled spans hurts performance, whereas TTT on oracle spans substantially improves it. Motivated by this, we propose a simple method, Self-Guided TTT (S-TTT): before adaptation, the model identifies the evidence spans it should learn from, and the standard language-modeling training objective is applied only to those selected spans. On two challenging long-context reasoning benchmarks, LongBench-v2 and LongBench-Pro, S-TTT improves accuracy for both Qwen3-4B-Thinking-2507 and Llama-3.1-8B-Instruct, achieving up to a 15% relative improvement.
- Abstract(参考訳): 長文処理は大規模言語モデル(LLM)ではますます重要になっているが、コンテキストウィンドウを拡張するだけでは、長い入力の有効利用が保証されない。
入力の長さが大きくなると、精度が劣化することが多く、モデルが疑問に最も関係のある証拠を特定し、利用するのに苦労していることを示している。
長期利用を改善するための有望な方法はテスト時間トレーニング(TTT)であり、テストコンテキストをインスタンス固有のパラメータ適応のトレーニング例として扱う。
しかし、TTTを長い文脈全体に適用することは違法に高価であるが、ランダムにサンプリングされたスパンに適応すると、深刻なノイズが発生する。
長いコンテキストのほとんどのスパンは特定の問題とは無関係であるため、それらのトレーニングはベースモデルのパフォーマンスを低下させるかもしれない。
予備研究により,TTTはトレーニングスパンの品質に非常に敏感であることが明らかとなった。LongBench-v2では,ランダムサンプリングスパンのTTTは性能を損なうが,オラクルスパンのTTTは著しく改善する。
そこで本研究では,S-TTT (Self-Guided TTT) という簡単な手法を提案する。適応前に,モデルが学習すべきエビデンスを識別し,標準言語モデリング学習目標を選択したスパンにのみ適用する。
長文推論ベンチマークのLongBench-v2とLongBench-Proでは、S-TTTはQwen3-4B-Thinking-2507とLlama-3.1-8B-Instructの両方の精度を改善し、15%の相対的な改善を実現している。
関連論文リスト
- How to Train Long-Context Language Models (Effectively) [75.5418485597276]
言語モデル(LM)の継続学習と教師付き微調整(SFT)を行い,長文情報の有効利用について検討した。
コードリポジトリと書籍は長いデータの優れた情報源であることがわかったが、それらと高品質の短文データを組み合わせることが不可欠である。
最終モデルであるProLong-8Bは、128Kの同様のサイズのモデル間で、最先端の長文性能を示す。
論文 参考訳(メタデータ) (2024-10-03T16:46:52Z) - Effective Long-Context Scaling of Foundation Models [90.57254298730923]
最大32,768個のトークンの効率的なコンテキストウィンドウをサポートする長文LLMを提示する。
我々のモデルは、ほとんどの通常のタスクにおいて一貫した改善を達成し、Llama 2よりも長いコンテキストタスクを大幅に改善します。
論文 参考訳(メタデータ) (2023-09-27T21:41:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。