論文の概要: No Time Like the Present: Agentic Test-Time Training for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.03441v1
- Date: Fri, 03 Jul 2026 15:54:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.620844
- Title: No Time Like the Present: Agentic Test-Time Training for LLM Agents
- Title(参考訳): 現在のような時間がない: LLMエージェントのエージェントテストタイムトレーニング
- Abstract要約: テストタイムトレーニング(TTT)は、モデルの重みを進化するタスク状態に適応させる方法を提供する。
マルチターンエージェントエピソードにおける連続的TTTについて検討し、各更新が後続のトレーニングテキストを生成するポリシーを変更する。
ATTTはALFWorldで最大5.0ポイント、SWE-bench Liteで4.9ポイント成功している。
- 参考スコア(独自算出の注目度): 12.744663781119806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents often degrade over long episodes: as trajectories grow, they revisit explored states, repeat failed actions, and lose strategies that previously worked. Test-time training (TTT) offers a way to adapt model weights to the evolving task state, but existing LLM TTT methods largely adapt once to a fixed input. We study continuous TTT in multi-turn agent episodes, where each update changes the policy that generates later training text. This creates a self-training loop that helps when new trajectory information appears, but can amplify drift when the agent gets stuck and repeatedly trains on similar text. We find that update-text repetition distinguishes these regimes and introduce Agentic Test-Time Training (aTTT), a token-level reweighting method that downweights the loss on tokens appearing in repeated $n$-grams from prior updates while leaving novel tokens fully weighted. To run such updates inside live episodes, we build a concurrent serving system using vLLM's runtime LoRA API, limiting overhead to 1.9$\times$ the no-TTT cost. aTTT improves success by up to 5.0 points on ALFWorld and 4.9 points on SWE-bench Lite. The gains concentrate where models already have task competence but drift over long trajectories, suggesting that aTTT mainly preserves existing competence rather than teaching new abilities.
- Abstract(参考訳): LLMエージェントは長いエピソードで劣化することが多く、軌道が大きくなるにつれて、彼らは州を再考し、失敗を繰り返し、以前はうまく機能していた戦略を失う。
テストタイムトレーニング(TTT)は、モデルの重みを進化するタスク状態に適応させる手段を提供するが、既存のLCM TTTメソッドは、固定入力に1度だけ適応する。
マルチターンエージェントエピソードにおける連続的TTTについて検討し、各更新が後続のトレーニングテキストを生成するポリシーを変更する。
これは、新しい軌道情報が現れたときに役立つ自己学習ループを生成するが、エージェントが立ち往生し、同様のテキストで繰り返し訓練するときにドリフトを増幅することができる。
これは、新しいトークンを完全に重み付けしながら、以前の更新からn$-gramの繰り返しに現れるトークンの損失を下げるトークンレベル再重み付け手法である。
ライブエピソード内でこのような更新を実行するために、vLLMのランタイムであるLoRA APIを使用して並列サービスシステムを構築し、オーバーヘッドを1.9$\times$ no-TTTコストに制限します。
aTTTはALFWorldで最大5.0ポイント、SWE-bench Liteで4.9ポイント向上する。
この利益は、モデルが既にタスク能力を持っているが、長い軌道上を漂流している場所に集中しており、aTTTは新たな能力を教えるのではなく、主に既存の能力を維持することを示唆している。
関連論文リスト
- Rethinking Expressivity and Efficiency in Test-Time Training [26.484618002837635]
テストタイムトレーニング(TTT)は、推論中に継続的に重みを更新することで、長時間のコンテキスト処理を可能にする。
チャンクワイズ近似のハードウェア効率とトーケン毎の更新ダイナミクスの表現率のバランスをとるために,E$2$-TTTを提案する。
E$2$-TTTは効率的なチャンクワイド手法のトレーニングスループットと一致し、表現率と効率を効果的に調整することを示した。
論文 参考訳(メタデータ) (2026-08-21T17:12:28Z) - Modular TTT: Rethinking Test-Time Training as Composable Modules [35.87120372962587]
テストタイムトレーニング(TTT)は、内部学習ルールによって高速ウェイトが更新されるオンライン学習問題としてシーケンスモデリングを考察する。
既存のアプローチは通常、各変種を個別にハードコードする。
本稿では,内部学習者を有向非巡回グラフとして表現するフレームワークであるModular TTTを提案する。
論文 参考訳(メタデータ) (2026-08-07T11:11:43Z) - Learning What to Remember: Test-Time Training via Context Distillation [72.10421333095852]
テストタイムトレーニング(TTT)は、長期コンテキストモデリングのためのオンラインパラメータ更新を実行する魅力的なアプローチである。
textbfTest-textbfTime textbfContext textbfDistillation (TTCD)を提案する。
論文 参考訳(メタデータ) (2026-08-03T04:06:06Z) - When Does Continual Learning Require Learning [68.55508958298942]
継続的学習は単一の能力ではないことを示す。
環境変化の異なるパターンは、根本的に異なる更新動作を必要とする。
それぞれの手法が成功するか、失敗するかを理解することが、より強力な継続的学習システムの設計を導くことを願っている。
論文 参考訳(メタデータ) (2026-07-08T18:27:40Z) - Learning, Fast and Slow: Towards LLMs That Adapt Continually [83.9214051113102]
大規模言語モデル(LLM)は、パラメータを更新することで下流タスクのために訓練される。
高速スロートレーニング(FST)は、推論タスクのスローラーニング(RL)よりも最大3倍のサンプリング効率を持つ。
論文 参考訳(メタデータ) (2026-05-12T17:58:20Z) - In-Place Test-Time Training [32.521599123691026]
In-Place Test-Time Training (In-Place TTT)は、テスト時間トレーニングを備えた大規模言語モデルをシームレスに提供するフレームワークである。
In-Place TTTは、ユビキタスブロックの最終射影行列を適応可能な高速ウェイトとして扱う。
我々は,TTTの汎用的な再構築目標を,次世代のToken-Predictionタスクに合わせた,理論的に整った目標に置き換える。
論文 参考訳(メタデータ) (2026-04-07T17:59:44Z) - Unsupervised Layer-Wise Dynamic Test Time Adaptation for LLMs [12.428201810981149]
大規模言語モデル(LLM)のためのテスト時適応(TTA)は、デプロイ時に利用可能な信号を使用して、推論時にモデルパラメータを更新する。
本報告では, 教師なし, サンプル特異的なTTAという, 一般的だが未探索のシステムに焦点を当てる。
本稿では,TTA強度をプロンプト表現,LLM構造,適応ステップの関数として明示的に変調するフレームワークである層ワイド動的テスト時間適応を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:22:14Z) - Test-Time Training Provably Improves Transformers as In-context Learners [49.09821664572445]
テキスト内学習のための勾配に基づくTTTアルゴリズムについて検討する。
テストプロンプトで提供されるコンテキスト内デモに対して,トランスフォーマーモデルをトレーニングする。
経験的貢献として,TabPFNに対するTTTの有用性について検討した。
論文 参考訳(メタデータ) (2025-03-14T20:06:37Z) - A Layer Selection Approach to Test Time Adaptation [0.2968738145616401]
テスト時間適応(TTA)は、推論中に事前訓練されたモデルを新しいドメインに適応させることによって、分散シフトの問題に対処する。
提案するGALAは,TTA中に最も有益な更新を行うための新しいレイヤ選択基準である。
論文 参考訳(メタデータ) (2024-04-04T19:55:11Z) - Enhancing Plasticity for First Session Adaptation Continual Learning [20.62749699589017]
クラスインクリメンタルラーニング(PLASTIC)における塑性強化テスト時間適応の導入
PLASTICはモデル安定性を維持しながら可塑性をCILに再蓄積する。
従来型と最先端のPTMベースのCILアプローチを一貫して上回ります。
論文 参考訳(メタデータ) (2023-10-17T13:06:39Z) - Test-Time Training on Video Streams [66.63237260332984]
以前の作業では、テスト時にトレーニングされたモデルをさらに改善するための一般的なフレームワークとして、テスト時間トレーニング(TTT)が確立されていた。
TTTをストリーミング設定に拡張し、複数のテストインスタンスが時間順に到着します。
オンラインTTTは、現実世界の3つのデータセット上で、4つのタスクで固定モデルベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2023-07-11T05:17:42Z) - Improving Representational Continuity via Continued Pretraining [76.29171039601948]
トランスファーラーニングコミュニティ(LP-FT)は、ナイーブトレーニングやその他の継続的な学習方法よりも優れている。
LP-FTは、リアルタイム衛星リモートセンシングデータセット(FMoW)における忘れを減らす。
LP-FTの変種は、NLP連続学習ベンチマークで最先端の精度を得る。
論文 参考訳(メタデータ) (2023-02-26T10:39:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。