論文の概要: Test-Time Training as Residual Memory for Robot Policies
- arxiv url: http://arxiv.org/abs/2610.04701v1
- Date: Sat, 03 Oct 2026 18:26:25 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:14:59.527658
- Title: Test-Time Training as Residual Memory for Robot Policies
- Title(参考訳): ロボット政策における残差記憶としてのテストタイムトレーニング
- Abstract要約: テストタイムトレーニング(TTT)をTTTメモリとして利用するTTT-RMを紹介する。
TTT-RMは、過去の表現を現在の観測と検索メモリから再構築する履歴復号器を学習する。
メモリ集約型シミュレーションベンチマークと実世界のタスクの実験は、TTT-RMが複数のメモリ設計において一貫して改善されていることを示している。
- 参考スコア(独自算出の注目度): 27.439388903252013
- License:
- Abstract: Memory is essential for long-horizon robotic manipulation, where successful actions may depend on past events that are no longer recoverable from the current observation. As episodes grow longer, however, retaining the full history becomes increasingly costly, creating a fundamental scalability challenge for memory-augmented policies. Existing approaches address this challenge by either storing selected past observations in a bounded memory bank or compressing interaction history into a fixed-size parametric state through Test-Time Training (TTT). Yet these formulations do not explicitly distinguish between historical information that can already be recovered from the policy's current context and information that must persist beyond it. We introduce TTT-RM, which repurposes TTT as Residual Memory, using fast weights not to generically compress history but to complement a bounded memory bank by preserving task-relevant historical information that cannot be recovered from the policy's current context. Concretely, TTT-RM learns a history decoder that reconstructs historical representations from the current observation and retrieved memory. The resulting reconstruction residual captures what this context fails to explain and serves as the learning target for TTT. The TTT slow weights are optimized against this residual target so that online fast-weight updates learn to encode complementary historical information over time. The fast-weight state is then queried to produce a residual memory representation that conditions action generation. Extensive experiments on memory-intensive simulation benchmarks and real-world tasks show that TTT-RM consistently improves across multiple memory designs, outperforms diverse baselines, and supports sustained execution on a three-minute, eight-stage stowing task.
- Abstract(参考訳): 記憶は、現在の観測から回復できない過去の出来事に依存するかもしれない、長期にわたるロボット操作にとって不可欠である。
しかし、エピソードが長くなるにつれて、完全な履歴を維持するのにますますコストがかかり、メモリ拡張ポリシーの基本的なスケーラビリティの課題が生まれる。
既存のアプローチでは、選択された過去の観測を境界メモリバンクに格納するか、テストタイムトレーニング(TTT)を通じて、相互作用履歴を固定サイズのパラメトリック状態に圧縮するか、この課題に対処している。
しかし、これらの定式化は、政策の現在の状況から既に回収できる歴史的情報と、それを超えて持続しなければならない情報とを明確に区別するものではない。
本稿では,TTT をResidual Memory として再利用する TTT-RM を導入し,履歴を汎用的に圧縮するのではなく,政策の現在の状況から復元できないタスク関連履歴情報を保存して,境界メモリバンクを補完する。
具体的には、TTT-RMは、現在観測されている記憶から歴史的表現を再構築する履歴復号器を学習する。
結果として得られた再構成残差は、このコンテキストが説明できないものをキャプチャし、TTTの学習ターゲットとして機能する。
TTTのスローウェイトは、この残留目標に対して最適化されているため、オンラインの高速アップデートは、時間の経過とともに補完的な履歴情報をエンコードする。
その後、高速な状態がクエリされ、アクション生成を条件とした残メモリ表現が生成される。
メモリ集約型シミュレーションベンチマークと実世界のタスクに関する大規模な実験は、TTT-RMが複数のメモリ設計を一貫して改善し、多様なベースラインを上回り、3分間の8段階のストーイングタスクで持続的な実行をサポートすることを示している。
関連論文リスト
- Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents [44.553954363902356]
エージェントメモリシステムは、過去の経験を再利用して将来のパフォーマンスを改善する。
既存の設計のほとんどは、タスクが完了すると書き込み時にメモリをキュレートする。
即時要求に合わせたタスク適応ペイロードを開発する。
我々のJust-in-Time Memory(JitMem)は、学習した書き込み時間メモリメソッドと同様に、無メモリエージェントよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-09-23T04:14:53Z) - Memory Control Signals Emerge Before Action in Long Horizon Agents [55.84813053778976]
各エージェントアクションの直前に隠された状態を調べ、圧縮とリコールの要求がモデルの内部表現にすでにエンコードされていることを確認する。
本研究では,状態誘導圧縮と外部エビデンス検索を組み合わせたPreaction Memory with Evidence Retrieval (PaMER)を提案する。
論文 参考訳(メタデータ) (2026-09-23T03:23:34Z) - MARCH: Scaling Recurrent Memory with Content-Routed State Anchors [41.39470291507015]
トランスフォーマーはその強い長文検索能力の多くを、コンテキスト長で成長するトークンレベルのメモリに負っている。
リカレントな代替手段は、履歴全体を固定サイズの状態に圧縮することで効率的な復号化を提供する。
メモリ・アンカー・ルーティング(Memory-Anchor Routing across Context History, MARCH)は、状態空間モデルを固定次元を超えて効果的にスケールするネットワークアーキテクチャである。
論文 参考訳(メタデータ) (2026-08-12T13:45:01Z) - Learning What to Remember: Test-Time Training via Context Distillation [72.10421333095852]
テストタイムトレーニング(TTT)は、長期コンテキストモデリングのためのオンラインパラメータ更新を実行する魅力的なアプローチである。
textbfTest-textbfTime textbfContext textbfDistillation (TTCD)を提案する。
論文 参考訳(メタデータ) (2026-08-03T04:06:06Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs [17.526686616588794]
大きな言語モデル(LLM)は、長い時間をかけてユーザーと対話することがますます期待されている。
LLMは過去のすべてのインタラクションを保持することができず、履歴情報の保存、更新、検索には長期記憶管理が不可欠である。
REALは長期会話記憶を時間的かつ信頼性に配慮したプロパティグラフとして構成する。
論文 参考訳(メタデータ) (2026-06-09T10:53:10Z) - STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments [63.39393178045112]
モバイルエージェントは即座に反応制御を行うが、メモリを必要とする現実的なロングホライゾンタスクでは頻繁に失敗する。
制御可能な仮想環境を通じて,モバイルエージェントの明示的なメモリをトレーニングするフレームワークSTAMPを提案する。
結果のStampGUIエージェントは、メモリワールドベンチマークに新たなハイウォーターマークを設定し、例外的なメモリ精度とタスクレジリエンスを実証します。
論文 参考訳(メタデータ) (2026-05-28T04:00:13Z) - All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning [53.72709564555407]
Memoは、強化学習のためのトランスフォーマーベースのアーキテクチャとトレーニングのレシピである。
トレーニング中のモデルの入力と周期的な要約トークンをインターリーブすることで、メモリの生成と検索を組み込む。
グリッドワールドメタRLベンチマークとマルチオブジェクトナビゲーションタスクにおけるMemoの有効性を,フォトリアリスティック屋内環境で実証する。
論文 参考訳(メタデータ) (2025-10-22T16:24:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。