論文の概要: TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning
- arxiv url: http://arxiv.org/abs/2607.08283v2
- Date: Wed, 15 Jul 2026 15:46:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 14:31:40.666677
- Title: TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning
- Title(参考訳): TFP:視覚運動学習のための一時条件付きメモリフュージョンポリシー
- Authors: Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan,
- Abstract要約: Vision-Language-Action(VLA)ポリシーは、$_0.5$やOpenVLAのような多くのタスクでうまく機能するが、リアクティブであることが多い。
このようなタスクは、メモリだけでなく、動的に認識される信念の更新も必要である、と我々は主張する。
- 参考スコア(独自算出の注目度): 11.149498165285491
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision--Language--Action (VLA) policies such as $π_{0.5}$ and OpenVLA perform well on many manipulation tasks, but they are often reactive: the next action is predicted from the current observation, instruction, and proprioceptive state. This assumption breaks down in stage-dependent manipulation, where visually similar states may require different actions depending on latent task progress and previous interaction outcomes. We argue that such tasks require not only memory, but dynamics-aware belief updates: the policy should preserve task progress during stable or occluded phases and revise its belief near contact, release, or subgoal transitions. We introduce Temporally Conditioned Memory-Fusion Policies (TFP), a lightweight memory-action framework for VLA backbones. TFP maintains an episode-local task-progress belief with Liquid Time-Constant dynamics and injects the updated belief directly into the flow-matching action decoder through adaptive modulation. This lets temporally accumulated context shape the generated action chunk, rather than serving only as passive history context. With a 3.3B-parameter model, TFP improves the average success rate from \(96.9\%\) to \(98.75\%\) on LIBERO and from \(91.4\%\) to \(93.77\%\) on LIBERO-plus. On the memory-focused MIKASA ShellGameTouch diagnostic, TFP achieves success up to \(75.0\%\). Mechanistic analyses show that write-gain changes near manipulation events are about \(6\times\) larger than far non-event phases, and hidden-state interventions show that the belief causally modulates generated action chunks. These results suggest that compact, event-sensitive memory dynamics can improve VLA policies under occlusion, visual perturbation, and stage-dependent task structure.
- Abstract(参考訳): π_{0.5}$やOpenVLAのようなVLA(Vision-Language-Action)のポリシーは多くの操作タスクでうまく機能するが、それらはしばしば反応し、次のアクションは現在の観察、指示、受容状態から予測される。
この仮定はステージ依存的な操作で分解され、視覚的に類似した状態は、潜在タスクの進行と以前の相互作用の結果によって異なるアクションを必要とする可能性がある。
このようなタスクは記憶だけでなく、動的に認識される信念の更新を必要としている。このポリシーは、安定あるいは排除されたフェーズにおけるタスクの進捗を保ち、接触、解放、またはサブゴール遷移の近くでその信念を見直しなければならない。
VLAバックボーンのための軽量メモリアクションフレームワークであるTFP(Temporally Conditioned Memory-Fusion Policies)を導入する。
TFPは、リキッド・タイム・コンスタント・ダイナミクスによるエピソードローカルなタスク・プログレス・信念を維持し、適応変調によりフローマッチング・アクション・デコーダに直接更新された信念を注入する。
これにより、受動的履歴コンテキストとしてのみ機能するのではなく、時間的に蓄積されたコンテキストが生成されたアクションチャンクを形成することができる。
3.3Bパラメータモデルにより、TFPは、LIBERO では \(96.9\%\) から \(98.75\%\) に、LIBERO では \(91.4\%\) から \(93.77\%\) に改善する。
メモリ中心のMIKASA ShellGameTouch診断では、TFPは最大で(75.0\%\)の成功を達成する。
メカニカル分析は、操作事象の近くの書き込みゲインの変化は、遠くない非活動段階よりも約(6\times\)大きいことを示し、隠れ状態の介入は、信念が生成されたアクションチャンクを因果的に調節することを示している。
これらの結果は、コンパクトでイベントに敏感なメモリダイナミクスが、閉塞、視覚摂動、ステージ依存タスク構造の下でのVLAポリシーを改善することを示唆している。
関連論文リスト
- KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies [14.253600207124194]
メモリはこの曖昧さに対処し、ポリシーが実行履歴からタスクの進捗を推測できるようにする。
本稿では,VLA ポリシーのタスク関連状態変化に関連するキネマティクスを自動的に保存する,軽量なプラグインメモリフレームワーク KEMO を提案する。
830ステップから2846ステップ(28秒から95秒)の軌道長と2~6サブタスクにまたがる実世界のマルチアーム操作タスクにおけるKEMOの評価を行った。
論文 参考訳(メタデータ) (2026-06-22T16:57:43Z) - EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies [68.812675280427]
EventVLAは、疎視的エビデンスメモリの概念に基づいて開発されたエンドツーエンドフレームワークである。
KEMは、VLAの潜伏した埋め込みから将来の確率を直接予測し、スパースでタスククリティカルな視覚イベントを自律的にキャプチャして保存する。
対話型視覚的エビデンスで非マルコフ操作タスクを評価するための診断ベンチマークであるRoboTwin-MeMを提案する。
論文 参考訳(メタデータ) (2026-06-18T11:11:37Z) - Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation [5.524438437366922]
変形可能なオブジェクト操作のための位相条件付き力覚フレームワークを提案する。
FiLM条件のACTエンコーダは、現在のタスクフェーズに基づいて特徴抽出を変調する。
視覚、力、ポーズフィードバックを融合させた多モード位相予測器は、視覚単独では見えない接触障害をリアルタイムで推定する。
論文 参考訳(メタデータ) (2026-05-28T05:59:53Z) - From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model [76.88595728131288]
VLA(Vision-Language-Action)モデルは、分散シフト時にしばしば性能劣化に悩まされる。
時間的コヒーレントな行動表現の学習を通じて堅牢な操作を容易にするフレームワークである textbfBehaviorVLA を提案する。
RoboTwin 2.0、LIBERO、CALVINの実験では、最先端の成功率は58%、98%、および4.36(Avg.Len)である。
論文 参考訳(メタデータ) (2026-05-21T16:14:19Z) - VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models [27.12266806191131]
VLA(Vision-Language-Action)モデルは、ロボットが複雑な命令駆動タスクを実行できるように、急速に高度なインボディードインテリジェンスを備えている。
現在のアプローチはしばしば、操作をサポートする視覚的にスパースで構造的に重要な領域を創り出し、初期のタスクフェーズの不安定な振る舞いを引き起こす。
提案手法であるVLA-IAP(Interaction-Aligned Pruning)では,構造的アンカーを保存するための幾何学的事前メカニズムと動的スケジューリング戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T09:33:05Z) - VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory [31.464584758455356]
VPWEMは、ワーキングメモリとエピソードメモリを備えた非マルコフヴィジュモータ政策である。
動作生成には短期情報とエピソードワイド情報の両方を使用し、1ステップあたりのメモリと計算がほぼ一定である。
論文 参考訳(メタデータ) (2026-03-05T07:52:50Z) - Gated Differentiable Working Memory for Long-Context Language Modeling [80.27483324685434]
本稿では,Gdwm(Gated Differentiable Working Memory)を提案する。
ZeroSCROLLS と LongBench v2 の実験では、Gdwm は均一なベースラインよりも 4$times$ の勾配ステップで同等または優れたパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-01-19T10:00:33Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。