論文の概要: Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2608.03727v1
- Date: Tue, 04 Aug 2026 14:25:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.727333
- Title: Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies
- Title(参考訳): トラック4Action:世界中心の3Dトラッカーをヴィジュアル・ランゲージ・アクション・ポリシーに拡張
- Authors: Chenyi Wang, Xinkai Wang, Bokai Lin, Jialin Tian, Fucheng Zhang, Cewu Lu, Lixin Yang,
- Abstract要約: アクションラベルは、ロボットが模倣するように指示する視覚言語アクション(VLA)ポリシーを示すが、これらのコマンドが3D世界を変える方法ではない。
Track4Actionは、凍結した世界中心の3Dトラッカーから現在のVLAポリシーへの遷移を蒸留するフレームワークである。
- 参考スコア(独自算出の注目度): 41.36837763264988
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action labels tell a vision-language-action (VLA) policy which robot commands to imitate, but not how those commands change the 3D world. The aligned demonstration clip contains this missing supervision because its $K$ frame transitions record the geometry, motion, visibility, and camera change produced during the corresponding $K$ actions. We introduce Track4Action, a framework that distills this realized transition from a frozen world-centric 3D tracker into a current-observation VLA policy. During training, Track4World encodes the clip $V_{t:t+K}$ into a pooled tracker feature. Learnable track queries infer this feature from current VLA hidden states, match it in a shared space, and condition a flow-matching action head through a feature-wise gate. The tracker feature only defines the alignment target, so neither the clip nor the tracker is used at deployment. Track4Action reaches 82.3% on zero-shot LIBERO-Plus, improving the alignment-free variant by 7.6 points and LaMP by 3.0 points. It obtains 80.44% and 81.48% on the clean and randomized RoboTwin 2.0 splits, and 67.5% average success across four physical bimanual tasks, 25.0 points above the alignment-free variant. The gains across simulation and physical tasks support action-aligned 3D tracker features as privileged supervision for tracker-free VLA deployment. Our project page is available at https://wing0night.github.io/track4action-project-page.
- Abstract(参考訳): アクションラベルは、ロボットが模倣するように指示する視覚言語アクション(VLA)ポリシーを示すが、これらのコマンドが3D世界を変える方法ではない。
K$のフレーム遷移は、対応するK$アクションで生成された幾何学、動き、可視性、カメラの変更を記録するためである。
Track4Actionは、凍結した世界中心の3Dトラッカーから現在のVLAポリシーへの遷移を蒸留するフレームワークである。
トレーニング中、Track4Worldはクリップ$V_{t:t+K}$をプールされたトラッカー機能にエンコードする。
学習可能なトラッククエリは、現在のVLA隠蔽状態からこの機能を推測し、共有スペースでマッチングし、機能ワイドゲートを介してフローマッチングアクションヘッドを条件付ける。
トラッカー機能はアライメントターゲットのみを定義するため、デプロイ時にクリップもトラッカーも使用しない。
Track4Actionは、ゼロショットのLIBERO-Plusで82.3%に達し、アライメントのない変種を7.6ポイント、LaMPを3.0ポイント改善した。
クリーンでランダムなRoboTwin 2.0の分割で80.44%と81.48%を獲得し、4つの物理的バイマニュアルタスクで平均67.5%成功し、アライメントフリー版より25.0ポイント高い。
シミュレーションや物理タスクを越えたゲインは、トラッカーフリーなVLAデプロイメントのための特権的な監視として、アクション整列3Dトラッカー機能をサポートする。
私たちのプロジェクトページはhttps://wing0night.github.io/track4action-project-pageで公開されています。
関連論文リスト
- RRTrack: Robust and Recoverable Object 6D Pose Tracking for Dynamic Scenes [55.15267980622371]
RRTrackは効率的で復元可能なオブジェクト6Dポーズトラッカーである。
高速な動きと目標の消光によるロバストな追跡を可能にする。
実験の結果、RRTrackはADD-S ARを66.3%改善し、ADD-S AUCを65.7%改善した。
論文 参考訳(メタデータ) (2026-07-26T14:05:46Z) - ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation [63.617951135459016]
VLA(Vision-Language-Action)モデルでは、ロボット操作が約束されているが、既存のほとんどのポリシーは、現在の観測からアクションを直接回帰することで、反応する。
ELAN4Dは,将来のロボットキートラックによるポリシーを予測的時間的監視として強化する,実施中心の4D対応トレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-05-28T19:03:30Z) - Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation [58.21084913574353]
我々は,世界力学を暗黙的に理解したVLAモデルを実現するシンプルなアプローチであるPri4Rを紹介する。
Pri4Rは3Dトラックを予測する軽量なポイントトラックヘッドでVLAを強化している。
3Dポイントトラック予測は,アクションワールドダイナミクスを学習するための効果的な監視対象であることを示す。
論文 参考訳(メタデータ) (2026-03-02T07:23:53Z) - Multi-View 3D Point Tracking [67.21282192436031]
本稿では,複数のカメラビューを用いた動的シーンにおける任意の点の追跡を目的とした,データ駆動型マルチビュー3Dポイントトラッカーについて紹介する。
本モデルでは,現実的な数のカメラを用いて直接3次元対応を推定する。
我々は5K合成多視点Kubricシーケンスをトレーニングし、2つの実世界のベンチマークで評価する。
論文 参考訳(メタデータ) (2025-08-28T17:58:20Z) - RaTrack: Moving Object Detection and Tracking with 4D Radar Point Cloud [10.593320435411714]
レーダベースのトラッキングに適した革新的なソリューションであるRaTrackを紹介します。
本手法は,動き推定モジュールによって強化された動き分割とクラスタリングに焦点を当てる。
RaTrackは移動物体の追跡精度が優れており、最先端の技術をはるかに上回っている。
論文 参考訳(メタデータ) (2023-09-18T13:02:29Z) - ByteTrackV2: 2D and 3D Multi-Object Tracking by Associating Every
Detection Box [81.45219802386444]
マルチオブジェクトトラッキング(MOT)は、ビデオフレーム間のオブジェクトのバウンディングボックスとIDを推定することを目的としている。
低スコア検出ボックス内の真のオブジェクトをマイニングするための階層型データアソシエーション戦略を提案する。
3次元のシナリオでは、トラッカーが世界座標の物体速度を予測するのがずっと簡単である。
論文 参考訳(メタデータ) (2023-03-27T15:35:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。