論文の概要: TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks
- arxiv url: http://arxiv.org/abs/2608.24101v3
- Date: Tue, 01 Sep 2026 23:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 16:10:20.171325
- Title: TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks
- Title(参考訳): TrAct:ビジュアルトラックを用いたブリッジロボット制御と視覚予測
- Abstract要約: 制御と予測の中間インタフェースとして視覚トラックを用いた世界モデルに基づくロボット意思決定フレームワークTrActを提案する。
TrActは3つのコンポーネントから構成される: ビジョン・ランゲージ・アクション・アンド・トラックモデル(VLAT)は、現在の観察と言語指導から候補行動と対応する視覚トラックを共同で予測し、トラック条件付き世界モデル(TWM)は、提案されたトラックで条件付けられた将来の視覚結果を予測する。
- 参考スコア(独自算出の注目度): 22.702826122425268
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robot actions are inherently embodiment-specific and only weakly aligned with image-space visual changes, limiting their effectiveness as conditioning signals for robot world models. In contrast, visual tracks provide an embodiment-agnostic representation of how task-relevant points move through a scene, offering dense image-space guidance for accurate and spatially precise future video prediction. Building on this observation, we propose TrAct, a world-model-based robot decision-making framework that uses visual tracks as an intermediate interface between control and prediction. TrAct consists of three components: a Vision-Language-Action-and-Track model (VLAT) that jointly predicts candidate actions and corresponding visual tracks from the current observation and language instruction; a track-conditioned world model (TWM) that predicts future visual outcomes conditioned on the proposed tracks; and a vision-language reward model (VLAC) that scores the predicted outcomes. At inference time, VLAT generates candidate action-track pairs, TWM rolls out their visual consequences, and VLAC selects the track whose predicted outcome best satisfies the instruction; the action paired with the selected track is then executed by the robot. Experiments on the proposed LIBERO-INTEGRAL benchmark and real-world Franka manipulation show that TrAct improves success rates from 27% to 55% in simulation and from 49% to 76% on real-world tasks compared with the strong VLA baseline $π_{0.5}$. Furthermore, TWM consistently improves video prediction quality over the action-conditioned world model (AWM). These results demonstrate that visual tracks provide an effective shared interface between robot control and visual prediction, enabling more accurate world modeling and stronger robot generalization.
- Abstract(参考訳): ロボットの行動は本質的に具体的であり、画像空間の視覚的変化と弱く一致しているだけであり、ロボットの世界モデルの条件付け信号としての有効性を制限している。
対照的に、視覚トラックは、タスク関連ポイントがシーンをどう移動するかの具現化に依存しない表現を提供し、高精度で空間的に正確な将来の映像予測のための高密度な画像空間ガイダンスを提供する。
本研究は,ビジュアルトラックを制御と予測の中間インタフェースとして利用する世界モデルに基づくロボット意思決定フレームワークTrActを提案する。
TrActは3つのコンポーネントから構成される: ビジョン・ランゲージ・アクション・アンド・トラックモデル(VLAT)は、現在の観察と言語指導から候補行動と対応する視覚トラックを共同で予測し、トラック条件付き世界モデル(TWM)は、提案されたトラックで条件付けられた将来の視覚結果を予測する。
推論時に、VLATは、候補となるアクショントラックペアを生成し、TWMはその視覚効果をロールアウトし、VLACは、予測結果が最も満足するトラックを選択し、選択されたトラックとペアのアクションをロボットによって実行する。
提案したLIBERO-INTEGRALベンチマークと実世界のFranka操作の実験により、TrActは27%から55%に改善し、実世界のタスクでは49%から76%に改善した。
さらに、TWMはアクション条件付き世界モデル(AWM)よりもビデオ予測品質を一貫して改善する。
これらの結果は、視覚トラックがロボット制御と視覚予測の効果的な共有インターフェースを提供し、より正確な世界モデリングとより強力なロボットの一般化を可能にしていることを示している。
関連論文リスト
- LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - $τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation [45.040666672458634]
政策学習,映像予測,行動評価を統合した統合ビデオアクション世界モデルを提案する。
このモデルは、実際のロボット遠隔操作で約27,300ドル(約2万2000円)で訓練されている。
論文 参考訳(メタデータ) (2026-05-31T05:35:36Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - Grounded World Model for Semantically Generalizable Planning [94.53923128709965]
我々は、視覚言語対応の潜在空間において、グラウンドドワールドモデル(GWM)を学習する。
提案された各アクションは、タスク命令に対する将来の結果がどの程度近いかに基づいてスコアされる。
提案したWISERベンチマークでは、GWM-MPCはテストセットで87%の成功率を達成した。
論文 参考訳(メタデータ) (2026-04-13T17:25:41Z) - AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps [7.710034405765985]
AIMは、明示的な空間的インターフェースを通じてこのギャップを橋渡しする意図認識の統一世界行動モデルである。
事前訓練されたビデオ生成モデルに基づいて構築されたAIMは、共有変換器アーキテクチャ内の将来の観測と値マップを共同でモデル化する。
RoboTwin 2.0ベンチマークの実験では、AIMは平均94.0%の成功率に達し、以前の統合された世界行動ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-04-13T07:48:58Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [89.44024245194315]
視覚言語行動モデル(VLA)に明示的な視覚連鎖(CoT)推論を組み込む手法を提案する。
視覚およびアクショントークンの理解と生成が可能な最先端の7B VLAであるCoT-VLAを紹介する。
実験の結果,CoT-VLAは実世界の操作タスクでは17%,シミュレーションベンチマークでは6%,最先端のVLAモデルでは6%,高い性能を示した。
論文 参考訳(メタデータ) (2025-03-27T22:23:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。