論文の概要: FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.14739v1
- Date: Thu, 16 Jul 2026 09:04:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.052357
- Title: FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
- Title(参考訳): FoMoVLA:ビジョン・ランゲージ・アクションモデルのための視覚的視点とモーションガイダンスのブリッジ
- Authors: Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan,
- Abstract要約: 既存の視覚的手法は将来の視覚状態を予測するが、明確な動作誘導は欠如している。
本稿では,VLA表現を明示的な時間的監督で拡張するフレームワークであるFoMoVLAを提案する。
- 参考スコア(独自算出の注目度): 21.446753234768824
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have achieved impressive results in visuomotor policy learning, yet remain fundamentally reactive, mapping current observations and language to actions without explicit forward prediction of world dynamics. Existing visual foresight methods predict future visual states but lack explicit motion guidance: they show where to go but not how to get there. We argue that future feature prediction and sparse point tracking are naturally complementary: the former provides the goal state, while the latter captures the continuous motion path toward it. We propose FoMoVLA, a framework that augments VLA representations with explicit spatio-temporal supervision by jointly learning future feature foresight and sparse 2D point tracking, enhancing the continuous action policy. FoMoVLA introduces compact foresight tokens to decode future feature states, decodes sparse temporal 2D point trajectories to model compact geometric motion, and couples both through a lightweight future-conditioned cross-attention module that enables consistent reasoning between anticipated states and point dynamics. Extensive experiments on LIBERO, RoboCasa GR-1 Tabletop, and LIBERO-Plus demonstrate state-of-the-art performance and strong zero-shot generalization. Project page is available at https://liauto-research.github.io/FoMoVLA.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、ヴィジュモータ政策学習において印象的な結果を得たが、基本的には反応し、現在の観察と言語を、世界ダイナミクスの明示的な前方予測なしで行動にマッピングする。
既存の視覚的監視手法は将来の視覚状態を予測しているが、明確な動作指示がない。
将来の特徴予測とスパース点追跡は自然に相補的であり、前者は目標状態を提供し、後者はそれに向けた連続的な動き経路を捉えている。
本稿では,VLA表現を明示的な時空間的監視で強化するフレームワークであるFoMoVLAを提案する。
FoMoVLAは、将来の特徴状態をデコードするために、コンパクトなフォレストトークンを導入し、コンパクトな幾何学的運動をモデル化するためにスパースな時間的2Dポイントトラジェクトリをデコードする。
LIBERO, RoboCasa GR-1 Tabletop, LIBERO-Plusの大規模実験は、最先端性能と強力なゼロショット一般化を実証している。
プロジェクトページはhttps://liauto-research.github.io/FoMoVLAで公開されている。
関連論文リスト
- LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model [16.87741001074065]
VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転のための有望なフレームワークとして登場した。
近年、世界モデリングによる濃密な視覚監視を取り入れようとする試みは、しばしばピクセルレベルの画像再構成を過度に強調している。
自律運転のための遅延視覚表現拡張VLAフレームワークであるLVDriveを提案する。
論文 参考訳(メタデータ) (2026-05-21T07:31:49Z) - Learning Vision-Language-Action World Models for Autonomous Driving [15.103497388527943]
VLA(Vision-Language-Action)モデルは最近、エンドツーエンドの自動運転において顕著な進歩を遂げている。
VLAモデルは時相力学と世界整合性の明示的なモデリングを欠いていることが多い。
VLA-World(VLA-World)は、予測的想像力と反射的推論を統一する、シンプルで効果的なVLA世界モデルである。
論文 参考訳(メタデータ) (2026-04-10T07:38:05Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model [73.03346643967309]
我々は、効果的な共同運動予測モデルには、時間的連続性と視覚的条件による監督的疎結合の両方が必要であると論じる。
FutureVLAは、視覚情報と運動情報を最初に分離することで、関節振動子埋め込みを抽出するように設計されている。
訓練後の段階において、我々は遅延埋め込みアライメント戦略を採用し、様々な下流VLAモデルによりこれらの時間的先行を内部化することができる。
論文 参考訳(メタデータ) (2026-03-11T12:39:55Z) - HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models [39.350965975615104]
HiF-VLAは、双方向の時間的推論に動きを利用する統一的なフレームワークである。
過去のダイナミクスを後見の先行を通してエンコードし、前見の推論を通して将来の動きを予測し、後見の変調された共同専門家を通して統合する。
現実世界の長距離操作タスクにおいて大幅な改善を実現し、実用的なロボット設定においてその幅広い効果を実証している。
論文 参考訳(メタデータ) (2025-12-10T18:59:32Z) - Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution [96.25314747309811]
将来的なシーンの進化と軌道計画を共同でモデル化する,新たなエンドツーエンドフレームワークであるSeerDriveを紹介する。
本手法はまず,周辺環境の動態を予測するために,将来の鳥眼ビュー(BEV)の表現を予測する。
2つの重要な要素がこれを可能にする:(1)予測されたBEV機能を軌道プランナーに注入する将来対応計画、(2)反復的なシーンモデリングと車両計画。
論文 参考訳(メタデータ) (2025-10-13T07:41:47Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving [19.81442567260658]
本稿では,VLAを画像で考えることのできる視覚的テンポラルTフレームワークを提案する。
nuScenes と NAVSIM では、FSDrive は精度を改善し、衝突を減らす。
論文 参考訳(メタデータ) (2025-05-23T09:55:32Z) - CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [89.44024245194315]
視覚言語行動モデル(VLA)に明示的な視覚連鎖(CoT)推論を組み込む手法を提案する。
視覚およびアクショントークンの理解と生成が可能な最先端の7B VLAであるCoT-VLAを紹介する。
実験の結果,CoT-VLAは実世界の操作タスクでは17%,シミュレーションベンチマークでは6%,最先端のVLAモデルでは6%,高い性能を示した。
論文 参考訳(メタデータ) (2025-03-27T22:23:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。