論文の概要: MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model
- arxiv url: http://arxiv.org/abs/2606.08288v1
- Date: Sat, 06 Jun 2026 18:20:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.020452
- Title: MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model
- Title(参考訳): MotionVLA:視覚・言語・アクションモデルに幾何学的動きを注入する
- Authors: Shanglin Yuan, Weiheng Zhao, Xianda Guo, Wei Sui, Li Yu, Wenyu Liu, Xinggang Wang,
- Abstract要約: 動作履歴インタフェースであるMotionVLAを導入し,過去のみのビデオウィンドウをコンパクトかつ時間的連続なトラジェクトリフィールドトークンに変換する。
我々は,MotionVLAがよりスムーズで直接的な実行を実現しながら,長時間の操作を改善することを示す。
- 参考スコア(独自算出の注目度): 41.634737117765745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models increasingly condition robot policies on history, depth, or 4D features to resolve ambiguity in long-horizon manipulation. However, more spatiotemporal evidence is not necessarily better: when the injected evidence is not motion-consistent, it can introduce geometric drift, fragmented temporal cues, and unstable action generation. This raises a simple question: should a VLA remember past frames, or remember the motion that connects them? We introduce MotionVLA, a motion-history interface that converts a short past-only video window into compact, time-continuous trajectory-field tokens. Instead of treating history as a sparse set of ndependently lifted frames, MotionVLA represents recent observations as physically coherent motion evidence. Current visual tokens query this history to retrieve task-relevant motion information, which is then recoupled into the VLA stream under trajectory-grounded supervision. Experiments across simulation benchmarks and preliminary real-robot rollouts show that MotionVLA improves long-horizon manipulation while producing smoother and more direct executions. These results suggest that effective VLA memory is not just about providing more 4D context, but about exposing motion-consistent evidence that is usable for control.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、長い水平操作におけるあいまいさを解決するために、歴史、深さ、または4D特徴に対してロボットポリシーをますます要求する。
しかし、より時空間的な証拠は必ずしも良いものではない: 注入された証拠が運動に一貫性がない場合、幾何学的ドリフト、断片化された時間的手がかり、不安定な行動生成を導入することができる。
VLAは過去のフレームを覚えるべきか、あるいはそれらを結ぶ動きを覚えるべきなのか?
動作履歴インタフェースであるMotionVLAを導入し,過去のみのビデオウィンドウをコンパクトかつ時間的連続なトラジェクトリフィールドトークンに変換する。
歴史を無関係に持ち上げられたフレームのスパース集合として扱う代わりに、モーションVLAは最近の観測を物理的に一貫性のある運動証拠として表現している。
現在の視覚トークンは、この履歴をクエリしてタスク関連モーション情報を取得し、それを軌跡管理の下でVLAストリームに再結合する。
シミュレーションベンチマークと予備的な実ロボットロールアウトによる実験は、MotionVLAがよりスムーズで直接的な実行を生成しながら、長距離操作を改善することを示している。
これらの結果は、有効なVLAメモリは、より多くの4Dコンテキストを提供するだけでなく、制御に使えるモーション一貫性のあるエビデンスを露呈するものであることを示唆している。
関連論文リスト
- MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving [54.57163800903507]
我々は、自動運転のための最初の統合ストリーミングVLAアーキテクチャであるMindVLA-U1を紹介する。
統一されたVLMバックボーンは、1つの共有表現に1つのフォワードパスでAR言語トークンとフローマッチングされた連続的なアクショントラジェクトリを生成する。
ロングテールのWOD-E2Eベンチマークでは、MindVLA-U1が経験豊富な人間のドライバーを初めて上回った。
論文 参考訳(メタデータ) (2026-05-12T18:09:42Z) - Robotic VLA Benefits from Joint Learning with Motion Image Diffusion [114.60268819583017]
VLA(Vision-Language-Action)モデルは、マルチモーダルな観察と指示を直接行動にマッピングすることで、ロボット操作において顕著な進歩を遂げた。
動き推論機能を備えたVLAモデルを強化する新しい戦略である動き画像拡散を用いた共同学習を提案する。
シミュレーションと実世界の両方の環境での実験により、モーション画像拡散による共同学習がpiシリーズVLAの成功率を97.5%に向上させることが示された。
論文 参考訳(メタデータ) (2025-12-19T19:07:53Z) - HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models [39.350965975615104]
HiF-VLAは、双方向の時間的推論に動きを利用する統一的なフレームワークである。
過去のダイナミクスを後見の先行を通してエンコードし、前見の推論を通して将来の動きを予測し、後見の変調された共同専門家を通して統合する。
現実世界の長距離操作タスクにおいて大幅な改善を実現し、実用的なロボット設定においてその幅広い効果を実証している。
論文 参考訳(メタデータ) (2025-12-10T18:59:32Z) - C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation [81.4106601222722]
トラジェクティブに基づくモーションコントロールは、制御可能なビデオ生成のための直感的で効率的なアプローチとして登場した。
我々はC-Dragという制御可能なビデオ生成のためのチェーン・オブ・ソート型モーションコントローラを提案する。
本手法は,物体認識モジュールとChain-of-Thoughtベースの動作推論モジュールを含む。
論文 参考訳(メタデータ) (2025-02-27T08:21:03Z) - Segmenting the motion components of a video: A long-term unsupervised model [5.801044612920816]
ビデオシーケンス上でのコヒーレントで安定した動作セグメンテーションを提供したいと思っています。
完全教師なし方式で動作する新しい長期光時間モデルを提案する。
4つのVOSに関する実験を報告し、競争力のある定量的結果を示した。
論文 参考訳(メタデータ) (2023-10-02T09:33:54Z) - Observation-Centric SORT: Rethinking SORT for Robust Multi-Object
Tracking [32.32109475782992]
簡単な動きモデルにより、外観のような他の手段を使わずに、最先端のトラッキング性能が得られることを示す。
そこで我々は,提案手法を OC-SORT,Observatory-Centric SORT,略してOC-SORT と呼ぶ。
論文 参考訳(メタデータ) (2022-03-27T17:57:08Z) - Implicit Motion Handling for Video Camouflaged Object Detection [60.98467179649398]
本稿では,新しいビデオカモフラージュオブジェクト検出(VCOD)フレームワークを提案する。
短期的および長期的整合性を利用して、ビデオフレームからカモフラージュされたオブジェクトを検出する。
論文 参考訳(メタデータ) (2022-03-14T17:55:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。