論文の概要: Native Video-Action Pretraining for Generalizable Robot Control
- arxiv url: http://arxiv.org/abs/2607.08639v2
- Date: Thu, 16 Jul 2026 15:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.830312
- Title: Native Video-Action Pretraining for Generalizable Robot Control
- Title(参考訳): 汎用ロボット制御のためのネイティブビデオアクション事前学習
- Authors: Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu,
- Abstract要約: LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
- 参考スコア(独自算出の注目度): 77.59831077077176
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The advent of video-action models offers a promising path for robot control. Nevertheless, we argue that repurposing video generative models designed for digital content creation is inherently inadequate for physical environments. To bridge this gap, we present LingBot-VA 2.0, a video-action foundation model built from the ground up for embodiment. Four core design principles showcase its evolution from LingBot-VA. (1) Departing from traditional reconstruction-focused VAEs, we introduce a semantic visual-action tokenizer, which aligns visual representations with both semantics and actions, improving instruction following and action precision in subsequent policy learning. (2) Given the strictly causal nature of temporal dynamics, we adopt a causal pretraining paradigm, training from scratch to circumvent the catastrophic forgetting that frequently occurs when adapting bidirectional architectures. (3) To meet the demands of high-frequency inference, our model employs a sparse MoE backbone, expanding model capacity without compromising efficiency. (4) Real-time closed-loop control is realized through an enhanced asynchronous inference scheme, which predicts future latents in parallel with action execution while re-grounding each rollout on the latest observation via learned forward dynamics. Real-world deployment validates LingBot-VA 2.0 as a robust foundation model, as evidenced by its few-shot generalization across complex manipulation tasks.
- Abstract(参考訳): ビデオアクションモデルの出現は、ロボット制御にとって有望な道を提供する。
それにもかかわらず、デジタルコンテンツ作成のために設計されたビデオ生成モデルの再購入は、物理的環境に本質的に不適切である、と我々は主張する。
このギャップを埋めるために、我々はLingBot-VA 2.0を紹介します。
4つの基本設計原則は、LingBot-VAからの進化を示している。
1) 従来の再建型VAEとは別に,視覚表現を意味と行動の両方に整合させ,その後の政策学習における指示追従と行動精度を向上させるセマンティック・アクション・トークンーザを導入する。
2) 時間力学の厳密な因果的性質を考慮し, 双方向アーキテクチャの適応時に頻繁に発生する破滅的な忘れを回避すべく, ゼロから訓練する因果前訓練パラダイムを採用する。
(3) 高頻度推論の要求を満たすため,本モデルは疎いMoEバックボーンを採用し,効率を損なうことなくモデル容量を拡大する。
(4) 実時間クローズドループ制御は,学習したフォワードダイナミクスによる最新の観測で各ロールアウトを再度グラウンド化しながら,動作実行と並行して将来の潜伏を予測できる拡張非同期推論方式により実現される。
LingBot-VA 2.0は、複雑な操作タスクをまたいだ数ショットの一般化によって実証された、堅牢な基盤モデルとして検証されている。
関連論文リスト
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization [81.9611022323101]
本稿では,VQAとサブタスク予測のトレーニングを継続するネイティブVLMバックボーン上にポリシを構築するInternVLA-A1.5について述べる。
将来の予測は、学習可能な予測トークンの小さなセットが、凍結事前学習されたビデオ生成モデルの監督の下で、タスク関連の将来をコンパクトな遅延コードに凝縮する潜時予測問題として再放送される。
InternVLA-A1.5は、1.2Mのロボットエピソードと3Mのマルチモーダルサンプルで事前訓練され、6つのシミュレーションベンチマークで最高の結果を得る。
論文 参考訳(メタデータ) (2026-07-06T12:25:30Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - Causal World Modeling for Robot Control [56.31803788587547]
ビデオワールドモデルは、アクションと視覚力学の因果関係を理解することによって、近い将来に想像できる能力を提供する。
本稿では,フレーム予測とポリシ実行を同時に学習する自動回帰拡散フレームワークLingBot-VAを紹介する。
シミュレーションベンチマークと実世界のシナリオの両方でモデルを評価したところ、長距離操作、ポストトレーニングにおけるデータ効率、新しい構成への強力な一般化性などに大きな可能性を示唆している。
論文 参考訳(メタデータ) (2026-01-29T17:07:43Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。