論文の概要: InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- arxiv url: http://arxiv.org/abs/2607.04988v1
- Date: Mon, 06 Jul 2026 12:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.147695
- Title: InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- Title(参考訳): InternVLA-A1.5:理解、潜在的展望、および構成的一般化のための行動の統一化
- Authors: Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang,
- Abstract要約: 本稿では,VQAとサブタスク予測のトレーニングを継続するネイティブVLMバックボーン上にポリシを構築するInternVLA-A1.5について述べる。
将来の予測は、学習可能な予測トークンの小さなセットが、凍結事前学習されたビデオ生成モデルの監督の下で、タスク関連の将来をコンパクトな遅延コードに凝縮する潜時予測問題として再放送される。
InternVLA-A1.5は、1.2Mのロボットエピソードと3Mのマルチモーダルサンプルで事前訓練され、6つのシミュレーションベンチマークで最高の結果を得る。
- 参考スコア(独自算出の注目度): 81.9611022323101
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Unified models for robot manipulation aim to equip one policy with both the semantic priors of pretrained VLMs and the physical dynamics learned through future prediction. In practice, existing designs tend to erode the semantics of the pretrained backbone, suffer interference among heterogeneous objectives, and learn future prediction from scratch in pixel space, leaving the dynamics priors of pretrained video generators unexploited. We present InternVLA-A1.5, which builds the policy on a native VLM backbone that keeps training on VQA and subtask prediction, and attaches a lightweight unified expert for continuous action generation. Future prediction is recast as a latent-querying problem, where a small set of learnable foresight tokens condenses the task-relevant future into a compact latent code under the supervision of a frozen pretrained video generation model, so the policy inherits world-model dynamics priors without ever learning pixel-level generation. The video branch is discarded at inference, keeping real-time control. Pretrained on 1.2M robot episodes and 3M multimodal samples, InternVLA-A1.5 achieves the best overall results on all six simulation benchmarks. In the real world, the preserved semantics deliver the strongest compositional generalization on held-out instruction bindings, and the two designs together sustain long-horizon execution.
- Abstract(参考訳): ロボット操作の統一モデルは、事前訓練されたVLMの意味的前提と、将来の予測を通じて学習された物理力学の両方に、1つのポリシーを組み込むことを目的としている。
実際には、既存のデザインは、事前訓練されたバックボーンのセマンティクスを損なう傾向があり、不均一な目的の間に干渉し、ピクセル空間のスクラッチから将来の予測を学習し、事前訓練されたビデオジェネレータのダイナミクスを未解明のまま残している。
本稿では,VQAとサブタスク予測のトレーニングを継続するネイティブVLMバックボーン上にポリシを構築するInternVLA-A1.5について述べる。
将来の予測は、学習可能な予測トークンの小さなセットが、凍結した事前学習されたビデオ生成モデルの監督の下で、タスク関連の将来をコンパクトな潜時コードに凝縮する潜時予測問題として再放送されるので、このポリシーはピクセルレベルの生成を学習することなく、ワールド・モデル・ダイナミクスを継承する。
ビデオブランチは推論時に破棄され、リアルタイム制御が維持される。
InternVLA-A1.5は、1.2Mのロボットエピソードと3Mのマルチモーダルサンプルで事前訓練され、6つのシミュレーションベンチマークで最高の結果を得る。
実世界では、保存された意味論は、保持された命令バインディングに最も強い構成的一般化をもたらす。
関連論文リスト
- Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining [28.30092786035367]
DeFIはビジュアルフォワードと逆ダイナミクスを分離し、各データソースを利用するための新しいフレームワークである。
今後の予測のために,多種多様な人・ロボットビデオで事前訓練された一般フォワード・ダイナミクス・モデル(GFDM)と,ラベルなしビデオ遷移から潜伏行動を予測するための自己教師付き学習によって訓練された一般逆ダイナミクス・モデル(GIDM)を紹介する。
CALVIN ABC-D と SimplerEnv の実験では、DeFI は CALVIN の平均タスク長 4.51 に達し、SimplerEnv-Frac は 51.2% 成功した。
論文 参考訳(メタデータ) (2026-03-27T17:20:10Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - UniCoD: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning [22.84748754972181]
オープンエンド環境で多様なタスクを処理できる汎用的なロボットポリシーを構築することは、ロボット工学における中心的な課題である。
大規模な事前学習から知識を活用するために、以前の研究は一般的に視覚言語理解モデル(VLM)または生成モデルの上に一般的なポリシーを構築してきた。
最近の生成と理解の統一モデルは、大規模な事前学習を通じて、理解と生成の両方において強力な能力を示している。
そこで,UniCoDを導入し,100万以上のインターネット規模の操作映像を事前学習することで,高次元視覚特徴を動的にモデル化する機能を実現する。
論文 参考訳(メタデータ) (2025-10-12T14:54:19Z) - Reinforcement Learning with Action-Free Pre-Training from Videos [95.25074614579646]
本稿では,ビデオにおける生成前学習を通じて動的理解に役立つ表現を学習するフレームワークを提案する。
我々のフレームワークは、視覚に基づく強化学習の最終性能とサンプル効率の両方を著しく改善する。
論文 参考訳(メタデータ) (2022-03-25T19:44:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。