論文の概要: DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning
- arxiv url: http://arxiv.org/abs/2607.24159v1
- Date: Mon, 27 Jul 2026 08:37:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.364791
- Title: DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning
- Title(参考訳): DeVA:ロボットポリシー学習のための物理ガイダンス付きビデオアクションモデル
- Authors: Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman,
- Abstract要約: 一般的なロボット操作は、言語命令を実行しながら視覚シーンがどのように進化するかを予測するポリシーを必要とする。
DeVAはDecoupled Video-Actionモデルであり、特殊ビデオとアクションの専門家、多レベル機能転送、物理的ガイダンスを備えている。
シミュレーションベンチマークと実世界のデプロイの両方の実験では、限られたデータによる強力なパフォーマンス、統一アーキテクチャよりも高速な収束、物理的ガイダンスによるパフォーマンス向上が示されている。
- 参考スコア(独自算出の注目度): 28.673173377342593
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalizable robot manipulation requires policies that can anticipate how visual scenes evolve while executing language instructions. While recent Vision-Language-Action models benefit from large-scale pretraining, their predominantly static pretraining objectives provide limited supervision for physical dynamics and temporal causality, leaving control-relevant knowledge to be learned from downstream robot demonstrations. Video generative models offer a promising foundation by encoding rich spatiotemporal priors through future predictions. However, existing Video-Action Models either couple video and action prediction in a shared backbone, making policy adaptation harder to optimize, or under-utilize video information when guiding the action branch. In this work, we introduce DeVA, a Decoupled Video-Action model with specialized video and action experts, multi-level feature transfer, and physically salient guidance. DeVA transfers representations from multiple video layers to the action expert, enabling rich information exchange while making policy learning more tractable. It further supervises intermediate video features and the action stream with physically salient guidance (affordance/depth). Experiments on both simulation benchmarks and real-world deployment demonstrate strong performance with limited data, faster convergence than a unified architecture, and clear performance gains from physical guidance.
- Abstract(参考訳): 一般化可能なロボット操作は、言語命令を実行しながら視覚的なシーンがどのように進化するかを予測するポリシーを必要とする。
近年のVision-Language-Actionモデルは大規模な事前訓練の恩恵を受けているが、彼らの主に静的な事前訓練の目的は、物理的ダイナミクスと時間的因果関係の限定的な監督を提供し、下流ロボットのデモンストレーションから学ぶための制御関連知識を残している。
ビデオ生成モデルは、将来の予測を通じて、豊富な時空間事前を符号化することで、有望な基盤を提供する。
しかし、既存のビデオ・アクション・モデルでは、ビデオとアクションの予測を共有バックボーンで組み合わせることで、アクション・ブランチを導く際に、ポリシーの適応を最適化しにくくしたり、ビデオ情報の利用を弱めたりする。
本稿では,ビデオとアクションの専門家を専門とするデカップリング・ビデオ・アクション・モデルであるDeVA,マルチレベルの特徴伝達,物理的に健全なガイダンスを紹介する。
DeVAは、複数のビデオレイヤからアクションエキスパートに表現を転送し、ポリシー学習をより魅力的にしながら、豊富な情報交換を可能にする。
さらに、中間的なビデオ機能と、物理的に健全なガイダンス(アフォード/ディープス)でアクションストリームを監督する。
シミュレーションベンチマークと実世界のデプロイの両方の実験では、限られたデータによる強力なパフォーマンス、統一アーキテクチャよりも高速な収束、物理的ガイダンスによるパフォーマンス向上が示されている。
関連論文リスト
- From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos [73.51386721543135]
本稿では,映像から視覚的潜伏空間をロボット軌道から受容的潜伏空間に整列させるフレームワークであるContrastive Latent Action Pretraining (CLAP)を提案する。
CLAPは、ビデオの遷移を量子化され、物理的に実行可能なコードブックにマッピングする。
本稿では,命令追従やオブジェクトの一般化に優れた自己回帰モデルであるCLAP-NTPと,高頻度かつ高精度な操作のために設計されたRectified FlowベースのポリシーであるCLAP-RFの両方を提供する二重形式VLAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-07T16:26:33Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Unified Video Action Model [47.88377984526902]
統合されたビデオとアクションモデルは、アクション予測のためのリッチなシーン情報を提供するロボット工学にとって重要な約束である。
我々は,映像とアクションの予測を協調的に最適化し,高精度かつ効率的なアクション推論を実現するUnified Video Action Model (UVA)を提案する。
広範な実験により、UVAは幅広いロボティクスタスクの汎用的なソリューションとして機能できることが実証された。
論文 参考訳(メタデータ) (2025-02-28T21:38:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。