論文の概要: Vid2WAM: Distilling Video Diffusion Priors into World Action Models
- arxiv url: http://arxiv.org/abs/2608.08558v1
- Date: Sun, 09 Aug 2026 08:02:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.868436
- Title: Vid2WAM: Distilling Video Diffusion Priors into World Action Models
- Title(参考訳): Vid2WAM:世界アクションモデルにビデオ拡散を先取りする
- Abstract要約: 世界行動モデル(WAM)は、将来の視覚力学とアクションを共同でモデル化することで、ロボットポリシー学習を改善する。
大規模なビデオ基礎モデルからコンパクトなWAM学生へ視覚拡散を先取りするオフライン蒸留フレームワークであるVid2WAMを提案する。
Vid2WAMは、限られた専門家によるデモンストレーションにおいて、新しいタスクの一般化とデータ効率を向上させる。
- 参考スコア(独自算出の注目度): 59.28345153395937
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World Action Models (WAMs) improve robot policy learning by jointly modeling future visual dynamics and actions. However, their scalability and generalization remain constrained by their reliance on costly expert demonstrations. We challenge this by asking whether future supervision for WAMs must originate from target-task expert trajectories. In this paper, we propose Vid2WAM, an offline distillation framework that transfers visual diffusion priors from a large video foundation model into a compact WAM student. Given an observation and language instruction, Vid2WAM distills supervision through two complementary channels: task-conditioned future rollouts directly supervise the student's future prediction branch, while an inverse dynamics model recovers embodiment-specific pseudo-actions for action learning. To robustly integrate synthetic and real supervision, we introduce source-aware residual action adaptation that learns source-specific corrections around a shared action backbone and mitigates interference from noisy pseudo-actions. During inference, both the video teacher and inverse dynamics model are discarded, leaving only the WAM student for efficient deployment. Simulation and real-world experiments demonstrate that Vid2WAM improves novel-task generalization and data efficiency under limited expert demonstrations while preserving low-latency inference.
- Abstract(参考訳): 世界行動モデル(WAM)は、将来の視覚力学とアクションを共同でモデル化することで、ロボットポリシー学習を改善する。
しかし、彼らのスケーラビリティと一般化は、コストのかかる専門家によるデモンストレーションへの依存によって制約され続けている。
我々は、WAMの今後の監督は、ターゲットタスクの専門家の軌跡に起因すべきかどうかを問うことで、この問題に挑戦する。
本稿では,大規模なビデオ基盤モデルからコンパクトなWAM学生へ視覚拡散を先取りするオフライン蒸留フレームワークVid2WAMを提案する。
タスク条件付き将来のロールアウトは、生徒の将来の予測ブランチを直接監督し、逆ダイナミクスモデルは、アクション学習のためのエンボディメント固有の擬似アクションを回復する。
そこで本研究では,共有動作バックボーンの周囲のソース固有の補正を学習し,ノイズのある擬似動作からの干渉を緩和するソース認識残効適応を導入する。
推論中、ビデオ教師と逆ダイナミクスモデルの両方が破棄され、WAMの学生だけが効率的に配置できる。
シミュレーションと実世界の実験により、Vid2WAMは低レイテンシの推論を保ちながら、限られた専門家によるデモンストレーションの下で、新しいタスクの一般化とデータ効率を改善することが示されている。
関連論文リスト
- DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning [28.673173377342593]
一般的なロボット操作は、言語命令を実行しながら視覚シーンがどのように進化するかを予測するポリシーを必要とする。
DeVAはDecoupled Video-Actionモデルであり、特殊ビデオとアクションの専門家、多レベル機能転送、物理的ガイダンスを備えている。
シミュレーションベンチマークと実世界のデプロイの両方の実験では、限られたデータによる強力なパフォーマンス、統一アーキテクチャよりも高速な収束、物理的ガイダンスによるパフォーマンス向上が示されている。
論文 参考訳(メタデータ) (2026-07-27T08:37:35Z) - Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation [80.18527639791074]
世界アクションモデルは、自動運転と都市ナビゲーションに非常に有望だ。
既存のアプローチには、重要な制限がある。
我々は,映像生成とアクション予測を分離するエンドツーエンドのWAMフレームワークであるMetisを提案する。
論文 参考訳(メタデータ) (2026-06-14T15:40:49Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining [28.30092786035367]
DeFIはビジュアルフォワードと逆ダイナミクスを分離し、各データソースを利用するための新しいフレームワークである。
今後の予測のために,多種多様な人・ロボットビデオで事前訓練された一般フォワード・ダイナミクス・モデル(GFDM)と,ラベルなしビデオ遷移から潜伏行動を予測するための自己教師付き学習によって訓練された一般逆ダイナミクス・モデル(GIDM)を紹介する。
CALVIN ABC-D と SimplerEnv の実験では、DeFI は CALVIN の平均タスク長 4.51 に達し、SimplerEnv-Frac は 51.2% 成功した。
論文 参考訳(メタデータ) (2026-03-27T17:20:10Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - AMPLIFY: Actionless Motion Priors for Robot Learning from Videos [29.799207502031496]
AMPLIFYは,大規模ビデオデータを活用する新しいフレームワークである。
我々は、豊富なアクションフリービデオでフォワードダイナミクスモデルを訓練し、限られたアクションラベル付き例で逆ダイナミクスモデルを訓練する。
下流の政策学習において、我々のダイナミクス予測は、低データのレシエーションにおいて1.2-2.2倍の改善を実現し、アクションフリーなヒューマンビデオから学ぶことで平均1.4倍の改善を実現し、非配布アクションデータからLIBEROタスクへの第1次一般化を可能にした。
論文 参考訳(メタデータ) (2025-06-17T05:31:42Z) - Model-Based Reinforcement Learning with Multi-Task Offline Pretraining [59.82457030180094]
本稿では,オフラインデータから新しいタスクへ,潜在的に有用なダイナミックスや動作デモを伝達するモデルベースRL法を提案する。
主な考え方は、世界モデルを行動学習のシミュレーターとしてだけでなく、タスクの関連性を測定するツールとして使うことである。
本稿では,Meta-WorldとDeepMind Control Suiteの最先端手法と比較して,我々のアプローチの利点を実証する。
論文 参考訳(メタデータ) (2023-06-06T02:24:41Z) - Reinforcement Learning with Action-Free Pre-Training from Videos [95.25074614579646]
本稿では,ビデオにおける生成前学習を通じて動的理解に役立つ表現を学習するフレームワークを提案する。
我々のフレームワークは、視覚に基づく強化学習の最終性能とサンプル効率の両方を著しく改善する。
論文 参考訳(メタデータ) (2022-03-25T19:44:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。