論文の概要: WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos
- arxiv url: http://arxiv.org/abs/2607.11397v1
- Date: Mon, 13 Jul 2026 11:02:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.443608
- Title: WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos
- Title(参考訳): アクションラベル付きデモとアクションフリービデオによるWALA学習の潜在行動
- Abstract要約: WALAは、アクションラベル付きデモとアクションフリービデオの両方から実行可能な潜在アクションを学ぶためのフレームワークである。
WALAはRoboTwin上で高いパフォーマンスを実現し,RoboCasa上での最先端の成果を平均75.2%で実現している。
- 参考スコア(独自算出の注目度): 38.959415159248046
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalizable robot policies typically rely on action-labeled robot demonstrations, which are expensive to collect and difficult to scale. In contrast, large-scale human and robot videos contain rich physical interactions but often lack executable robot action labels. We present WALA, a framework for learning executable latent actions from both action-labeled demonstrations and action-free videos. WALA first pretrains a semantic-geometric latent action model from videos by modeling the evolution between current observations and sparsely sampled future observations. Instead of reconstructing raw pixels, WALA predicts future deltas in the DINOv3 feature space and dense depth space, preserving task-relevant semantic and geometric structure while reducing sensitivity to appearance details. During policy training, the pretrained encoder provides stable latent action targets, and the decoder serves as a trainable latent world model. The latent actions generated by the vision-language backbone are jointly supervised by robot action prediction, latent action target matching, and future dynamics prediction. This enables action-labeled demonstrations to provide executable control supervision, while action-free videos contribute dynamics supervision without requiring robot action annotations. Experiments show that WALA achieves strong performance on RoboTwin, sets a new state-of-the-art result on RoboCasa with 75.2% average success, and improves both policy performance and generalization in real-world manipulation tasks.
- Abstract(参考訳): 一般的なロボットポリシーは、一般的にアクションラベル付きロボットのデモに頼っている。
対照的に、大規模な人間とロボットのビデオは、リッチな物理的相互作用を含んでいるが、しばしば実行可能なロボットアクションラベルを欠いている。
本稿では、アクションラベル付きデモとアクションフリービデオの両方から実行可能な潜在アクションを学習するためのフレームワークWALAを提案する。
WALAは、まず、現在の観測とわずかにサンプリングされた将来の観測の間の進化をモデル化することによって、ビデオから意味幾何学的潜在アクションモデルを事前訓練する。
WALAは生のピクセルを再構成する代わりに、DINOv3特徴空間と密度深度空間の将来のデルタを予測し、タスク関連セマンティックスと幾何学的構造を保存し、外観の詳細に対する感度を低下させる。
政策訓練中、事前訓練されたエンコーダは安定した潜在行動目標を提供し、デコーダは訓練可能な潜在世界モデルとして機能する。
視覚言語バックボーンによって生成される潜伏動作は、ロボットアクション予測、潜伏動作目標マッチング、将来のダイナミクス予測によって共同で監視される。
これにより、アクションラベル付きデモでは、ロボットアクションアノテーションを必要とせずに、アクションフリーのビデオが動的監視に寄与する。
実験の結果、WALAはRoboTwin上で高いパフォーマンスを達成し、RoboCasa上で75.2%の平均的な成功を達成し、実際の操作タスクにおけるポリシー性能と一般化の両方を改善した。
関連論文リスト
- HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model [13.153130497047043]
大規模な人間のビデオから一般化可能な視覚-言語-アクションモデルを学ぶことは有望だが、断熱的不一致のため難しい。
本稿では,人間のビデオからより効果的なVLA事前学習のための人間ロボット協調表現学習フレームワークであるHARPを提案する。
特徴可視化、シミュレーション、実世界の操作実験は、人間ロボットのアライメントと下流ポリシーのパフォーマンスを改善した。
論文 参考訳(メタデータ) (2026-05-29T12:36:30Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation [27.54751123419347]
人間のビデオからロボットポリシーを学習するための教師なし事前学習フレームワークであるConLAを提案する。
人間のビデオのみに事前学習を行うことで、実際のロボット軌道事前学習で得られた性能を初めて上回ります。
論文 参考訳(メタデータ) (2026-01-31T06:40:57Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Large Video Planner Enables Generalizable Robot Control [117.49024534548319]
汎用ロボットは、様々なタスクや環境にまたがって一般化する意思決定モデルを必要とする。
最近の研究は、マルチモーダル大言語モデル(LM)をアクション出力で拡張し、視覚-アクション(VLA)システムを構築することで、ロボット基盤モデルを構築している。
本稿では,ロボット基礎モデル構築における主要なモダリティとして,大規模ビデオ事前学習を用いるための代替パラダイムについて検討する。
論文 参考訳(メタデータ) (2025-12-17T18:35:54Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos [101.26467307473638]
我々はMotoを紹介する。Motoは、映像コンテンツをラテントモーションTokenizerでラテントモーションTokenシーケンスに変換する。
我々は、モーショントークンによるMoto-GPTの事前学習を行い、多様な視覚的動きの知識を捉えることができる。
実際のロボット動作に先立って学習した動きを転送するために、潜伏した動きのトークン予測と実際のロボット制御をシームレスにブリッジするコファインチューニング戦略を実装した。
論文 参考訳(メタデータ) (2024-12-05T18:57:04Z) - Latent Action Pretraining from Videos [156.88613023078778]
一般行動モデル(LAPA)のための潜在行動事前訓練について紹介する。
LAPA(英: LAPA)は、VLA(Vision-Language-Action)モデルに接地型ロボットアクションラベルを含まない教師なしの訓練方法である。
本稿では,ロボットアクションラベルを持たないインターネット規模のビデオから学習する手法を提案する。
論文 参考訳(メタデータ) (2024-10-15T16:28:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。