論文の概要: WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning
- arxiv url: http://arxiv.org/abs/2606.25591v2
- Date: Sun, 28 Jun 2026 08:36:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 13:45:02.023861
- Title: WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning
- Title(参考訳): WOLF-VLA:視覚言語学習のための全体ヒューマノイド最適ロコモーションフレームワーク
- Authors: Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner,
- Abstract要約: VLA(Vision-Language-Action)モデルは最近、ロボット操作の強力な一般化を実証している。
この研究は、全身最適制御(OC)モーション合成と大規模マルチモーダルデータセットを統合する統合フレームワークWOLF-VLAを導入する。
我々は6つの移動関連タスクファミリにまたがって動的に実現可能なヒューマノイドトラジェクトリの包括的データセットを構築した。
我々は,収集された共同軌跡,エゴ中心の視覚観察,自然言語指導を用いてVLAモデルを訓練し,初期条件変動に対する強い推論と堅牢性を示す政策を導出する。
- 参考スコア(独自算出の注目度): 4.427336047705734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have recently demonstrated strong generalization in robotic manipulation, yet their applicability to whole-body, contact-rich humanoid locomotion remains severely underexplored due to data scarcity, the absence of dynamically consistent demonstrations, and the difficulty of encoding optimality and safety in learning-based pipelines. This work introduces a unified framework WOLF-VLA that integrates whole-body optimal-control (OC) motion synthesis with large-scale multi-modal dataset to train VLAs capable of generating humanoid locomotion policies directly from natural-language instructions. We construct a comprehensive dataset of dynamically feasible humanoid trajectories across six locomotion-related task families, each parameterized by environmental variations, object colors, placements, and visual distractors. We train a VLA model using the collected joint trajectories, ego-centric visual observations and natural language instruction, yielding a policy that exhibits strong reasoning and robustness to initial-condition variability, and competitive performance across several tasks and environment settings. A systematic ablation study demonstrates the impact of each modality on the model performance. The full dataset, model checkpoints, and benchmarking simulation suite will be openly released, establishing a reproducible dynamically consistent benchmark for whole-body humanoid locomotion rich VLA control and enabling future research in scalable transfer of instruction-driven locomotion policies.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは最近、ロボット操作の強力な一般化を実証しているが、データ不足、動的に一貫したデモンストレーションの欠如、学習ベースのパイプラインにおける最適性と安全性の符号化の難しさにより、接触に富んだヒューマノイドの運動への適用性が著しく過小評価されている。
本研究は,全体最適制御(OC)モーション合成を大規模マルチモーダルデータセットと統合した統合フレームワークWOLF-VLAを導入し,自然言語命令から直接ヒューマノイド移動ポリシーを生成可能なVLAを訓練する。
本研究では, 環境変動, 対象色, 配置, 視覚的注意を指標として, 6つの移動関連課題群を対象に, 動的に実現可能なヒューマノイド軌道の包括的データセットを構築した。
我々は,収集された共同軌跡,エゴ中心の視覚観測,自然言語指導を用いてVLAモデルを訓練し,初期条件変数に対する強い推論と堅牢性,および複数のタスクや環境設定における競合性能を示す政策を導出する。
系統的アブレーション研究は、各モダリティがモデル性能に与える影響を実証する。
完全なデータセット、モデルチェックポイント、ベンチマークシミュレーションスイートが公開され、ボディ全体のヒューマノイドロコモーションリッチVLAコントロールのための再現可能な動的一貫したベンチマークを確立し、命令駆動ロコモーションポリシーのスケーラブルな転送における将来の研究を可能にする。
関連論文リスト
- DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy [55.03832008486675]
World-VLA-Loopは、世界モデルとVision-Language-Action (VLA) ポリシーの共同改良のためのクローズドループフレームワークである。
本研究では,将来観測と報奨信号の同時予測により,高忠実度インタラクティブシミュレータとして機能する状態認識型ビデオワールドモデルを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:57:55Z) - Vision Language Action Models in Robotic Manipulation: A Systematic Review [1.1767330101986737]
ビジョン言語アクション(VLA)モデルは、ロボット工学の変革的なシフトを表す。
本稿では,VLAパラダイムの包括的で先進的な合成について述べる。
102のVLAモデル、26の基盤データセット、12のシミュレーションプラットフォームを分析します。
論文 参考訳(メタデータ) (2025-07-14T18:00:34Z) - TrackVLA: Embodied Visual Tracking in the Wild [34.03604806748204]
Embodied visual trackingは、Embodied AIの基本的なスキルであり、エージェントは、自我中心の視覚のみを使用して、動的環境における特定のターゲットに従うことができる。
既存のアプローチは通常、認識と計画のモジュラー分離を通じてこの問題に対処する。
本研究では,物体認識と軌道計画の相乗効果を学習する視覚・言語・行動モデルであるTrackVLAを提案する。
論文 参考訳(メタデータ) (2025-05-29T07:28:09Z) - LANGTRAJ: Diffusion Model and Dataset for Language-Conditioned Trajectory Simulation [102.1527101235251]
LangTrajは、トラフィックシナリオにおけるすべてのエージェントの共同動作をシミュレートする、言語条件のシーン拡散モデルである。
自然言語入力を条件付けすることで、LangTrajはインタラクティブな振る舞いを柔軟かつ直感的に制御できる。
LangTraj氏は、リアリズム、言語制御性、言語条件の安全クリティカルなシミュレーションにおいて、強力なパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-04-15T17:14:06Z) - TrajLLM: A Modular LLM-Enhanced Agent-Based Framework for Realistic Human Trajectory Simulation [3.8106509573548286]
この作業は、Large Language Models(LLM)を活用して人間のモビリティをシミュレートし、従来のモデルにおける高コストやプライバシの問題に対処する。
我々の階層的枠組みは、実世界の人口統計と心理データを用いて、ペルソナ生成、活動選択、目的地予測を統合している。
論文 参考訳(メタデータ) (2025-02-26T00:13:26Z) - Vision Language Models are In-Context Value Learners [89.29486557646624]
本稿では、視覚言語モデル(VLM)に埋め込まれた世界的知識を活用してタスクの進捗を予測する普遍的価値関数推定器である生成価値学習(GVL)を提案する。
ロボットやタスク固有のトレーニングがなければ、GVLは300以上の異なる現実世界のタスクに対して、ゼロショットと数ショットの効果的な値をインコンテキストで予測することができる。
論文 参考訳(メタデータ) (2024-11-07T09:17:50Z) - Probing Multimodal LLMs as World Models for Driving [72.18727651074563]
自律運転におけるMLLM(Multimodal Large Language Models)の適用について検討する。
GPT-4oのようなモデルの開発は進んでいるが、複雑な運転環境における性能は未解明のままである。
論文 参考訳(メタデータ) (2024-05-09T17:52:42Z) - An Adaptable Approach to Learn Realistic Legged Locomotion without
Examples [38.81854337592694]
本研究は,バネ装荷逆振り子モデルを用いて学習プロセスを導くことで,移動における現実性を保証するための汎用的アプローチを提案する。
モデルのない設定であっても、2足歩行ロボットと4足歩行ロボットに対して、学習したポリシーが現実的でエネルギー効率のよい移動歩行を生成できることを示す実験結果を示す。
論文 参考訳(メタデータ) (2021-10-28T10:14:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。