論文の概要: Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review
- arxiv url: http://arxiv.org/abs/2607.06706v1
- Date: Tue, 07 Jul 2026 18:24:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.195763
- Title: Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review
- Title(参考訳): 無人航空ロボットのための視覚言語行動(VLA)モデルとバイマニピュレーション
- Abstract要約: 視覚言語行動(VLA)モデルは、視覚的知覚、自然言語理解、行動生成を単一の基礎モデル内で統一する。
VLAはインターネット規模の事前学習から世界知識を継承するので、学習ベースの操作の主流のフレームワークとなっている。
- 参考スコア(独自算出の注目度): 0.8018354527140357
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Language Action (VLA) models unify visual perception, natural-language understanding, and action generation within a single foundation model, allowing a robot to follow instructions such as fold the towel or fly to the red building directly from camera images. Because VLAs inherit world knowledge from internet-scale pre-training, they have become the dominant framework for learning-based manipulation, with bimanual coordination serving as the most demanding testbed: two arms with 7 degrees of freedom each must move in concert to fold, assemble, and reorient objects. Unmanned aerial robotics faces a structurally similar challenge: a drone must coordinate thrust, attitude, and increasingly gripper commands from visual observations under strict latency and payload constraints. This review covers 183 contributions spanning 2017-2026 and organized along seven dimensions: VLA architectures, training recipes, action representations, bimanual coordination (2022-2026), unmanned aerial vehicle (UAV) navigation and control (2017-2026), language grounding, and cross-cutting concerns including memory and world models. We show that the coordination strategies, training recipes, and action representations developed for bimanual VLAs transfer to unmanned aerial systems and identify fourteen research directions across both domains.
- Abstract(参考訳): 視覚言語行動(VLA)モデルは、単一の基礎モデル内で視覚知覚、自然言語理解、行動生成を統一し、ロボットはタオルを折ったり、カメライメージから直接赤い建物に飛ぶといった指示に従うことができる。
VLAはインターネット規模の事前学習から世界知識を継承するので、それらは学習に基づく操作の主流のフレームワークとなり、双方向の調整が最も要求の多いテストベッドとなっている。
無人の空中ロボットは構造的に類似した課題に直面している。ドローンは、厳格なレイテンシとペイロードの制約の下で視覚的な観察から、推力、姿勢、そしてますます握るコマンドを調整しなければならない。
VLAアーキテクチャ、トレーニングレシピ、アクション表現、バイマンコーディネーション(2022-2026)、無人航空機(UAV)ナビゲーションとコントロール(2017-2026)、言語接地、メモリや世界モデルを含む横断的関心事。
両領域にまたがる14の研究方向を識別し, 協調戦略, 訓練方法, 行動表現が, 無人航空システムへの双方向VLAの移動のために開発されたことを示す。
関連論文リスト
- Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations [3.00988853836121]
視覚言語アクション(VLA)モデルは、知覚、言語、行動を直接リンクすることで直感的なロボット制御への新たな道を開く。
本稿では,言語調和型ドローンナビゲーションのための実用的エキスパート蒸留パイプライン (Exp2VLA) を提案する。
論文 参考訳(メタデータ) (2026-07-03T09:37:48Z) - World Pilot: Steering Vision-Language-Action Models with World-Action Priors [21.867210989881016]
Vision-Language-Action(VLA)モデルは、大規模な事前トレーニングからセマンティックグラウンドを継承する。
World Pilotは、World-Action Model(WAM)の事前設定でポリシーを強化する
World PilotはLIBERO-PlusゼロショットOODベンチマークで84.7%という最先端のトータル成功率を達成した。
論文 参考訳(メタデータ) (2026-06-10T17:59:08Z) - Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments [96.23886784364997]
身体的な知性は、操作やナビゲーションといった個々のタスクのための特別なモデルを通してしばしば研究される。
本稿では,Qwenの視覚言語モデリングスタックを連続的な動作と軌道生成に拡張した統一的な基礎モデルであるQwen-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:36:31Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval [25.233263762328836]
空間認識型データセットAirSpatialを導入し,206K以上の命令を含む。
3DBBを提供する最初のリモートセンシンググラウンドデータセットである。
本研究では,航空機属性の微粒化認識と検索が可能な航空エージェントAirSpatialBotを開発した。
論文 参考訳(メタデータ) (2026-01-04T07:38:51Z) - AirScape: An Aerial Generative World Model with Motion Controllability [29.696659138543136]
AirScapeは、6自由度飛行エージェント用に設計された世界初の世界モデルである。
現在の視覚的入力と動きの意図に基づいて将来の観測を予測する。
論文 参考訳(メタデータ) (2025-07-10T16:05:30Z) - IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI [28.160367249993318]
Image-Goal Representations (IGOR)は、人間やさまざまなロボットにまたがる統一的で意味的に一貫したアクション空間を学習する。
IGORは大規模ロボットと人間の活動データ間の知識伝達を可能にする。
我々はIGORが人間とロボットの知識伝達と制御の新しい可能性を開くと考えている。
論文 参考訳(メタデータ) (2024-10-17T13:41:16Z) - Multi-model fusion for Aerial Vision and Dialog Navigation based on
human attention aids [69.98258892165767]
本稿では,2023年ICCV会話史のための航空航法課題について述べる。
本稿では,人間注意支援型トランスフォーマモデル(HAA-Transformer)と人間注意支援型LSTMモデル(HAA-LSTM)の融合訓練方法を提案する。
論文 参考訳(メタデータ) (2023-08-27T10:32:52Z) - RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic
Control [140.48218261864153]
本研究では,インターネット規模のデータに基づいて学習した視覚言語モデルを,エンドツーエンドのロボット制御に直接組み込む方法について検討する。
提案手法は,インターネット規模のトレーニングから,RT-2による創発的能力の獲得を可能にした。
論文 参考訳(メタデータ) (2023-07-28T21:18:02Z) - A New Path: Scaling Vision-and-Language Navigation with Synthetic
Instructions and Imitation Learning [70.14372215250535]
VLN(Vision-and-Language Navigation)の最近の研究は、RLエージェントを訓練して、フォトリアリスティックな環境で自然言語ナビゲーション命令を実行する。
人間の指導データが不足し、訓練環境の多様性が限られていることを考えると、これらのエージェントは複雑な言語基盤と空間言語理解に苦慮している。
我々は、密集した360度パノラマで捉えた500以上の屋内環境を取り、これらのパノラマを通して航法軌道を構築し、各軌道に対して視覚的に接地された指示を生成する。
4.2Mの命令-軌道対のデータセットは、既存の人間の注釈付きデータセットよりも2桁大きい。
論文 参考訳(メタデータ) (2022-10-06T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。