論文の概要: $π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation
- arxiv url: http://arxiv.org/abs/2603.25038v1
- Date: Thu, 26 Mar 2026 05:19:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.113252
- Title: $π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation
- Title(参考訳): VLAモデルの空気マニピュレーションへの物理誘導移動
- Authors: Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager,
- Abstract要約: 本研究では,操作を前提としたVLAの空中ピックアップ・アンド・プレイスタスクへの転送可能性を検討するシステムであるAirVLAを紹介する。
この"ダイナミックスギャップ"を埋めるために、ポリシのフローマッチングサンプリングプロセスに直接ペイロード制約を注入するPayload-Aware Guidanceメカニズムを導入します。
本手法は460個の実世界の累積実験により評価し,この合成データが性能の鍵となることを実証した。
- 参考スコア(独自算出の注目度): 14.43820301560473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models such as $π_0$ have demonstrated remarkable generalization across diverse fixed-base manipulators. However, transferring these foundation models to aerial platforms remains an open challenge due to the fundamental mismatch between the quasi-static dynamics of fixed-base arms and the underactuated, highly dynamic nature of flight. In this work, we introduce AirVLA, a system that investigates the transferability of manipulation-pretrained VLAs to aerial pick-and-place tasks. We find that while visual representations transfer effectively, the specific control dynamics required for flight do not. To bridge this "dynamics gap" without retraining the foundation model, we introduce a Payload-Aware Guidance mechanism that injects payload constraints directly into the policy's flow-matching sampling process. To overcome data scarcity, we further utilize a Gaussian Splatting pipeline to synthesize navigation training data. We evaluate our method through a cumulative 460 real-world experiments which demonstrate that this synthetic data is a key enabler of performance, unlocking 100% success in navigation tasks where directly fine-tuning on teleoperation data alone attains 81% success. Our inference-time intervention, Payload-Aware Guidance, increases real-world pick-and-place task success from 23% to 50%. Finally, we evaluate the model on a long-horizon compositional task, achieving a 62% overall success rate. These results suggest that pre-trained manipulation VLAs, with appropriate data augmentation and physics-informed guidance, can transfer to aerial manipulation and navigation, as well as the composition of these tasks.
- Abstract(参考訳): π_0$のようなビジョン・ランゲージ・アクション(VLA)モデルは、様々な固定ベースマニピュレータにまたがる顕著な一般化を証明している。
しかし、固定ベースアームの準静力学と飛行の不安定で非常にダイナミックな性質との基本的なミスマッチのため、これらの基礎モデルを空中プラットフォームに転送することは依然として未解決の課題である。
本研究では,操作前VLAの空中ピック・アンド・プレイスタスクへの転送可能性を調べるシステムであるAirVLAを紹介する。
視覚的表現は効果的に伝達されるが、飛行に必要な特定の制御力学は成立しない。
この「ダイナミックスギャップ」を基礎モデルを再トレーニングすることなく橋渡しするために、我々は、ペイロードの制約を直接、ポリシーのフローマッチングサンプリングプロセスに注入するPayload-Aware Guidanceメカニズムを導入します。
データ不足を克服するために、我々はさらにガウススプラッティングパイプラインを使用してナビゲーショントレーニングデータを合成する。
提案手法を460個の実世界の累積実験により評価し,この合成データが性能の鍵となることを示し,遠隔操作データのみを直接微調整するナビゲーションタスクにおいて,100%の成功率が81%に達することを示した。
私たちの推論時間の介入であるPayload-Aware Guidanceは、現実のピック・アンド・プレイス・タスクの成功を23%から50%に向上させています。
最後に,長期的構成課題におけるモデルの評価を行い,全体の成功率を62%とした。
これらの結果は、適切なデータ拡張と物理インフォームドガイダンスを備えた事前訓練された操作VLAが、これらのタスクの構成だけでなく、空中操作やナビゲーションにも移行可能であることを示唆している。
関連論文リスト
- Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA [62.16042475700567]
本稿では,遠隔操作データ収集を簡易化する共有自律型アシスタントIMCopilotを紹介する。
我々は、不均一な力と触覚モーダルを予め訓練されたVLAバックボーンにシームレスに統合するアーキテクチャであるMoDE-VLAを提案する。
我々は,複雑度を増大させる4つの課題に対するアプローチの有効性を検証し,厳密な接触量の多い課題におけるベースラインよりも2倍の成功率の向上を実証した。
論文 参考訳(メタデータ) (2026-03-09T09:02:30Z) - AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation [15.824903784302562]
VLA(Vision-Language-Action)モデルは、地上ベースのインボディードインテリジェンスにおいて顕著な成功を収めた。
エアリアル・マニピュレーション・システム(AMS)への彼らの応用は、まだほとんど探索されていないフロンティアである。
航空操作に適した最初のVLAベンチマークである textbfAIR-VLA を提案する。
論文 参考訳(メタデータ) (2026-01-29T12:09:00Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z) - AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation [24.199522837278128]
本稿では,タスク固有の条件からアクション実行を分離するタスク非依存のアクションパラダイムを提案する。
ATARAはスケーラブルなセルフ教師付きフレームワークで、人間の遠隔操作と比較して30倍以上のコレクションを高速化する。
我々はArm-Decoupled EstimationとDirection-Aware Decoderを備えた逆動的モデルであるAnyPosを提案する。
論文 参考訳(メタデータ) (2025-07-17T03:48:57Z) - Enhancing Training Data Attribution with Representational Optimization [57.61977909113113]
トレーニングデータ属性法は、トレーニングデータがモデルの予測にどのように影響するかを測定することを目的としている。
本稿では,タスク固有表現とモデル整合表現をTDAで明示的に学習することで,このギャップを埋める表現ベースアプローチであるAirRepを提案する。
AirRepは、属性品質に合わせて調整されたトレーニング可能なエンコーダと、グループワイドの影響を正確に見積もるアテンションベースのプール機構の2つの重要なイノベーションを紹介している。
論文 参考訳(メタデータ) (2025-05-24T05:17:53Z) - An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training [51.622652121580394]
Masked Image Modeling (MIM) Pre-training for Large-scale Vision Transformer (ViTs) は、学習した自己教師型ViT機能に加えて、下流での有望なパフォーマンスを実現する。
本稿では,テキストテキストレメリーで軽量なViTの微調整性能が,この事前学習パラダイムの恩恵を受けるかどうかを問う。
バニラ/階層設計(5.7M$/6.5M$)による純軽量ViTの蒸留による事前トレーニングは、ImageNet-1で79.4%$/78.9%の精度で達成できる。
論文 参考訳(メタデータ) (2024-04-18T14:14:44Z) - DiffsFormer: A Diffusion Transformer on Stock Factor Augmentation [36.75453713794983]
トランスフォーマーアーキテクチャを用いたストックファクタ生成のための拡散モデル(DiffsFormer)を提案する。
特定の下流タスクを提示すると、既存のサンプルを編集してトレーニング手順を強化するためにDiffsFormerを使用します。
提案手法は,各データセットの年次リターン率の7.2%と27.8%を相対的に改善する。
論文 参考訳(メタデータ) (2024-02-05T03:54:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。