論文の概要: From Local Whole-Body VLA Behaviors to Scene-Scale Aerial Manipulation
- arxiv url: http://arxiv.org/abs/2609.39670v1
- Date: Wed, 30 Sep 2026 13:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.820082
- Title: From Local Whole-Body VLA Behaviors to Scene-Scale Aerial Manipulation
- Title(参考訳): 局所的な全体VLA挙動からScene-Scale Aerial Manipulationへ
- Abstract要約: 視覚言語アクション(VLA)モデルはタスク条件付きインタラクションを可能にするが、それらをシーンスケールの空中操作に拡張することは依然として困難である。
合成ポリシトレーニングとシーンスケール実行のための統合された枠組みを, 無人航空機マニピュレータ (UAM) に提示する。
シーン再構成可能なパイプラインは、物理プラットフォームを使用せずに、タスク条件付き、キノダイナミックに実現可能な軌道と、VLAトレーニングのための同期マルチビュー観測を合成する。
- 参考スコア(独自算出の注目度): 24.05452779162353
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-language-action (VLA) models enable task-conditioned interaction, but extending them to scene-scale aerial manipulation remains challenging due to costly whole-body demonstrations, latency-induced action-state misalignment, and cross-site behavior composition. We present a unified framework for synthetic policy training and scene-scale execution on articulated uncrewed aerial manipulators (UAMs). A scene-reconfigurable pipeline synthesizes task-conditioned, kinodynamically feasible trajectories and synchronized multiview observations for VLA training without physical-platform demonstrations. Measured-progress-aligned realization (MPAR) aligns asynchronously returned action chunks with measured execution progress and realizes them as continuous, dynamically feasible trajectories. A relational Scene Graph grounds language goals to object instances and feasible interaction regions, while topology-guided transfer connects local behaviors across sites. Local VLA skills achieve 39/60 successes (65.0%) in simulation under oracle target and feasible-handoff conditions. Under 500-ms added latency, with and without a transient command-update stall, MPAR reduces median takeover phase error by 0.212 s over nominal-time alignment. The complete system completes 21/50 simulated multi-site missions (42.0%) and is further validated on a physical articulated UAM.
- Abstract(参考訳): 視覚-言語-アクション(VLA)モデルはタスク条件付きインタラクションを可能にするが、コストのかかる全身のデモンストレーション、遅延による動作-状態の不一致、およびクロスサイト行動構成のために、それらをシーンスケールの空中操作に拡張することは依然として困難である。
本稿では, 合成政策訓練とシーンスケール実行のための統一的な枠組みを, 無人航空機マニピュレータ (UAM) 上で提案する。
シーン再構成可能なパイプラインは、物理プラットフォームを使用せずに、タスク条件付き、キノダイナミックに実現可能な軌道と、VLAトレーニングのための同期マルチビュー観測を合成する。
測定プログレス整合現実化(MPAR)は、非同期に返されるアクションチャンクを測定された実行進捗と整合させ、連続的かつ動的に実現可能な軌道として実現する。
リレーショナルScene Graphは、言語目標をオブジェクトインスタンスと実行可能なインタラクションリージョンに置き、トポロジ誘導転送はサイト間のローカルな振る舞いを接続する。
局所的なVLAスキルは、オラクルターゲットと実現可能なハンドオフ条件下でのシミュレーションで39/60成功(65.0%)を達成した。
500ミリ秒の遅延を追加し、過渡的なコマンド更新ストールがなければ、MPARは名目時間アライメントよりも中央のテイクオーバーフェーズエラーを0.212秒削減する。
完全なシステムは、21/50のシミュレーションされたマルチサイトミッション(42.0%)を完了し、物理的に調音されたUAMでさらに検証される。
関連論文リスト
- AeroManip-VLA: Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations [11.854784625103578]
本稿では,航空VLAデータ生成とポリシー評価のためのスケーラブルなベンチマークであるAeroManip-VLAを提案する。
AeroManip-VLAは、低レベルのペイロード対応飛行と操作制御を備えたGPUアクセラレーションシミュレーションフレームワークを提供する。
本研究では,AeroManip-VLAが実世界展開前のシミュレーションにおいて,スケーラブルな空中操作データ生成,構造化軌道解析,系統的なVLA評価を可能にすることを示す。
論文 参考訳(メタデータ) (2026-09-29T07:34:54Z) - SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation [16.77451640494332]
本稿では、最初のRGB観測と言語命令を完全なアクティベーションコマンドシーケンスにマッピングするフレームワークSWIMを提案する。
ビジョン・ランゲージ・アクション(VLA)ポリシーであるSWIM-VLAは、RGB観測、言語指示、腱状態の共有表現を通じて、拡散アクションヘッドと視覚ソフト・プロプライオセプション(VSP)を組み合わせる。
本研究は,平面型腱駆動型ソフトロボットにおけるSWIMのパッケージング,リーチ,グリーピングについて検討し,グリーティングターゲットを固定した。
論文 参考訳(メタデータ) (2026-09-15T11:41:36Z) - Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning [21.67233368353003]
本稿では,アクション生成ループから空間的グラウンドを明示的に抽出する分離アーキテクチャであるSVP-ILを提案する。
実験では、SVP-ILは最先端のVLAや純粋なビジュモータベースラインよりも著しく優れている。
論文 参考訳(メタデータ) (2026-06-24T03:45:06Z) - Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance [108.46436073194546]
効果的なプランニングは、ローカルで、視覚的に基礎があり、内部で生成され、アクションと直接整合するべきである、と私たちは主張する。
本稿では,タスク条件付きアベイランスをVLAモデル内で明示的な視覚的計画インターフェースとして内包する統合フレームワークであるAfford-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-22T20:43:47Z) - From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model [76.88595728131288]
VLA(Vision-Language-Action)モデルは、分散シフト時にしばしば性能劣化に悩まされる。
時間的コヒーレントな行動表現の学習を通じて堅牢な操作を容易にするフレームワークである textbfBehaviorVLA を提案する。
RoboTwin 2.0、LIBERO、CALVINの実験では、最先端の成功率は58%、98%、および4.36(Avg.Len)である。
論文 参考訳(メタデータ) (2026-05-21T16:14:19Z) - DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions [0.5599792629509227]
本稿では,人-物間相互作用(HOI)データから外乱操作を学習するフレームワークであるDexSynを紹介する。
また,プロテローム受容履歴からのsim-to-realトランスファーを可能にするコンタクト・アンド・オリエンテーション・アダプティブ・モジュールを提案する。
論文 参考訳(メタデータ) (2026-05-07T09:31:43Z) - Universal Pose Pretraining for Generalizable Vision-Language-Action Policies [83.39008378156647]
既存のVision-Language-Action(VLA)モデルは、しばしば機能崩壊と訓練効率の低下に悩まされる。
本稿では,VLAトレーニングを3次元空間前駆体抽出のための事前学習フェーズに分離する,分離されたパラダイムであるPose-VLAを提案する。
我々のフレームワークは2段階の事前学習パイプラインに従い、ポーズと動きのアライメントによる基本的な空間接地を確立する。
論文 参考訳(メタデータ) (2026-02-23T11:00:08Z) - MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer [55.982504915794514]
クロス・エボディメント・ポリシーは一般的に共有プライベート・アーキテクチャに依存している。
本報告では,MOTIFを効率よく数発のクロスボディーメントトランスファーに適用する。
我々はMOTIFが数発の転送シナリオにおいて強いベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-02-14T13:21:40Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation [52.83157499300261]
時間的推論と閉ループ適応を統合した動的オブジェクト操作のフレームワークであるDynamicVLAを提案する。
我々は、自動データ収集パイプラインでスクラッチから構築されたDynamic Object Manipulationベンチマークを紹介します。
広範囲な評価は、応答速度、知覚、一般化の顕著な改善を示している。
論文 参考訳(メタデータ) (2026-01-29T18:59:51Z) - AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation [21.23747444669735]
VLAモデル(AC2-VLA)に対するアクションコンテキスト対応適応計算を提案する。
AC2-VLAは、タイムステップ間の認識再利用、トークンプルーニング、統一メカニズム内のモデルコンポーネントの選択的な実行を適応的に行う。
ロボット操作ベンチマークの実験では、AC2-VLAはFLOPを29.4%まで減らし、最大1.79倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-27T14:10:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。