論文の概要: RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2608.09467v1
- Date: Mon, 10 Aug 2026 11:37:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.225295
- Title: RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation
- Title(参考訳): RecoverFly: 航空ビジョンランゲージナビゲーションのための訓練後フレームワーク
- Abstract要約: 無人航空機の視覚言語ナビゲーション(UAV-VLN)は、視覚的な観察と言語指示を信頼性のある飛行行動に変換するためにエージェントを必要とする。
エンドツーエンドのUAV-VLAポリシを対象とした,障害対応のRLポストトレーニングフレームワークであるRecoverFlyを提案する。
- 参考スコア(独自算出の注目度): 16.942230083606674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unmanned aerial vehicle vision-language navigation (UAV-VLN) requires agents to translate visual observations and language instructions into reliable flight actions in complex environments. Although recent end-to-end UAV vision-language-action (UAV-VLA) policies reduce reliance on separately designed perception, planning, and control modules, their behavior-cloning objectives provide limited corrective supervision for interactive closed-loop execution. Reinforcement learning (RL) offers a promising solution, while its effectiveness is constrained by inefficient use of samples, long-tailed scene distributions, and policy distribution shift during optimization. To this end, we propose RecoverFly, a failure-aware RL post-training framework for end-to-end UAV-VLA policies. Specifically, RecoverFly adapts token-level RL for stable optimization of grammar-constrained autoregressive UAV actions, revisits unresolved failure cases to strengthen corrective learning and sample utilization, and combines a two-stage long-tail scene curriculum with reference-policy regularization to improve scene adaptation while preserving acquired capabilities. Experiments on the TravelUAV benchmark demonstrate that RecoverFly achieves the best performance on the seen, unseen-map, and unseen-object splits. Moreover, compared to the AerialVLA initialization, RecoverFly improves success rate by 3.12 to 8.37 percentage points under a total rollout budget of about 30\% of the training-set size, validating its effectiveness, robustness, and generalization capabilities.
- Abstract(参考訳): 無人航空機の視覚言語ナビゲーション(UAV-VLN)は、複雑な環境で視覚的な観察と言語指示を信頼できる飛行行動に変換するためにエージェントを必要とする。
最近のUAV-VLA(End-to-end UAV vision-Language-action)ポリシーは、個別に設計された知覚、計画、制御モジュールへの依存を減らすが、それらの行動閉鎖目標は、対話的なクローズドループ実行のための限定的な修正的監視を提供する。
強化学習(Reinforcement Learning, RL)は有望な解を提供するが、その有効性は、非効率なサンプルの使用、長い尾のシーン分布、最適化中のポリシー分布シフトによって制約される。
この目的のために、我々は、エンドツーエンドUAV-VLAポリシーのための障害対応RLポストトレーニングフレームワークであるRecoverFlyを提案する。
具体的には、RecoverFlyは、文法制約付き自己回帰的UAVアクションの安定的な最適化にトークンレベルRLを適用し、未解決の障害事例を再検討し、修正学習とサンプル利用を強化し、2段階のロングテールシーンカリキュラムと参照型正規化を組み合わせて、取得した能力を保ちながらシーン適応を改善する。
TravelUAVベンチマークの実験では、RecoverFlyは見た、見えないマップ、見えないオブジェクトの分割で最高のパフォーマンスを達成している。
さらに、AerialVLAの初期化と比較して、RecoverFlyはトレーニングセットサイズの約30%のロールアウト予算の下で成功率を3.12から8.37ポイント改善し、その有効性、堅牢性、一般化能力を検証する。
関連論文リスト
- CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking [6.465600276213322]
VLA(Vision-Language-Action)ポリシーは、視覚的標的を効果的に追跡することができるが、建物、植生、道路沿いの物体が視線を塞ぐと、その性能は劣化することが多い。
本稿では,空間認識型VLAモデルCosFly-VLAについて述べる。
OpenVLAとは対照的に、CosFly-VLA-0.8Bはオープンループ平均変位誤差(ADE)を外見テストで34.1%、目に見えないテストで35.3%削減する。
論文 参考訳(メタデータ) (2026-07-16T13:52:08Z) - VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies [58.65913948991329]
正確な低レイテンシVLAポリシーのためのビジュアル中間推論フレームワークであるVISUALTHINK-VLAを提案する。
私たちのブートストラップ哲学は、効果的な視覚的思考でアクションを導くことです。
これは、デコードオーバーヘッドを回避しながら空間的精度を保った、コンパクトなビジュアル・エビデンスインターフェースを通じてアクション予測をブートストラップする。
論文 参考訳(メタデータ) (2026-05-28T14:36:53Z) - Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts [18.44683570310399]
低品質なアクションは、実行中に物理的な障害を引き起こしたり、冗長なレンダリングコストで世界モデルのロールアウトを誤解させるおそれがある。
実演や世界モデルの想像力の前にプリエンプティブ・アクションアセスメントの妥当性を示す統一型ランタイム検証アーキテクチャであるPre-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-21T13:13:31Z) - LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models [13.30873593845724]
LoopVLAは、表現の洗練、アクション予測、十分性推定を学習する、リカレントなVision-Language-Actionアーキテクチャである。
この結果から,LoopVLAはVLAポリシーの効率性向上のフロンティアを推し進め,パラメータを45%削減し,推論スループットを最大1.7倍向上させることを示した。
論文 参考訳(メタデータ) (2026-05-11T03:51:22Z) - RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models [90.39703013636868]
RePO-VLAは、リカバリ駆動のポリシー最適化フレームワークである。
成功、回復、失敗の軌跡に異なる役割を割り当てる。
対人的な成功は、平均で20%から75%、実世界の規模で80%まで上昇する。
論文 参考訳(メタデータ) (2026-05-10T08:24:05Z) - Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures [14.313346858887286]
自律走行のためのVLA(Vision-Language-Action)モデルは、強化学習(Reinforcement Learning、RL)最適化時にしばしばパフォーマンス高原に到達する。
この停滞は、以前のスーパービジョン・ファインチューニング(SFT)によって制約された探査能力から生じる。
構造化された診断フィードバックでRLを増強するフレームワークであるELF-VLA(Explicit Learning from Failures)を提案する。
論文 参考訳(メタデータ) (2026-03-01T11:41:22Z) - AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation [21.23747444669735]
VLAモデル(AC2-VLA)に対するアクションコンテキスト対応適応計算を提案する。
AC2-VLAは、タイムステップ間の認識再利用、トークンプルーニング、統一メカニズム内のモデルコンポーネントの選択的な実行を適応的に行う。
ロボット操作ベンチマークの実験では、AC2-VLAはFLOPを29.4%まで減らし、最大1.79倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-27T14:10:39Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning [55.83415345423854]
批判的オブジェクト指向(CO)推論と強化学習(RL)を統合した新しいエンドツーエンド駆動フレームワークCOVLM-RLを提案する。
CARLAシミュレータで行った実験により、COVLM-RLはトレーニング運転環境における成功率を30%向上することが示された。
論文 参考訳(メタデータ) (2025-12-10T06:18:16Z) - Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization [61.55616421408666]
低高度経済ネットワーク(LAENets)は、航空監視、環境検知、セマンティックデータ収集など、様々な応用を可能にしている。
オンボードビジョン(VLM)は、リアルタイムな推論を提供するが、オンボードの動的ネットワーク条件は限られている。
動的LEENet条件下での通信効率を向上させるUAV対応LEENetシステムを提案する。
論文 参考訳(メタデータ) (2025-10-11T05:11:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。