論文の概要: AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization
- arxiv url: http://arxiv.org/abs/2608.07557v1
- Date: Sun, 02 Aug 2026 13:32:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.433532
- Title: AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization
- Title(参考訳): AeroDPO:高忠実度知覚と自動選好最適化を備えた軽量UAVナビゲーション
- Abstract要約: UAV-VLN (Vision-Language Navigation for Unmanned Aerial Vehicles) は複雑な3D環境において高速かつ反応性の制御を必要とする。
最近の最小限のエンドツーエンドのパラダイムは、数十億のパラメータを含む巨大な言語モデルに依存しており、現実のエッジデプロイメントでは違法なレイテンシが発生している。
高忠実度視覚入力を備えた軽量な2Bモデルが,大規模な7Bベースラインの成功率と完全に一致していることを示す。
- 参考スコア(独自算出の注目度): 25.085954455657454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Navigation for Unmanned Aerial Vehicles (UAV-VLN) requires rapid and reactive control in complex 3D environments. Recent minimalist end-to-end paradigms show great promise but typically rely on massive language models containing billions of parameters, incurring prohibitive latency for real-world edge deployment. In this paper, we challenge this parameter-heavy reliance. Comprehensive cross-scale evaluations reveal the critical insight that perception quality fundamentally outweighs language reasoning capacity. We demonstrate that a lightweight 2B model equipped with high-fidelity visual inputs completely matches the overall success rates of massive 7B baselines. However, this minimalist policy exposes a fundamental robustness flaw inherent to pure Behavior Cloning (BC). Lacking explicit negative feedback, the agent fails to internalize robust spatial constraints and exhibits alarming collision rates in out-of-distribution (OOD) scenarios. To overcome this vulnerability without relying on unscalable human annotations, we propose AeroDPO, a zero-cost automated Direct Preference Optimization pipeline driven by deterministic physical simulation state rollback. Upon detecting collisions, the system autonomously rewinds the environment to extract causal reasoning errors as rejected actions, applies decoupled privileged interventions to synthesize collision-avoidance preferred maneuvers, and leverages an offline vision language inspector to filter visual ambiguities. By equipping our 2B model with this automated data flywheel, AeroDPO boosts success rates to 49.16% on unmapped scenarios while drastically suppressing collision rates, establishing a new SOTA for autonomous aerial agents.
- Abstract(参考訳): UAV-VLN (Vision-Language Navigation for Unmanned Aerial Vehicles) は複雑な3D環境において高速かつ反応性の制御を必要とする。
最近のミニマリストのエンドツーエンドのパラダイムは、非常に有望だが、数十億のパラメータを含む巨大な言語モデルに依存しており、現実のエッジデプロイメントでは違法なレイテンシが発生している。
本稿では,このパラメータ重依存に挑戦する。
総合的なクロススケール評価は、知覚品質が言語推論能力を大幅に上回っているという批判的な洞察を明らかにしている。
高忠実度視覚入力を備えた軽量な2Bモデルが,大規模な7Bベースラインの成功率と完全に一致していることを示す。
しかしながら、この最小主義の政策は、純粋な行動クローン(BC)に固有の根本的な堅牢性欠陥を露呈する。
明確な負のフィードバックが欠如しているため、エージェントは堅牢な空間的制約の内部化に失敗し、アウト・オブ・ディストリビューション(OOD)のシナリオで警告的な衝突率を示す。
計算不能な人的アノテーションに頼ることなく、この脆弱性を克服するために、決定論的物理シミュレーション状態のロールバックによって駆動される、ゼロコストの自動化されたダイレクトパラメータ最適化パイプラインであるAeroDPOを提案する。
衝突を検知すると、システムは環境を自律的に巻き戻し、因果推論エラーを排除された行動として抽出し、衝突回避優先の操作を合成するために分離された特権的介入を適用し、オフライン視覚言語インスペクタを利用して視覚的曖昧さをフィルタリングする。
われわれの2Bモデルにこの自動データフライホイールを装備することで、AeroDPOは無人のシナリオで成功率を49.16%まで引き上げ、衝突速度を劇的に抑制し、自律航空エージェントのための新しいSOTAを確立した。
関連論文リスト
- KinematicRL: A Sim-to-Real Reinforcement Learning Framework For Social Navigation With Kinodynamic Feasibility [27.73146983499444]
Deep Reinforcement Learning (DRL)はソーシャルナビゲーションを約束しているが、現実のデプロイメントは、永続的なsim-to-realギャップによって妨げられている。
この研究は、これらの制限に対処し、動的に実行可能なナビゲーションポリシーを生成する統一されたフレームワークを提示している。
実世界の環境での実験では、提案された追跡パイプラインと組み合わせることで、KinematicRLを最小限の修正で実微分駆動ロボットにデプロイできることが示されている。
論文 参考訳(メタデータ) (2026-06-10T13:07:03Z) - Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Onboard MuJoCo-based Model Predictive Control for Shipboard Crane with Double-Pendulum Sway Suppression [7.645323708488569]
海上での重荷の移動は、危険なペイロードのスウェイによって制限された効率的なクレーンの運用に依存している。
既存の制御方法はそのような設定で苦労し、しばしば単純化された分析モデルに依存している。
MuJoCo MPCフレームワークを中心とした,完全なリアルタイム制御パイプラインを示す。
論文 参考訳(メタデータ) (2026-03-17T11:43:52Z) - Optimization-Guided Diffusion for Interactive Scene Generation [52.23368750264419]
本稿では,拡散型サンプリングにおける構造的一貫性と相互作用認識を実現するための,最適化誘導型トレーニングフリーフレームワークであるOMEGAを提案する。
OMEGAは生成リアリズム,一貫性,可制御性を向上し,身体的および行動学的に有効なシーンの比率を増大させることを示す。
当社のアプローチでは,3秒未満の時間対コリションで,より近いコリジョンフレームを5ドル(約5,500円)で生成することも可能だ。
論文 参考訳(メタデータ) (2025-12-08T15:56:18Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Constrained Reinforcement Learning using Distributional Representation for Trustworthy Quadrotor UAV Tracking Control [2.325021848829375]
本研究では, 未知の空力効果に対する分散強化学習障害推定器を統合した新しいトラジェクトリトラッカーを提案する。
提案手法は, 空気力学効果の真値と推定値の不確かさを正確に同定する。
本システムは,最近の技術と比較して,累積追尾誤差を少なくとも70%改善することを示した。
論文 参考訳(メタデータ) (2023-02-22T23:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。