論文の概要: FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.08359v1
- Date: Thu, 09 Jul 2026 11:17:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.507332
- Title: FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation
- Title(参考訳): FSD-VLN:空中長距離視線ナビゲーションのための高速低速デュアルシステムモデリング
- Abstract要約: Vision-Language Navigation (VLN)は、言語命令をリアルタイムの視覚入力にマッピングすることで、未知の環境での自律的なナビゲーションである。
既存の方法は、グローバルマルチモーダル理解とシーケンシャルアクション生成の間の構造的不整合に悩まされている。
FSD-VLNは,セマンティック推論と低高度飛行コマンド生成を混在させる高速なデュアルシステムアーキテクチャである。
- 参考スコア(独自算出の注目度): 33.92221208368759
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Navigation (VLN) enables UAV autonomous navigation in unknown environments by mapping language instructions to real-time visual inputs. Compared with GPS-dependent or pre-programmed navigation, VLN supports intuitive human-machine interaction and stronger environmental adaptability, requiring tight integration of high-level semantic reasoning and low-latency flight control.Existing methods suffer from structural misalignment between global multimodal understanding and sequential action generation, causing jittery trajectories and severe decision latency for long-horizon aerial navigation. To solve this issue, we propose FSD-VLN, a fast-slow dual-system architecture disentangling semantic reasoning and low-latency flight command generation.The framework has two asynchronous branches: a slow stream extracting stable semantic priors from pre-trained vision-language models, and a Diffusion Transformer (DiT) fast stream modeling cross-temporal action distributions to produce consistent flight outputs. We further introduce a time-aware adaptive optimizer to stabilize long-sequence training and reduce gradient oscillation.Large-scale low-altitude simulation experiments show FSD-VLN achieves up to 2X higher navigation success rates on unseen scenes than SOTA methods, while cutting single-action inference delay and total task runtime by over 50%. Our work validates the benefit of decoupled semantic-control modeling and provides a practical paradigm for long-horizon aerial VLN.
- Abstract(参考訳): Vision-Language Navigation (VLN)は、言語命令をリアルタイムで視覚入力にマッピングすることで、未知の環境で無人ナビゲーションを可能にする。
GPSに依存したナビゲーションや事前にプログラムされたナビゲーションと比較して、VLNは直感的なヒューマンマシンインタラクションと環境適応性をサポートし、高レベルのセマンティック推論と低遅延飛行制御の緊密な統合を必要とする。
この問題を解決するために、FSD-VLNという高速なデュアルシステムアーキテクチャで、セマンティック推論と低レイテンシのフライトコマンド生成を行う。このフレームワークは、事前訓練された視覚言語モデルから安定したセマンティック事前を抽出する緩やかなストリームと、時間的作用分布をモデル化して一貫した飛行出力を生成するDiffusion Transformer(DiT)という2つの非同期分岐を持つ。
大規模低高度シミュレーション実験により、単一動作の推論遅延と全タスク実行時間を50%以上削減しつつ、未確認シーンにおけるFSD-VLNの航法成功率を最大2倍に向上することが示された。
本研究は,非結合なセマンティック・コントロール・モデリングの利点を検証し,長距離航空VLNの実践的パラダイムを提供する。
関連論文リスト
- FreqNav: Stage-Wise Frequency Routing for Object-Oriented Aerial Vision-Language Navigation [20.62861089679206]
長距離航法のための軽量適応認識フレームワークを提案する。
FreqNavは、現在のナビゲーションステージに従って、周波数コンポーネント間で視覚トークンを動的に再配置する。
実験によると、FreqNavは強いベースラインを上回り、およそ3倍高速な推論を実現している。
論文 参考訳(メタデータ) (2026-08-02T03:49:54Z) - DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments [55.73595346639892]
我々は高レベルナビゲーション推論と実行可能なUAV動作を橋渡しするDynFlyを提案する。
DynFlyはB-スプライン制御点空間のエキスパート軌道を表し、Spline-DiTジェネレータを用いて条件付き軌道生成を学習する。
OpenUAV UAV-VLNベンチマークの実験では、DynFlyは航法性能と軌道品質の両方を改善している。
論文 参考訳(メタデータ) (2026-06-30T13:33:48Z) - Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation [22.062997228195815]
言語誘導型UAVエージェントは、スムーズで物理的に実行可能な連続飛行コマンドを生成しながら、長い水平意味指示を実行しなければならない。
textbfFine-fine textbfLong-horizon textbf Instruction-textbfGuided benchmark for textbfHybrid UAV navigation and reasoning textbfTasks。
UAVエージェントにタスク実行状況とミッション計画に対するリアルタイム飛行中の推論能力を与えるため、我々は、
論文 参考訳(メタデータ) (2026-06-05T02:23:05Z) - SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation [19.9336847486232]
SEDualVLNは空間的に拡張されたデュアルシステムビジョンランゲージナビゲーションフレームワークである。
System 1は、グローバルな空間認識とローカルな空間認識の両方で拡張されたVLMモデルであり、アクション生成に使用される。
System 2は一般的なMLLMとマッピングモジュールを統合し、MLLMはリアルタイム3Dマップのトップダウンビューを活用することで、経路ポイントを計画する。
論文 参考訳(メタデータ) (2026-05-17T04:12:56Z) - MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving [54.57163800903507]
我々は、自動運転のための最初の統合ストリーミングVLAアーキテクチャであるMindVLA-U1を紹介する。
統一されたVLMバックボーンは、1つの共有表現に1つのフォワードパスでAR言語トークンとフローマッチングされた連続的なアクショントラジェクトリを生成する。
ロングテールのWOD-E2Eベンチマークでは、MindVLA-U1が経験豊富な人間のドライバーを初めて上回った。
論文 参考訳(メタデータ) (2026-05-12T18:09:42Z) - History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation [18.716145266309802]
Vision-Language Navigation (LNV)は、ロボットが視覚的に接地された環境で自然言語の指示に従うことを可能にする。
近年のVision-Language-Action-Modelでは,ナビゲーション性能は高いが,リアルタイムデプロイメントを制限している計算遅延は大きい。
VLNベースのVLNに適した学習自由な視覚言語フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-06T17:03:16Z) - AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge [49.66156306240961]
高レイテンシは制御ループを壊し、リアルタイムデプロイメントでは安全でない強力なモデルをレンダリングする。
リアクティブ実行からセマンティック推論を分離する非同期制御フレームワークであるAsyncVLAを提案する。
AsyncVLAは、最先端のベースラインよりも40%高い成功率を達成する。
論文 参考訳(メタデータ) (2026-02-13T21:31:19Z) - Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation [45.54638103934175]
本稿では,高レベル推論と低レベル動作実行を統合した視覚言語ナビゲーションシステムであるDualVLNを提案する。
System 1は、System 2の明示的なピクセル目標と潜在機能の両方を活用して、スムーズで正確な軌跡を生成することで、"高速に動く"。
システムは全てのVLNベンチマークや実世界の実験で先行手法よりも優れており、堅牢な長期計画とリアルタイム適応性を示している。
論文 参考訳(メタデータ) (2025-12-09T02:29:36Z) - DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation [73.80968452950854]
Vision-Language Navigation in Continuous Environments (VLN-CE) は、エージェントが自由形式の3D空間を通して自然言語の指示に従う必要がある。
既存のVLN-CEアプローチは通常、2段階のウェイポイント計画フレームワークを使用する。
本稿では,エンドツーエンド最適化VLN-CEポリシとしてDAgger Diffusion Navigation (DifNav)を提案する。
論文 参考訳(メタデータ) (2025-08-13T02:51:43Z) - VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning [77.34267241692706]
Vision-Language Navigation(VLN)は、エージェントが自然言語命令を使用して現実世界の環境をナビゲートする必要がある、AIの実施における中核的な課題である。
本稿では、LVLM(Large Vision-Language Models)を利用して、エゴセントリックな動画ストリームを連続的なナビゲーションアクションに変換するエンドツーエンドフレームワークであるVLN-R1を提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。