論文の概要: FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation
- arxiv url: http://arxiv.org/abs/2608.00635v1
- Date: Sat, 01 Aug 2026 12:43:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.832583
- Title: FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation
- Title(参考訳): FlowPilot: アジャイルUAVナビゲーションのためのリアルタイムワールドアクションモデリング
- Abstract要約: FlowPilotは、UAVナビゲーションを深度からリアルタイムに行うための、コンパクトなワールドアクションモデルである。
デュアルストリーム・オブ・トランスフォーマーは、ビデオとアクションの専門家を共通の注意で結合し、将来的な予測と軌跡生成を相互に通知する。
- 参考スコア(独自算出の注目度): 18.092834753587454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present FlowPilot, a compact world-action model for real-time onboard UAV navigation from depth. Unlike map-then-optimize pipelines that require local reconstruction or end-to-end policies that lack explicit scene prediction, FlowPilot jointly denoises future depth observations and executable trajectories with flow matching. A dual-stream mixture-of-transformers couples video and action experts through shared attention, allowing future-scene prediction and trajectory generation to inform each other. At deployment, the model runs action-centrically and outputs only a trajectory. To ensure trackability, actions are parameterized as degree-7 Bernstein polynomials: the current state constrains the initial control points, and the network predicts five free control points, yielding C^2-continuous references with closed-form velocity, acceleration and jerk. FlowPilot is trained on a three-level depth pyramid spanning high-throughput simulation, photorealistic simulation, and real onboard data. In closed-loop simulation, it outperforms learning- and optimization-based baselines under increasing clutter and commanded speeds up to 8m/s. On a physical quadrotor, the full perception-to-action pipeline runs in under 18ms on a Jetson Orin NX and reaches 5.5m/s in cluttered indoor and forest environments using only onboard sensing and computation.
- Abstract(参考訳): 本稿では,UAVナビゲーションを奥行きからリアルタイムに行うための,コンパクトなワールドアクションモデルであるFlowPilotを紹介する。
ローカル再構築や明示的なシーン予測を欠いたエンドツーエンドポリシを必要とするマップテーマ最適化パイプラインとは異なり、FlowPilotは、将来的な深度観測とフローマッチングによる実行可能なトラジェクトリを共同で識別する。
デュアルストリーム・オブ・トランスフォーマーは、ビデオとアクションの専門家を共通の注意で結合し、将来的な予測と軌跡生成を相互に通知する。
デプロイ時に、モデルはアクション中心で実行され、軌道のみを出力する。
現在の状態は初期制御点を制約し、ネットワークは5つの自由制御点を予測し、C^2-連続参照を閉形式速度、加速度、ジャークとする。
FlowPilotは、高スループットシミュレーション、フォトリアリスティックシミュレーション、実際のオンボードデータにまたがる3レベルの深さピラミッドでトレーニングされている。
クローズドループシミュレーションでは、学習ベースラインや最適化ベースラインよりもクラッタが増加し、最大8m/sの速度で性能が向上する。
物理的四極子では、完全な知覚と反応のパイプラインはジェットソン・オリンのNX上で18ms以下で動作し、センサーと計算のみを使用して、乱雑な屋内および森林環境において5.5m/sに達する。
関連論文リスト
- MAD: Mapping-Aware World Models for Agile Quadrotor Flight [47.458890396048126]
マッピング・アウェア・ドリーマー(英: Mapping-Aware Dreamer、MAD)は、視覚に基づく四面体飛行のための幾何学的世界モデルである。
MADは、ロボセントリックな占有率と可視性グリッドマップを再構成する反復潜時ダイナミクスを学習する。
室内・屋外での安全な飛行を限定センシングで実証し,シミュレーションで9.66m/s,実世界の森林実験で5.05m/sに達した。
論文 参考訳(メタデータ) (2026-06-03T07:17:57Z) - RoboFlow4D: A Lightweight Flow World Model Toward Real-Time Flow-Guided Robotic Manipulation [29.85979864354417]
3D環境での計画と行動は、現実世界におけるロボット操作の基本的な能力である。
物理的3次元空間における時間的動きを推定することにより知覚と計画を統合する軽量なフローワールドモデルであるRoboFlow4Dを紹介する。
論文 参考訳(メタデータ) (2026-05-17T16:11:22Z) - FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving [20.991905328262746]
本稿では,新しいエゴシーン対話型モデリングパラダイムを提案する。
人間の認識にインスパイアされたこのパラダイムは、エゴ-車両に対するシーンフローとして、エゴ-シーンの相互作用を表現している。
その内部では、エゴ誘導シーン分割がまず基本的なフローユニットを構築してシーンフローを定量化する。
そして、フロー単位に基づいて、空間的および時間的フロー予測を行い、シーンフローのダイナミクスをモデル化する。
論文 参考訳(メタデータ) (2026-03-11T16:28:53Z) - CoFL: Continuous Flow Fields for Language-Conditioned Navigation [14.35468089349405]
CoFLは、鳥眼ビュー(BEV)観察と言語指導をナビゲーションのための連続フローフィールドにマッピングするエンドツーエンドのポリシーである。
混合分布の訓練により、CoFLはモジュラービジョン・ランゲージ・モデル(VLM)ベースのプランナーよりも大幅に優れている。
論文 参考訳(メタデータ) (2026-03-03T11:02:55Z) - Trace Anything: Representing Any Video in 4D via Trajectory Fields [98.85848134960172]
軌道場 (Trajectory Field) は、各フレーム内の各ピクセルに時間の連続した3次元軌跡関数を割り当てる密集写像である。
我々は,1つのフィードフォワードパスで軌道場全体を予測するニューラルネットワークであるTrace Anythingを紹介する。
私たちは、新しいプラットフォームからのデータを含む大規模な4Dデータに基づいて、Trace Anythingモデルをトレーニングしました。
論文 参考訳(メタデータ) (2025-10-15T17:59:04Z) - SpaRC-AD: A Baseline for Radar-Camera Fusion in End-to-End Autonomous Driving [5.343552118560704]
SpaRC-ADは、計画指向の自律運転のためのクエリベースのエンドツーエンドカメラレーダ融合フレームワークである。
本手法は、複数の自律運転タスクにおいて、最先端のビジョンのみのベースラインよりも強力な改善を実現する。
論文 参考訳(メタデータ) (2025-08-14T12:02:41Z) - m4: A Learned Flow-level Network Simulator [14.802940782072122]
フローレベルのシミュレータは、動的に割り当てられた送信速度を持つ連続フローとしてトラフィックを抽象化する。
機械学習を用いて関心のネットワークのダイナミクスを学習する,正確でスケーラブルなフローレベルシミュレータであるm4を提案する。
論文 参考訳(メタデータ) (2025-03-03T17:51:08Z) - Gaussian Splatting to Real World Flight Navigation Transfer with Liquid Networks [93.38375271826202]
本研究では,シミュレート・トゥ・リアルな視覚四重項ナビゲーションタスクにおける分布シフトに対する一般化とロバスト性を改善する手法を提案する。
まず,擬似飛行力学とガウススプラッティングを統合してシミュレータを構築し,その後,液状ニューラルネットワークを用いてロバストなナビゲーションポリシーを訓練する。
このようにして、我々は3次元ガウススプラッティングラディアンス場レンダリング、専門家による実演訓練データのプログラミング、およびLiquid Networkのタスク理解能力の進歩を組み合わせたフルスタックの模倣学習プロトコルを得る。
論文 参考訳(メタデータ) (2024-06-21T13:48:37Z) - Trace and Pace: Controllable Pedestrian Animation via Guided Trajectory
Diffusion [83.88829943619656]
本研究では,現実的な歩行者軌跡生成手法と,ユーザ定義目標を達成するために制御可能なフルボディアニメーションを提案する。
我々のガイド付き拡散モデルでは,対象とする経路,速度,特定社会集団による軌道の制約が可能である。
本稿では,アニメーションコントローラのRLトレーニング中に学習した値関数を用いて,拡散を誘導し,特定のシナリオに適した軌道を生成することを提案する。
論文 参考訳(メタデータ) (2023-04-04T15:46:42Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z) - Real-time Object Detection for Streaming Perception [84.2559631820007]
ストリーミング知覚は,ビデオオンライン知覚の1つの指標として,レイテンシと精度を共同評価するために提案される。
ストリーミング知覚のためのシンプルで効果的なフレームワークを構築します。
提案手法はArgoverse-HDデータセット上での競合性能を実現し,強力なベースラインに比べてAPを4.9%向上させる。
論文 参考訳(メタデータ) (2022-03-23T11:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。