論文の概要: No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
- arxiv url: http://arxiv.org/abs/2607.19288v1
- Date: Tue, 21 Jul 2026 16:59:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.496237
- Title: No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
- Title(参考訳): 訓練なし、飛行改善:UAVナビゲーションのためのテストタイムスケールVLM
- Abstract要約: テストタイムスケーリングは、視覚言語モデル(VLM)の推論性能を改善するための有望な方法を提供する
本稿では,UAV用VLNにテスト時間スケーリングを適用するための,シンプルで効果的なアプローチについて検討する。
我々は、追加のモデルトレーニングを必要としない反復的な洗練プロセスを通じて、ナビゲーション推論を強化し、モデルの精度と安全性を向上させるために、初期ナビゲーション計画の再評価を指導する。
- 参考スコア(独自算出の注目度): 18.43685294681289
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-time scaling offers a promising method to improve the inference performance of Vision-Language Models (VLMs) without additional training. Existing approaches to vision-language navigation (VLN) for Unmanned Aerial Vehicle (UAV) typically relies on a single inference pass, which can falter in complex environments by producing suboptimal or unsafe trajectories. In this paper, we explore a simple and effective approach to apply test-time scaling to VLN for UAV. We enhance navigation reasoning through an iterative refinement process that requires no extra model training, guiding the model to re-evaluate its initial navigation plan for better accuracy and safety. Our method first prompts the model to generate multiple parallel candidates and then performs a self-correction step, achieving deeper and more robust planning without changing the underlying model. To further strengthen decision-making, we design a multi-criteria scoring function to evaluate the refined candidates based on safety, goal alignment, and forward-progress. This simple yet powerful combination enables a frozen UAV navigation VLMs to self-correct and generate more accurate and reliable flight plans, achieving SOTA performance in this task.
- Abstract(参考訳): テストタイムスケーリングは、追加のトレーニングなしでビジョンランゲージモデル(VLM)の推論性能を改善するための有望な方法を提供する。
無人航空機 (UAV) の既存の視覚言語ナビゲーション (VLN) へのアプローチは、通常は1つの推論パスに依存しており、これは準最適または安全でない軌道を生成することで複雑な環境に干渉することができる。
本稿では,UAV用VLNにテスト時間スケーリングを適用するための,シンプルで効果的なアプローチについて検討する。
我々は、追加のモデルトレーニングを必要としない反復的な洗練プロセスを通じて、ナビゲーション推論を強化し、モデルの精度と安全性を向上させるために、初期ナビゲーション計画の再評価を指導する。
提案手法はまず,複数の並列候補を生成することをモデルに促し,次に自己補正を行い,基礎となるモデルを変更することなく,より深く,より堅牢な計画を立てる。
意思決定をさらに強化するために,安全性,ゴールアライメント,前進率に基づいて,改良された候補を評価するための多基準スコアリング関数を設計する。
このシンプルで強力な組み合わせにより、凍結したUAVナビゲーションVLMが自己修正され、より正確で信頼性の高い飛行計画が作成され、SOTAの性能が達成される。
関連論文リスト
- AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models [1.0323063834827415]
AdaVLAは、高速かつ高精度なフローマッチングベースのビジョン・ランゲージ・アクションモデルのための、オンラインでトレーニング不要な適応フレームワークである。
本手法は, それぞれ$_0.5$とX-VLAで1.87times$と$2.24times$の高速化を実現し, 成功率の低下を無視できることを示す。
論文 参考訳(メタデータ) (2026-08-29T11:44:18Z) - Self-Predictive Representation for Autonomous UAV Object-Goal Navigation [0.44394014369725115]
強化学習(Reinforcement Learning, RL)は、UAVに複雑なナビゲーションポリシーを学ぶ権限を与える。
オブジェクトゴールナビゲーション(OGN)設定では、ターゲット認識は追加の課題として発生する。
本研究では,3次元OGN問題の解法におけるデータサンプル効率の問題に対処する。
論文 参考訳(メタデータ) (2026-04-22T22:40:11Z) - APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model [21.492007331670376]
本稿では,自律ナビゲーションのための適応型プランナー学習モデル(textscapplv)を提案する。
textscapplvは、ナビゲーション性能と一般化の両方において、既存のメソッドよりも優れています。
我々は,収集した航法軌道からの教師付き学習微調整と,航法性能をさらに最適化するための強化学習微調整の2つの訓練戦略を開発した。
論文 参考訳(メタデータ) (2026-03-09T19:23:09Z) - History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation [18.716145266309802]
Vision-Language Navigation (LNV)は、ロボットが視覚的に接地された環境で自然言語の指示に従うことを可能にする。
近年のVision-Language-Action-Modelでは,ナビゲーション性能は高いが,リアルタイムデプロイメントを制限している計算遅延は大きい。
VLNベースのVLNに適した学習自由な視覚言語フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-06T17:03:16Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization [61.55616421408666]
低高度経済ネットワーク(LAENets)は、航空監視、環境検知、セマンティックデータ収集など、様々な応用を可能にしている。
オンボードビジョン(VLM)は、リアルタイムな推論を提供するが、オンボードの動的ネットワーク条件は限られている。
動的LEENet条件下での通信効率を向上させるUAV対応LEENetシステムを提案する。
論文 参考訳(メタデータ) (2025-10-11T05:11:21Z) - Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving [55.13109926181247]
離散拡散による安全な軌道生成のためのリフレクション機構を統合した学習ベースのフレームワークであるReflectDriveを紹介する。
我々のアプローチの中心は、勾配のない反復的な自己補正を行う、安全を意識した反射機構である。
本手法は目標条件付き軌道生成から始まり,マルチモーダル運転動作をモデル化する。
論文 参考訳(メタデータ) (2025-09-24T13:35:15Z) - ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation [57.399685080574756]
既存のMLLMベースのVLNメソッドは模倣学習(IL)に依存しており、ポストトレーニングにDAggerを使用することが多い。
マルチターンRLによるアクティブな探索を可能にするVLNフレームワークであるActiveVLNを提案する。
実験の結果,ActiveVLN は DAgger ベースと RL ベースのポストトレーニング手法と比較して,IL ベースラインよりも最大の性能向上を実現していることがわかった。
論文 参考訳(メタデータ) (2025-09-16T03:31:46Z) - A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation [30.207690822989292]
自己修正(SC-)VLAフレームワークは、アクションを直接予測する高速システムと、失敗したアクションを反映する遅いシステムを統合する。
高速システムでは,パラメータ効率のよい微調整を取り入れて,モデルにポーズ予測機能を持たせる。
動作が遅いシステムでは,動作不良後の人間の反射を模倣するように設計された,故障訂正のためのチェーン・オブ・ソート・トレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-05-27T17:58:48Z) - Visual-Language Navigation Pretraining via Prompt-based Environmental
Self-exploration [83.96729205383501]
本稿では,言語埋め込みの高速適応を実現するために,プロンプトベースの学習を導入する。
我々のモデルは、VLNやREVERIEを含む多様な視覚言語ナビゲーションタスクに適応することができる。
論文 参考訳(メタデータ) (2022-03-08T11:01:24Z) - Using Deep Reinforcement Learning Methods for Autonomous Vessels in 2D
Environments [11.657524999491029]
本研究では,Q-Learningとニューラル表現を組み合わせた深層強化学習を用いて不安定性を回避する。
当社の方法論では,Q-Learningを深く使用して,アジャイル方法論のローリングウェーブプランニングアプローチと組み合わせています。
実験の結果,VVNの長距離ミッションの平均性能は55.31倍に向上した。
論文 参考訳(メタデータ) (2020-03-23T12:58:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。