論文の概要: Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations
- arxiv url: http://arxiv.org/abs/2606.25629v1
- Date: Wed, 24 Jun 2026 09:35:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.297704
- Title: Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations
- Title(参考訳): 拡張視覚言語モデルを用いた安全臨界時のイベント適応型運動計画
- Abstract要約: 大きな視覚言語モデル(VLM)は、常識推論において顕著な能力を提供する。
本稿では,VLMに基づくロボットナビゲーションのための効率的なフレームワークであるイベント適応型モーションプランニング(EAMP)を提案する。
EAMPは、高レベルの推論と低レベルの制御を効果的に調整し、動的安全性マージンを大幅に改善する。
- 参考スコア(独自算出の注目度): 25.961619880053235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robot navigation in safety-critical scenarios faces significant challenges from unforeseen semantic events, where collisions arise primarily from the unpredictable behaviors of dynamic agents rather than unseen objects. While large vision-language models (VLMs) offer remarkable capabilities in commonsense reasoning, frequently invoking them within the continuous control loop introduces severe computational latency, fundamentally destabilizing physical execution. To address these challenges, we propose event-adaptive motion planning (EAMP), an efficient framework for VLM-based robot navigation. Specifically, a prompt-configurable semantic event trigger (PC-SET) selectively activates semantic intervention by continuously monitoring short temporal clips for behavioral anomalies. Upon triggering, an event-triggered distilled SemNav-VLM, fine-tuned via physically verified semantic distillation, maps detected anomalies into discrete strategy-level decisions. Subsequently, a semantic model predictive control (SMPC) module translates these strategies into dynamic reconfigurations of optimization objectives and geometric references. Extensive experiments in safety-critical logistics scenarios demonstrate that EAMP effectively aligns high-level reasoning with low-level control, significantly improving dynamic safety margins over existing baselines while preserving real-time efficiency.
- Abstract(参考訳): 安全クリティカルなシナリオにおけるロボットナビゲーションは、予期せぬセマンティックな出来事から重要な課題に直面している。
大きな視覚言語モデル(VLM)はコモンセンス推論において顕著な能力を提供するが、連続制御ループ内で頻繁にそれらを呼び出すと、計算の遅延が発生し、物理的実行を根本的に不安定にする。
これらの課題に対処するために、VLMベースのロボットナビゲーションのための効率的なフレームワークであるイベント適応型モーションプランニング(EAMP)を提案する。
具体的には、プロンプト構成可能なセマンティックイベントトリガー(PC-SET)は、動作異常に対する短い時間的クリップを継続的に監視することにより、セマンティック介入を選択的に活性化する。
トリガーされたセムナブ-VLMは、物理的に検証されたセマンティック蒸留によって微調整され、検出された異常を個別の戦略レベルで決定する。
その後、セマンティックモデル予測制御(SMPC)モジュールはこれらの戦略を最適化目標と幾何学的参照の動的再構成に変換する。
安全クリティカルなロジスティクスシナリオにおける大規模な実験により、EAMPは高レベルの推論と低レベルの制御を効果的に整合させ、既存のベースラインに対する動的安全性のマージンを大幅に改善し、リアルタイムの効率を保っていることが示された。
関連論文リスト
- Learning-Based Dynamic Obstacle Avoidance for a UAV Using Only Three Range Sensors [1.2246649738388389]
本研究では,未知の動環境下で一定高度で動作する無人航空機(UAV)のキノダイナミック・オンライン・モーション・プランニングに対する学習に基づくアプローチを提案する。
提案フレームワークは,行動グリッドマップの表現をDeep Reinforcement Learning (DRL)と統合し,継続的制御における安定した政策学習を実現する。
キーとなるアイデアは、低コストな3つの指向性レンジセンサーのみを使用して、信頼性の高いナビゲーションを可能にする状態表現と制御ポリシーの共設計である。
論文 参考訳(メタデータ) (2026-09-13T10:53:43Z) - GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking [71.9852231453445]
イベントカメラは低レイテンシとモーションロバストな知覚を可能にし、高速かつ非線形な動作下での機能追跡に適している。
既存のイベントベースの機能トラッキング手法は、イベントの蓄積を手作業で調整する、固定されたルールに依存している。
オンラインイベントベースの特徴追跡のための蓄積過程を適応的に制御する強化学習フレームワークを導入する。
論文 参考訳(メタデータ) (2026-07-17T07:18:07Z) - Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation [1.6711881128691604]
本稿では,インスタンス中心のシーンコンテキストとマルチモーダルな提案を前提とした拡散型シナリオ生成フレームワークを提案する。
Open Motionデータセットの実験では、さまざまなインタラクティブなシナリオにおけるリアリズム、安全性、コントロール可能性のバランスが好まれている。
論文 参考訳(メタデータ) (2026-06-25T15:01:31Z) - GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic [51.85782253444399]
MLLM(Multimodal large language model)は、自律運転システムに統合されつつある。
それらは、特に事故を起こしやすいシナリオにおいて、多様な安全上の脅威に弱いままである。
我々は,AD安全性を進化するマルコフ論理状態として定式化するモデル非依存型安全ガードであるGardadを提案する。
論文 参考訳(メタデータ) (2026-05-11T11:28:03Z) - F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation [62.06267255986041]
非同期推論はロボット操作における主要なパラダイムとして現れている。
本稿では,予測対象の流れを利用して将来の観測を合成する新しい枠組みを提案する。
本手法は複雑な動的操作タスクにおける応答性と成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-02T17:57:15Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - SPOT: Spatio-Temporal Obstacle-free Trajectory Planning for UAVs in an Unknown Dynamic Environment [1.9181913148426697]
我々は、視覚に基づくセーフフライト・コリドール(SFC)世代と統合した4次元プランナーを開発した。
シミュレーションおよび実世界のハードウェア実験において,本手法を広範囲に検証し,最先端の手法と比較した。
論文 参考訳(メタデータ) (2026-02-01T12:24:12Z) - \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - EASE: Embodied Active Event Perception via Self-Supervised Energy Minimization [6.249768559720122]
アクティブイベント認識は、人間とAIのコラボレーション、補助ロボット工学、自律ナビゲーションといったタスクにおいて、インテリジェンスを具現化する上で不可欠である。
本稿では,自由エネルギーによる表現学習と具体化制御を一体化する自己教師型フレームワークであるEASEを提案する。
論文 参考訳(メタデータ) (2025-06-20T23:45:51Z) - Real-Time Out-of-Distribution Failure Prevention via Multi-Modal Reasoning [18.28480383898768]
FORTRESSはロボットの安全性のための共同推論と計画のフレームワークである。
セマンティックに安全なフォールバック戦略を生成し、安全クリティカルなOOD障害を防ぐ。
論文 参考訳(メタデータ) (2025-05-15T17:55:28Z) - DynaVINS++: Robust Visual-Inertial State Estimator in Dynamic Environments by Adaptive Truncated Least Squares and Stable State Recovery [11.37707868611451]
我々はmboxtextitDynaVINS++と呼ばれる堅牢なVINSフレームワークを提案する。
我々のアプローチは、突然の動的オブジェクトを含む動的環境における有望なパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-10-20T12:13:45Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。