論文の概要: Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving
- arxiv url: http://arxiv.org/abs/2604.01723v1
- Date: Thu, 02 Apr 2026 07:43:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:10.59084
- Title: Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving
- Title(参考訳): 視覚・言語・行動駆動のための実行時安全監督による因果場面のナレーション
- Authors: Yun Li, Yidu Zhang, Simon Thompson, Ehsan Javanmardi, Manabu Tsukada,
- Abstract要約: 本稿では,VLAテキスト入力を意図制約アライメントによって再構成するCausal Scene Narration (CSN)を紹介する。
CSNは、オリジナルのLMDriveで+31.1%、設定整列版で+24.5%改善した。
- 参考スコア(独自算出の注目度): 6.095431709661074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models for autonomous driving must integrate diverse textual inputs, including navigation commands, hazard warnings, and traffic state descriptions, yet current systems often present these as disconnected fragments, forcing the model to discover on its own which environmental constraints are relevant to the current maneuver. We introduce Causal Scene Narration (CSN), which restructures VLA text inputs through intent-constraint alignment, quantitative grounding, and structured separation, at inference time with zero GPU cost. We complement CSN with Simplex-based runtime safety supervision and training-time alignment via Plackett-Luce DPO with negative log-likelihood (NLL) regularization. A multi-town closed-loop CARLA evaluation shows that CSN improves Driving Score by +31.1% on original LMDrive and +24.5% on the preference-aligned variant. A controlled ablation reveals that causal structure accounts for 39.1% of this gain, with the remainder attributable to information content alone. A perception noise ablation confirms that CSN's benefit is robust to realistic sensing errors. Semantic safety supervision improves Infraction Score, while reactive Time-To-Collision monitoring degrades performance, demonstrating that intent-aware monitoring is needed for VLA systems.
- Abstract(参考訳): 自律走行のためのVLA(Vision-Language-Action)モデルは、ナビゲーションコマンド、危険警告、交通状態の記述を含む多様なテキスト入力を統合する必要があるが、現在のシステムはこれらを切断されたフラグメントとして提示することが多く、現在の操作に関連する環境制約をモデル自身が発見せざるを得ない。
本稿では,VLAテキスト入力の意図制約アライメント,定量グラウンド,構造化分離をGPUコストゼロの推論時間で再構成するCausal Scene Narration(CSN)を紹介する。
CSNをSimplexベースのランタイム安全性監視とPlanet-Luce DPOによるトレーニング時間アライメントで補完する。
マルチタウン・クローズドループ CARLA の評価では、CSN はオリジナルのLMDriveでは+31.1%、優先順の変種では+24.5%改善している。
制御されたアブレーションは、因果構造がこの利得の39.1%を占めており、残りは情報内容のみに起因することを明らかにしている。
知覚ノイズアブレーションは、CSNの利点が現実的な検知誤差に対して堅牢であることを確認する。
セマンティック安全性監視は、Infraction Scoreを改善し、リアクティブのTime-To-Collisionモニタリングはパフォーマンスを低下させ、VLAシステムに意図認識モニタリングが必要であることを実証する。
関連論文リスト
- Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning [71.19675094463834]
この作業では、モデルが実行前に計画されたアクションを推論し、修正することを可能にする、自己修正型のVLAフレームワークである、Counterfactual VLAを導入している。
CF-VLAはまず、駆動意図を要約した時間分割メタアクションを生成し、その後、メタアクションと視覚コンテキストの両方で条件付けられた反実的推論を実行する。
大規模運転データセットの実験では、CF-VLAは軌道精度を最大17.6%向上し、安全基準を20.5%向上し、適応的思考を示す。
論文 参考訳(メタデータ) (2025-12-30T19:04:17Z) - Attention in Motion: Secure Platooning via Transformer-based Misbehavior Detection [0.6999740786886536]
車両小隊は、多車編成の調整を通じて、輸送効率と安全性の変革的な改善を約束する。
確率チェックや統計的手法に依存する従来の誤動作検出手法は、偽陽性(FP)率が高い。
Intention In Motion (AIMformer) は、車体プラトンにおけるリアルタイムな誤動作検出に適したトランスフォーマーベースのフレームワークである。
論文 参考訳(メタデータ) (2025-12-17T14:45:33Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - End-to-End Visual Autonomous Parking via Control-Aided Attention [30.52881549605385]
CAA-Policyは、正確な駐車のためのエンドツーエンドの模倣学習システムである。
制御信号は、新しい制御支援注意機構を通じて視覚的注意の学習を導くことができる。
論文 参考訳(メタデータ) (2025-09-14T04:51:19Z) - KEPT: Knowledge-Enhanced Prediction of Trajectories from Consecutive Driving Frames with Vision-Language Models [19.625631486595505]
本稿では,知識に富んだ視覚言語フレームワークであるKEPTを紹介する。
連続するフロントビュー駆動フレームから直接エゴ軌道を予測する。
オープンループプロトコル間の最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-09-03T03:10:42Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z) - SafeAuto: Knowledge-Enhanced Safe Autonomous Driving with Multimodal Foundation Models [63.71984266104757]
我々は、構造化されていない知識と構造化されていない知識の両方を取り入れることで、MLLMベースの自動運転を強化するフレームワークであるSafeAutoを提案する。
安全知識を明示的に統合するため,交通ルールを一階述語論理に変換する推論コンポーネントを開発した。
我々のマルチモーダル検索・拡張生成モデルは、過去の運転経験から学ぶために、ビデオ、制御信号、環境特性を活用する。
論文 参考訳(メタデータ) (2025-02-28T21:53:47Z) - Cognitive Accident Prediction in Driving Scenes: A Multimodality
Benchmark [77.54411007883962]
本研究では,視覚的観察と運転者の注意に対する人為的な文章記述の認識を効果的に活用し,モデルトレーニングを容易にする認知事故予測手法を提案する。
CAPは、注意テキスト〜ビジョンシフト融合モジュール、注意シーンコンテキスト転送モジュール、運転注意誘導事故予測モジュールによって構成される。
我々は,1,727件の事故ビデオと219万フレーム以上の大規模ベンチマークを構築した。
論文 参考訳(メタデータ) (2022-12-19T11:43:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。