論文の概要: SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving
- arxiv url: http://arxiv.org/abs/2607.19701v1
- Date: Wed, 22 Jul 2026 03:05:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.957056
- Title: SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving
- Title(参考訳): SafeGen: VLMによる自動運転のための安全批判シナリオのゴールコンディションビデオ拡散
- Authors: Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu,
- Abstract要約: VLMADにおける安全クリティカルシナリオ生成のための,目標条件付き拡散フレームワークSafeGenを提案する。
私たちの重要な洞察は、ゴール条件付き拡散プロセスとしてシナリオ生成を定式化することです。
コンテクスト境界状態推論とエンド状態条件付きビデオ進化を紹介する。
- 参考スコア(独自算出の注目度): 32.42098682227667
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: VLMs are increasingly deployed in AD systems, creating an urgent need for rigorous safety evaluation under rare yet safety-critical scenarios. Among these, interactions with vulnerable road users represent a major source of real-world failures. However, existing safety-critical scenario generation methods predominantly rely on simulator-based pipelines, which suffer from a substantial sim-to-real gap and often fail to capture realistic, diverse, and unforeseen human-vehicle interaction dynamics. We present SafeGen, a goal-conditioned diffusion framework for safety-critical scenario generation in VLMADs. Our key insight is to formulate scenario generation as a goal-conditioned diffusion process, where a predefined catastrophic end-state serves as a strong supervisory signal, guiding the generation of temporally coherent video trajectories that naturally evolve toward safety-critical outcomes. Building on this formulation, we introduce Context Grounded End State Reasoning, which leverages VLMs to analyze benign driving contexts and infer latent vulnerabilities in human-vehicle interactions, producing structured end-state specifications that induce high-risk scenarios. Conditioned on these targets, we further propose End State Conditioned Video Evolution, which grounds semantic threats into physically plausible visual dynamics. Specifically, we instantiate high-risk agents within the scene via depth-aware geometric projection, followed by boundary-conditioned diffusion to generate intermediate frames with consistent motion patterns and temporal coherence. Extensive experiments across 3 VLMADs demonstrate that SafeGen increases the Judge Overall Score, a metric using a VLM judge to evaluate VLMADs' understanding and decision-making, by 24.25% on average compared to SoTA baselines. Furthermore, fine-tuning a VLMAD improves performance in real-world driving scenes by an average of 15.9%.
- Abstract(参考訳): VLMはADシステムにますます導入され、希少かつ安全クリティカルなシナリオ下で厳格な安全性評価が緊急に必要となる。
中でも、脆弱な道路利用者とのインタラクションは、現実世界の障害の主な原因である。
しかし、既存の安全クリティカルシナリオ生成手法は主にシミュレーターベースのパイプラインに依存しており、これはシミュレート・トゥ・リアルのギャップに悩まされ、現実的で多様性があり、予期せぬ人間と車両の相互作用のダイナミクスを捉えるのに失敗する。
VLMADにおける安全クリティカルシナリオ生成のための,目標条件付き拡散フレームワークSafeGenを提案する。
我々の重要な洞察は、目標条件付き拡散過程としてシナリオ生成を定式化することであり、そこでは、あらかじめ定義された破滅的な終末状態が強力な監視信号として機能し、安全クリティカルな結果に向かって自然に進化する時間的コヒーレントなビデオトラジェクトリの生成を導く。
この定式化に基づくContext Grounded End State Reasoningは、VLMを活用して、人間と車両の相互作用における良質な駆動状況を分析し、高リスクシナリオを誘発する構造化されたエンドステート仕様を生成する。
これらの目標を前提として,意味論的脅威を物理的に妥当な視覚力学に根ざした,エンド状態条件付きビデオ進化を提案する。
具体的には、奥行き認識幾何投影によりシーン内の高リスクエージェントをインスタンス化し、続いて境界条件拡散を行い、一貫した動きパターンと時間的コヒーレンスを持つ中間フレームを生成する。
3つのVLMADにわたる大規模な実験により、SafeGenは、VLMADsの理解と意思決定をSoTAベースラインと比較して平均24.25%向上させた。
さらに、VLMADの微調整により、現実世界の運転シーンのパフォーマンスは平均15.9%向上する。
関連論文リスト
- Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - Adversarial Generation and Collaborative Evolution of Safety-Critical Scenarios for Autonomous Vehicles [47.25901323750217]
シミュレーションにおける安全クリティカルシナリオの生成は、社会に道路が配備される以前、自動運転車の安全性評価においてますます重要になっている。
我々は,新たなシナリオを推論し,複雑なトラフィックフローでそれらを増幅することにより,多彩な安全クリティカルシナリオを生成できるフレームワークであるScenGEを提案する。
実世界の車両テストと人間による評価を通じて、我々のフレームワークを検証する。
論文 参考訳(メタデータ) (2025-08-20T08:36:57Z) - INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation [7.362380225654904]
INSIGHTは、危険検出とエッジケース評価を強化するために設計された階層型視覚言語モデル(VLM)フレームワークである。
本手法は,マルチモーダルデータ融合を用いて意味表現と視覚表現を統合し,運転シナリオの正確な解釈を可能にする。
BDD100Kデータセットの実験結果は、既存のモデルよりもハザード予測の正確性と正確性を大幅に改善したことを示している。
論文 参考訳(メタデータ) (2025-02-01T01:43:53Z) - Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving [65.61999354218628]
我々は、自律運転システムにおいて、視覚言語モデル(VLM)をターゲットとしたブラックボックス敵攻撃を設計する第一歩を踏み出す。
セマンティクスの生成と注入による低レベル推論の分解を目標とするカスケーディング・アディバーショナル・ディスラプション(CAD)を提案する。
本稿では,高レベルリスクシナリオの理解と構築に代理VLMを活用することで,動的適応に対処するリスクシーンインジェクションを提案する。
論文 参考訳(メタデータ) (2025-01-23T11:10:02Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z) - Safety-aware Causal Representation for Trustworthy Offline Reinforcement
Learning in Autonomous Driving [33.672722472758636]
オフライン強化学習(RL)アプローチは、オフラインデータセットからのシーケンシャルな意思決定問題に対処する上で、顕著な効果を示す。
一般化可能なエンドツーエンド駆動ポリシの学習を容易にするために,saFety-aware strUctured Scenario representation (Fusion)を導入した。
様々な運転シナリオにおける実証的な証拠は、フュージョンが自律運転エージェントの安全性と一般化性を著しく向上させることを証明している。
論文 参考訳(メタデータ) (2023-10-31T18:21:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。