論文の概要: From Driving Videos to Simulatable Scenarios
- arxiv url: http://arxiv.org/abs/2606.21993v1
- Date: Sat, 20 Jun 2026 11:16:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 21:50:12.75404
- Title: From Driving Videos to Simulatable Scenarios
- Title(参考訳): ドライビングビデオからシミュラブルシナリオへ
- Authors: Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López,
- Abstract要約: 本稿では,運転映像からシミュラブル運転シナリオを自動的に生成するフレームワークであるD-V2Sを紹介する。
D-V2Sはビデオの関連意味要素の90%が存在しているシナリオを生成する。
また、D-V2Sのモジュールのセマンティックおよび人間駆動のアブレーション解析も提供する。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Autonomous vehicles (AVs) face driving scenarios ranging from routine traffic to rare events. To assess safety it is crucial to reproduce these scenarios in a controllable, repeatable, and scalable manner, with simulation playing a key role. This paper introduces D-V2S, a novel framework that automatically generates simulatable driving scenarios from driving videos. D-V2S operates in two stages: a Driving Record Analyzer (DRA) uses a vision language model (VLM) with our designed prompt to produce natural-language descriptions from input videos, capturing road layouts and dynamic traffic interactions; subsequently, a Scenario Generator (SG) uses a large language model (LLM) and our conditioning context to translate these descriptions into executable scenarios. Using simulations, we show that D-V2S generates scenarios where 90% of the relevant semantic elements of the videos are present. We also provide qualitative results demonstrating D-V2S's capability to transform real-world driving videos into simulatable scenarios. Moreover, we provide both semantic and human driven ablative analyses of D-V2S's modules. In particular, we show how the VLM choice matters for DRA, and how our SG achieves a 75% preference rate over other state-of-the-art methods.
- Abstract(参考訳): 自動走行車(AV)は、定期的な交通から稀なイベントまで、様々な運転シナリオに直面している。
安全性を評価するためには、これらのシナリオを制御可能で反復可能でスケーラブルな方法で再現することが重要であり、シミュレーションが重要な役割を果たす。
本稿では,運転映像からシミュラブル運転シナリオを自動的に生成する新しいフレームワークであるD-V2Sを紹介する。
D-V2Sは2段階で動作する: ドライビング・レコード・アナライザ(DRA)は視覚言語モデル(VLM)を使用して、入力ビデオから自然言語記述を生成し、道路レイアウトと動的トラフィックの相互作用をキャプチャし、次にシナリオ生成器(SG)は大きな言語モデル(LLM)と条件付きコンテキストを用いてこれらの記述を実行可能なシナリオに変換する。
シミュレーションを用いて、D-V2Sは、ビデオの関連する意味要素の90%が存在しているシナリオを生成する。
また,実世界の運転映像をシミュレート可能なシナリオに変換するD-V2Sの能力を示す定性的な結果も提供する。
さらに,D-V2Sのモジュールの意味的および人間主導的アブレーション解析も提供する。
特に、VLM選択がDRAにとってどのように重要か、そして我々のSGが他の最先端手法よりも75%の選好率を達成するかを示す。
関連論文リスト
- TRANSPORTER: Transferring Visual Semantics from VLM Manifolds [56.749972238005604]
本稿では,ビデオ生成のためのモデルに依存しないアプローチであるTransportERとともに,ロジット・トゥ・ビデオ(L2V)タスクを提案する。
TransporterはVLMの高セマンティック埋め込み空間への最適輸送結合を学習する。
代わりに、ロジットスコアは条件付きビデオ生成のための埋め込み方向を定義する。
論文 参考訳(メタデータ) (2025-11-23T09:12:48Z) - LLM-based Realistic Safety-Critical Driving Video Generation [4.537331974356809]
CARLAシミュレータ内の運転シナリオを自動的に合成するフレームワークを提案する。
このフレームワークはシナリオスクリプティング、トラフィック参加者の効率的なコードベースの制御、現実的な物理力学の実施において柔軟性がある。
本手法により,制御可能なシナリオ生成が可能となり,稀ではあるが重要なエッジケースの作成が容易になる。
論文 参考訳(メタデータ) (2025-07-02T00:45:19Z) - VaViM and VaVAM: Autonomous Driving through Video Generative Modeling [88.33638585518226]
本稿では,オープンソースの自動回帰ビデオモデル(VaM)とそのビデオアクションモデル(VaVAM)を紹介する。
オープンループ運転とクローズドループ運転のシナリオでモデルを評価したところ、ビデオベースの事前学習が自律運転の可能性を秘めていることがわかった。
論文 参考訳(メタデータ) (2025-02-21T18:56:02Z) - Generating Out-Of-Distribution Scenarios Using Language Models [58.47597351184034]
大規模言語モデル(LLM)は自動運転において有望であることを示している。
本稿では,多様なOF-Distribution(OOD)駆動シナリオを生成するためのフレームワークを提案する。
我々は、広範囲なシミュレーションを通じてフレームワークを評価し、新しい"OOD-ness"メトリクスを導入する。
論文 参考訳(メタデータ) (2024-11-25T16:38:17Z) - From Dashcam Videos to Driving Simulations: Stress Testing Automated Vehicles against Rare Events [5.132984904858975]
現実的な運転シナリオを用いたシミュレーションにおける自動運転システム(ADS)のテストは、その性能を検証する上で重要である。
本稿では,現実の自動車事故映像の詳細なシミュレーションシナリオへの変換を自動化する新しいフレームワークを提案する。
予備結果は,完全自動化と人的介入を伴わず,リアルタイム変換を数分で完了させるという,かなりの時間効率を示した。
論文 参考訳(メタデータ) (2024-11-25T01:01:54Z) - SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving [15.551625571158056]
我々はSimpleLLM4ADと呼ばれるe2eAD法を提案する。
本手法では,e2eADタスクは知覚,予測,計画,行動の4段階に分けられる。
我々の実験は、SimpleLLM4ADが複雑な運転シナリオで競合性能を達成することを示した。
論文 参考訳(メタデータ) (2024-07-31T02:35:33Z) - Probing Multimodal LLMs as World Models for Driving [72.18727651074563]
自律運転におけるMLLM(Multimodal Large Language Models)の適用について検討する。
GPT-4oのようなモデルの開発は進んでいるが、複雑な運転環境における性能は未解明のままである。
論文 参考訳(メタデータ) (2024-05-09T17:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。