論文の概要: Multimodal Scenario Similarity Search for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2607.09428v1
- Date: Fri, 10 Jul 2026 13:55:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.856393
- Title: Multimodal Scenario Similarity Search for Autonomous Driving
- Title(参考訳): 自律運転のためのマルチモーダルシナリオ類似性探索
- Abstract要約: 大規模な自動運転データセットには、多数の記録されたシナリオが含まれている。
既存のアプローチは、視覚表現とモーションベースの記述の両方に依存している。
本稿では,視覚と軌跡に基づく表現を組み合わせた自律走行シナリオ検索の枠組みを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large-scale autonomous-driving datasets contain vast numbers of recorded scenarios, creating a need for efficient retrieval methods that can identify situations similar to a given query. Existing approaches typically rely on either visual representations or motion-based descriptions, making it difficult to understand their relative strengths and limitations for scenario retrieval. In this work, we present a multimodal framework for autonomous-driving scenario retrieval that combines visual and trajectory-based representations within a unified retrieval pipeline. We investigate two trajectory-based approaches: Exo-Trajectory, an explicit matching method based on surrounding-agent motion, and ScenarioFormer, a transformer-based representation learned from object trajectories using contrastive learning. We compare these approaches against strong vision-based baselines and analyze their behavior across a diverse set of driving scenarios. Experimental results show that trajectory representations provide strong retrieval performance for motion-centric events such as cut-ins, turning maneuvers, and traffic queueing, while visual embeddings excel when appearance cues are informative. Most importantly, combining visual and trajectory information consistently improves retrieval quality, yielding the best overall performance. These findings demonstrate that appearance and motion capture are complementary notions of scenario similarity and motivate multimodal retrieval systems for autonomous-driving data mining, dataset curation, and scenario-based validation.
- Abstract(参考訳): 大規模な自律走行データセットには、膨大な数の記録されたシナリオが含まれており、与えられたクエリに類似した状況を特定するための効率的な検索方法の必要性が生じる。
既存のアプローチは通常、視覚的な表現や動きに基づく記述に依存するため、シナリオ検索の相対的な強みや制限を理解することは困難である。
本研究では,視覚と軌跡に基づく表現を統合検索パイプライン内で組み合わせた,自律走行シナリオ検索のためのマルチモーダルフレームワークを提案する。
本研究では、周囲のエージェントの動きに基づく明示的なマッチング手法であるExo-Trajectoryと、コントラスト学習を用いた物体軌道から学習したトランスフォーマーに基づく表現であるScenarioFormerの2つの手法について検討する。
我々は、これらのアプローチを強い視覚に基づくベースラインと比較し、様々な運転シナリオでそれらの振る舞いを分析する。
実験の結果,軌道表現はカットイン,旋回操作,交通キューといった動き中心のイベントに対して強い検索性能を示し,視覚的埋め込みは視覚的埋め込みに優れることがわかった。
最も重要なことは、視覚情報と軌跡情報を組み合わせることで、常に検索品質が向上し、全体的なパフォーマンスが最高のものとなることである。
これらの結果は、外観とモーションキャプチャーがシナリオ類似性の相補的な概念であり、自動運転データマイニング、データセットキュレーション、シナリオベース検証のためのマルチモーダル検索システムを動機付けていることを示している。
関連論文リスト
- Extended Field of View Analysis for VideoGAN-based Trajectory Generation [2.7474251089367363]
本研究は,GAN(Generative Adversarial Network)に基づくセマンティック・バードズ・アイ・ビュー・トラフィック生成に関する先行研究に基づいて構築する。
我々は意味表現を改善し、トラジェクトリ抽出手順をグラフベースのアソシエーション手法に置き換える。
また、生成したビデオにおける幻覚や物体の永続性を評価するための定量的評価フレームワークも導入する。
論文 参考訳(メタデータ) (2026-08-03T14:21:07Z) - PoseDriver: A Unified Approach to Multi-Category Skeleton Detection for Autonomous Driving [72.70946892443236]
PoseDriverは、駆動シナリオで一般的なオブジェクトに合わせたボトムアップのマルチカテゴリスケルトン検出のための統合フレームワークである。
骨格表現に基づく車線検出のための新しい手法を提案し,OpenLaneデータセット上での最先端性能を実現する。
自転車の骨格検出のための新しいデータセットを提案し,新しいカテゴリーへのフレームワークの転送性を評価する。
論文 参考訳(メタデータ) (2026-03-24T13:56:35Z) - DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories [52.57197752244638]
本稿では,画像検索を自律探索タスクとして再構成する新しいエージェントパラダイムであるDeepImageSearchを紹介する。
モデルは、暗黙の文脈的手がかりに基づいてターゲットを特定するために、生の視覚履歴に対して多段階の推論を計画し実行しなければならない。
DisBenchは、相互接続された視覚データ上に構築された、挑戦的なベンチマークである。
論文 参考訳(メタデータ) (2026-02-11T12:51:10Z) - Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving [0.5249805590164902]
本研究では,人間中心の多様なシナリオにおける自律走行システムの目標評価を支援する,コンテキスト認識型動き検索フレームワークを提案する。
提案手法は,WayMoCoデータセットで評価した場合,動作コンテキスト検索の精度を最大27.5%向上させる。
論文 参考訳(メタデータ) (2025-08-01T12:41:52Z) - Exploring Semantic Clustering and Similarity Search for Heterogeneous Traffic Scenario Graph [41.2584175136191]
まず,交通シナリオを表現するための表現的かつ柔軟な異種時間グラフモデルを提案する。
次に,シナリオグラフに対する普遍的な埋め込み空間を学習するための自己教師付き手法を提案する。
特に、ブートストラップに基づくアプローチとともに、対照的な学習を実装し、シナリオ空間に対するそれらの適合性を評価する。
論文 参考訳(メタデータ) (2025-07-07T15:10:03Z) - Universal Retrieval for Multimodal Trajectory Modeling [12.160448446091607]
軌道データは、AIエージェント能力を向上する大きな可能性を秘めている。
本稿では,ユニバーサル検索とエージェント中心軌道モデリングのギャップを埋めるマルチモーダル軌道検索手法を提案する。
論文 参考訳(メタデータ) (2025-06-27T09:50:38Z) - CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling [53.97609687516371]
クロスモーダル検索は、異なるモーダルデータの相互作用を通じて、クエリと意味的に関連するインスタンスを検索することを目的としている。
従来のソリューションでは、クエリと候補の間のスコアを明示的に計算するために、シングルトウワーまたはデュアルトウワーのフレームワークを使用している。
粗大なセマンティックモデリングに基づく生成的クロスモーダル検索フレームワーク(CART)を提案する。
論文 参考訳(メタデータ) (2024-06-25T12:47:04Z) - A Diffusion-Model of Joint Interactive Navigation [14.689298253430568]
本稿では,交通シナリオを生成する拡散に基づくDJINNを提案する。
我々のアプローチは、過去、現在、未来からのフレキシブルな状態観察のセットに基づいて、全てのエージェントの軌跡を共同で拡散させる。
本稿では,DJINNが様々な条件分布からの直接的テスト時間サンプリングを柔軟に行う方法を示す。
論文 参考訳(メタデータ) (2023-09-21T22:10:20Z) - Visual Exemplar Driven Task-Prompting for Unified Perception in
Autonomous Driving [100.3848723827869]
本稿では,タスク固有のプロンプトを通じて視覚的見本を提示する,効果的なマルチタスクフレームワークVE-Promptを提案する。
具体的には、境界ボックスと色に基づくマーカーに基づいて視覚的な例を生成し、ターゲットカテゴリの正確な視覚的外観を提供する。
我々は変圧器をベースとしたエンコーダと畳み込み層を橋渡しし、自律運転における効率的かつ正確な統合認識を実現する。
論文 参考訳(メタデータ) (2023-03-03T08:54:06Z) - Self-Supervised Representation Learning from Temporal Ordering of
Automated Driving Sequences [49.91741677556553]
本研究では、認識タスクのための地域レベルの特徴表現を事前学習するための時間順述前文タスクであるTempOを提案する。
我々は各フレームを、オブジェクト検出やトラッキングシステムにとって自然な表現である、未順序な特徴ベクトルのセットで埋め込む。
BDD100K、nu Images、MOT17データセットの大規模な評価は、私たちのTempO事前学習アプローチがシングルフレームの自己教師型学習方法よりも優れていることを示している。
論文 参考訳(メタデータ) (2023-02-17T18:18:27Z) - Generating and Characterizing Scenarios for Safety Testing of Autonomous
Vehicles [86.9067793493874]
最先端運転シミュレータを用いて,テストシナリオを特徴付け,生成するための効率的なメカニズムを提案する。
次世代シミュレーション(NGSIM)プロジェクトにおける実運転データの特徴付けに本手法を用いる。
事故回避の複雑さに基づいてメトリクスを定義してシナリオをランク付けし、事故発生の可能性を最小限に抑えるための洞察を提供します。
論文 参考訳(メタデータ) (2021-03-12T17:00:23Z) - SMART: Simultaneous Multi-Agent Recurrent Trajectory Prediction [72.37440317774556]
本稿では,将来の軌道予測における2つの重要な課題に対処する手法を提案する。
エージェントの数に関係なく、トレーニングデータと予測と一定時間の推測の両方において、マルチモーダリティ。
論文 参考訳(メタデータ) (2020-07-26T08:17:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。