論文の概要: MV2: Multi-View Multi-Vehicle Driving Dataset for Novel View Synthesis
- arxiv url: http://arxiv.org/abs/2608.12442v2
- Date: Fri, 14 Aug 2026 22:47:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 15:48:19.520593
- Title: MV2: Multi-View Multi-Vehicle Driving Dataset for Novel View Synthesis
- Title(参考訳): MV2:新しいビュー合成のためのマルチビュー多車駆動データセット
- Abstract要約: 微分可能レンダリングは高度な新規ビュー合成(NVS)を持つ
少ない捕捉視点、動的オブジェクト、限られた多軌道データのため、現実の運転に適用することは依然として困難である。
我々は,NVSモデル評価のためのマルチビュー多車種データセットとベンチマークを,動的な都市景観における大きな視点変化の下で導入する。
- 参考スコア(独自算出の注目度): 17.447689425723045
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Differentiable rendering has advanced novel view synthesis (NVS), yet applying it to real-world driving remains difficult due to sparse capture viewpoints, dynamic objects, and limited multi-trajectory data. We introduce the Multi-View Multi-Vehicle (MV2) dataset and benchmark for evaluating NVS models under large viewpoint changes in dynamic urban scenes. MV2 features synchronized captures from a car, scooter, and drone, each following distinct yet synchronized trajectories. Training NVS methods on one vehicle's camera stream and testing on another enables evaluation under substantially larger viewpoint variations than existing single-trajectory datasets. All sequences are registered via Structure-from-Motion and camera poses verified using manual pixel-level correspondence annotations, yielding 50 high-quality scenes with 12000 images. Benchmarking recent NVS and camera pose estimation methods shows that NVS performance degrades with increasing viewpoint disparity, and that feed-forward pose estimators notably lag behind optimization-based approaches, highlighting MV2 as a rigorous testbed for NVS in driving. The dataset, benchmark protocol, and project resources are available at https://mv2-dataset.github.io/.
- Abstract(参考訳): 微分可能レンダリングは、新しいビュー合成(NVS)を先進的に実現しているが、少ないキャプチャ視点、動的オブジェクト、限られた多軌道データのために現実の運転に応用することは困難である。
本研究では,NVSモデル評価のためのMV2データセットとベンチマークを導入する。
MV2は、車、スクーター、ドローンからの同期捕獲を特徴としている。
ある車両のカメラストリーム上でNVSメソッドをトレーニングし、別の車両でテストすることで、既存の単一軌跡データセットよりもはるかに大きな視点変化による評価が可能になる。
全てのシーケンスはStructure-from-Motionで登録され、手動ピクセルレベルの対応アノテーションを使用して検証されたカメラのポーズにより、12000枚の画像で50の高品質なシーンが生成される。
最近のNVSとカメラのポーズ推定手法のベンチマークにより、NVSのパフォーマンスは視点差の増加とともに低下し、フィードフォワードのポーズ推定器は最適化ベースのアプローチの遅れを顕著に示し、MV2を運転中のNVSの厳密なテストベッドとして強調している。
データセット、ベンチマークプロトコル、プロジェクトリソースはhttps://mv2-dataset.github.io/で公開されている。
関連論文リスト
- TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple Views [50.26507994908593]
この設定の最初のベンチマークであるTAPVid-MV(Tracking Any Point in Video across Multiple Views)を紹介します。
キュレートされた284のシーケンス、1,142のキャリブレーションされたカメラストリーム、109,769のトラックが、屋内と屋外のドメインにまたがる7つのサブセットにまたがっている。
本研究では,センサ深度,LiDAR,SLAM,SfM点,ヒューマンメッシュ,ポーズされたオブジェクトメッシュ,シミュレーションといった,データセット固有の補助的モダリティを用いてこれらのトラジェクトリを解析し,各シーケンスとトラジェクトリを人間のアノテーションによって視覚的に検証する。
論文 参考訳(メタデータ) (2026-09-01T21:58:51Z) - Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes [48.537990488697965]
多視点の群集追跡は、各人の追跡軌跡を現場の地上で推定する。
最近の研究は主にCNNによる多視点群集追跡アーキテクチャに依存している。
マルチビュートラッキング性能を向上させるために,カメラビューと地上平面の相互作用を取り入れたトランスフォーマーベースのマルチビュー群追跡モデルであるtextitMVTrackTrans を提案する。
論文 参考訳(メタデータ) (2026-04-21T10:26:23Z) - DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis [17.750053029702222]
既存のテキスト・トゥ・ビデオ(T2V)評価ベンチマークであるVBenchやEvalCrafterには2つの制限がある。
ダイナミックカメラの動きを強調するプロンプトを体系的にキュレートしたベンチマークであるDynamicEvalを紹介する。
背景環境の整合性を示すために,Vbench運動の滑らか度測定値に基づく解釈可能な誤差マップを得る。
提案手法は,映像レベルとモデルレベルの両方において,人間の嗜好と強い相関関係を示す。
論文 参考訳(メタデータ) (2025-10-08T18:41:04Z) - TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving [10.439455144126617]
TinyDriveは、シナリオ駆動におけるマルチビューVQAのための軽量なVLMである。
本モデルは,マルチスケールビジョンエンコーダとトークンとシーケンスの二重レベル優先順位付け機構を含む2つの重要なコンポーネントから構成される。
TinyDriveは、私たちのカスタムキュレートされたVQAデータセットで最初に評価され、その後、パブリックなDriveLMベンチマークでテストされます。
論文 参考訳(メタデータ) (2025-05-21T14:19:24Z) - Extrapolated Urban View Synthesis Benchmark [53.657271730352214]
光シミュレーターは視覚中心型自動運転車(AV)の訓練と評価に不可欠である
中心となるのはノベルビュー合成(英語版)(NVS)であり、これはAVの広範かつ連続的なポーズ分布に対応するために、様々な目に見えない視点を生成する能力である。
近年の3次元ガウス・スプラッティングのような放射場の発展は、リアルタイムなリアルタイムレンダリングを実現し、大規模ドライビングシーンのモデリングに広く利用されている。
自動運転車と都市ロボットシミュレーション技術の進歩を支援するために、データを公開します。
論文 参考訳(メタデータ) (2024-12-06T18:41:39Z) - NVComposer: Boosting Generative Novel View Synthesis with Multiple Sparse and Unposed Images [50.36605863731669]
NVComposerは、明示的な外部アライメントの必要性を排除する新しいアプローチである。
NVComposerは、生成的マルチビューNVSタスクにおいて最先端のパフォーマンスを達成する。
提案手法は, 入力ビュー数の増加に伴い, 合成品質が大幅に向上したことを示す。
論文 参考訳(メタデータ) (2024-12-04T17:58:03Z) - MVGenMaster: Scaling Multi-View Generation from Any Image via 3D Priors Enhanced Diffusion Model [87.71060849866093]
MVGenMasterは3Dプリエントで拡張された多視点拡散モデルであり,NVS(多目的なノベルビュー合成)タスクに対処する。
我々のモデルは、可変参照ビューとカメラポーズで条件付けられた100の新しいビューを生成できる、シンプルで効果的なパイプラインを特徴としている。
スケールアップデータセットを用いてモデルを強化するために,いくつかのトレーニングとモデル修正を提案する。
論文 参考訳(メタデータ) (2024-11-25T07:34:23Z) - NVS-Adapter: Plug-and-Play Novel View Synthesis from a Single Image [45.34977005820166]
NVS-Adapterは、Text-to-Image(T2I)モデルのプラグインモジュールである。
T2Iモデルの一般化能力を完全に活用しながら、新しい視覚オブジェクトのマルチビューを合成する。
実験により,NVS-Adapterは幾何的に一貫した多視点を効果的に合成できることが示されている。
論文 参考訳(メタデータ) (2023-12-12T14:29:57Z) - Monocular Dynamic View Synthesis: A Reality Check [45.438135525140154]
本稿では,実測処理と既存の実験プロトコルの相違点を示す。
我々は、入力キャプチャーシーケンスに存在するマルチビュー信号の量を定量化するために、効果的なマルチビュー因子(EMF)を定義する。
また,より多様な実生活の変形シーケンスを含む新しいiPhoneデータセットを提案する。
論文 参考訳(メタデータ) (2022-10-24T17:58:28Z) - MVLidarNet: Real-Time Multi-Class Scene Understanding for Autonomous
Driving Using Multiple Views [60.538802124885414]
マルチビューLidarNet(MVLidarNet)は,多層物体検出とドライビング空間分割のための2段階のディープニューラルネットワークである。
MVLidarNetは、単一のLiDARスキャンを入力として、乾燥可能な空間を同時に決定しながら、オブジェクトを検出し、分類することができる。
我々は、KITTIとはるかに大きな内部データセットの両方で結果を示し、その方法が桁違いにスケールできることを実証する。
論文 参考訳(メタデータ) (2020-06-09T21:28:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。