論文の概要: InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2606.31109v1
- Date: Tue, 30 Jun 2026 04:08:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.070615
- Title: InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving
- Title(参考訳): InfiniVerse: 自動運転のための非有界環境生成の取り組み
- Authors: Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li,
- Abstract要約: InfiniVerseは、単一のフレームから動的都市シーンを合成するための統合パイプラインである。
InfiniVerseは6.4のFIDと67.97のFVDで最先端のパフォーマンスを達成し、持続時間と安定性の両方で既存のベンチマークを著しく上回っている。
- 参考スコア(独自算出の注目度): 70.7737035270887
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generating realistic, controllable, and temporally coherent urban environments is a critical yet unresolved challenge in the autonomous driving community. In this paper, we introduce InfiniVerse, a unified pipeline for long-range, 2D-3D-aligned, and controllable synthesis of dynamic urban scenes from a single frame. In practice, our approach first reconstructs a 3D occupancy representation from the input multi-view frame. This representation serves as a foundation for autoregressive scene extension along arbitrary trajectories. Subsequently, a video diffusion model translates the coarse occupancy grid into realistic, spatiotemporally consistent video sequences. Moreover, we propose a hierarchical sketch-and-refine paradigm, in which the generated videos are re-projected as image-conditioned feedback to enhance the 3D occupancy representation, establishing cross-modal alignment and mutual enhancement between the visual and spatial domains. Extensive evaluations on the Waymo Open Dataset and nuScenes demonstrate that InfiniVerse achieves state-of-the-art performance, with a FID of 6.4 and FVD of 67.97, significantly outperforming existing benchmarks in both duration and stability.
- Abstract(参考訳): 現実的で、制御可能で、時間的に一貫性のある都市環境を生成することは、自動運転コミュニティにおいて重要な課題であるが未解決の課題である。
本稿では,長距離2D-3Dアライメントと動的都市景観の制御可能な合成のための統合パイプラインであるInfiniVerseを紹介する。
実際に,本手法はまず,入力された多視点フレームから3次元の占有率表現を再構成する。
この表現は任意の軌道に沿った自己回帰的なシーン拡張の基盤として機能する。
その後、ビデオ拡散モデルにより、粗い占有グリッドを現実的で時空間的に一貫したビデオシーケンスに変換する。
さらに,生成した映像を画像条件のフィードバックとして再投影して3次元占有率の表現を向上し,視覚領域と空間領域の相互拡張と相互アライメントを確立する階層的スケッチ・アンド・リファイン・パラダイムを提案する。
Waymo Open DatasetとnuScenesの大規模な評価は、InfiniVerseが6.4とFVD67.97という最先端のパフォーマンスを達成し、既存のベンチマークよりも持続時間と安定性の両方で大幅に向上していることを示している。
関連論文リスト
- DriveFix: Spatio-Temporally Coherent Driving Scene Restoration [42.359886606034536]
DriveFixは、自動運転シーンのための新しいマルチビュー復元フレームワークである。
提案手法では,時間的空間コヒーレンスとクロスカメラ空間コヒーレンスの両方をモデル化するために,特殊なブロックを持つインターリーブ拡散トランスフォーマアーキテクチャを用いる。
復元されたビューは統一された3D幾何学に従属し、アーティファクトを著しく減少させる。
論文 参考訳(メタデータ) (2026-03-17T09:41:14Z) - OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution [34.8105632078785]
フィードフォワードフレームワークであるOnlineXを導入し、ストリーミング画像のみを用いて3次元の視覚的外観と言語フィールドをオンライン的に再構築する。
我々のフレームワークは、メモリ状態を専用のアクティブな状態と永続的な安定な状態に分離し、その後、前者からの情報を結合して後者に融合させ、忠実性と安定性の両方を達成する。
論文 参考訳(メタデータ) (2026-03-02T17:52:02Z) - RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space [51.441415833480505]
RAYNOVAは、二重因果自己回帰フレームワークを使用するシナリオを駆動するための多視点世界モデルである。
相対的なシャーカー線位置符号化に基づいて、ビュー、フレーム、スケールにまたがる等方的時間的表現を構築する。
論文 参考訳(メタデータ) (2026-02-24T08:41:40Z) - UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction [26.278318116942526]
We present UniSplat, a feed-forward framework that learns robust dynamic scene reconstruction through unified latent-temporal fusion。
実世界のデータセットの実験では、UniSplatが新しい視点で最先端の合成を実現し、オリジナルカメラのカバレッジ外の視点に対して堅牢で高品質なレンダリングを提供することを示した。
論文 参考訳(メタデータ) (2025-11-06T17:49:39Z) - DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion [62.589889759543446]
DriveGen3Dは、高品質で制御可能な動的3D駆動シーンを生成するための新しいフレームワークである。
本研究は,映像の高速化と大規模動的シーン再構築を融合させることにより,この手法のギャップを埋めるものである。
論文 参考訳(メタデータ) (2025-10-17T03:00:08Z) - Driv3R: Learning Dense 4D Reconstruction for Autonomous Driving [116.10577967146762]
マルチビュー画像シーケンスからフレーム単位のポイントマップを直接回帰するフレームワークであるDriv3Rを提案する。
我々は4次元フロー予測器を用いてシーン内の移動物体を識別し、これらの動的領域の再構築をより重視する。
Driv3Rは4D動的シーン再構築において従来のフレームワークより優れており、推論速度は15倍高速である。
論文 参考訳(メタデータ) (2024-12-09T18:58:03Z) - InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models [75.03495065452955]
InfiniCubeはダイナミックな3次元駆動シーンを高忠実かつ制御性で生成するスケーラブルな方法である。
制御可能でリアルな3Dドライビングシーンを生成でき、モデルの有効性と優越性を広範囲にわたる実験により検証できる。
論文 参考訳(メタデータ) (2024-12-05T07:32:20Z) - DriveScape: Towards High-Resolution Controllable Multi-View Driving Video Generation [10.296670127024045]
DriveScapeは、マルチビュー、3D条件付きビデオ生成のためのエンドツーエンドフレームワークである。
我々のBi-Directional Modulated Transformer (BiMot)は3次元構造情報の正確なアライメントを保証する。
DriveScapeはビデオ生成性能に優れ、FIDスコア8.34、FVDスコア76.39でnuScenesデータセットの最先端結果を達成する。
論文 参考訳(メタデータ) (2024-09-09T09:43:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。