InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving
Abstractの概要
InfiniVerseは、単一の多視点観測から自動運転用の長時間の動的都市シーンを生成するための統合パイプラインである。この手法はまず明示的な3D占有(occupancy)表現を再構築し、そのシーンをユーザー定義の軌道に沿って自己回帰的に拡張した後、微調整されたビデオ拡散モデルを用いて占有グリッドをリアルな多視点ビデオに変換する。中心的な設計は双方向の「スケッチ&リファイン」ループであり、粗い占有情報がビデオ合成をガイドし、生成されたフレームが再投影されて3D占有ルールを改良することで、長いロールアウトにわたって2Dと3Dのアライメントを維持することを目指している。Waymo Open DatasetとnuScenesでの実験により、生成品質、時間的整合性、占有再構築が評価され、さらにロールアウト長や構成要素のアブレーション分析も行われている。
新規性
本論文の主な新規性は、ジオメトリとビデオ生成を別々の段階として扱うのではなく、明示的な占有ベースの世界モデリングとビデオ拡散モデルを閉じた相互ループで統合した点にある。また、単一の多視点入力のみから制御可能な長距離生成を可能にする、階層的なスケッチ主導のシーン外挿メカニズムを導入している。
成果
報告されたベンチマークにおいて、InfiniVerseはFID 6.40およびFVD 67.97という最高水準の生成品質を達成し、長期間のロールアウトにおける劣化がVistaよりも遅いと報告している。アブレーション結果は、3Dブランチ、相互ループ、領域認識損失の追加によりビデオ品質が漸進的に向上し、改良されたボクセル再構築が34.31%のIoUおよび20.12%のmIoUに達することを示している。
論文の注目点
- InfiniVerseは、単一の多視点フレームから明示的な3D占有世界を構築し、それを任意の軌道に沿って拡張することで長時間のシーン生成を行う。
- この手法は、双方向の「スケッチ&リファイン」ループを通じて占有生成とビデオ拡散を結合し、時間的安定性とジオメトリ・外観のアライメントを向上させる。
- WaymoおよびnuScenesでの実験において、強力なベンチマーク性能と、再現されたVistaベースラインよりも優れた長期間ロールアウトの安定性が報告されている。