論文の概要: SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation
- arxiv url: http://arxiv.org/abs/2604.06113v1
- Date: Tue, 07 Apr 2026 17:24:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.964125
- Title: SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation
- Title(参考訳): SEM-ROVER:大規模運転シーン生成のためのセマンティックボクセル誘導拡散
- Authors: Hiba Dahmani, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond,
- Abstract要約: 本稿では,各占有ボクセルが一定数の色付き表面サンプルを格納する離散表現である$-Voxfield gridに基づく3D生成フレームワークを提案する。
この表現を生成するために,局所的なボクセル近傍で動作する意味条件付き拡散モデルを訓練する。
重なり合う領域にプログレッシブな空間効果を生かして大きなシーンにスケールする。最後に、生成された$-Voxfield グリッドを遅延レンダリングモジュールで描画し、フォトリアリスティックな画像を得る。
- 参考スコア(独自算出の注目度): 7.655860434125127
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scalable generation of outdoor driving scenes requires 3D representations that remain consistent across multiple viewpoints and scale to large areas. Existing solutions either rely on image or video generative models distilled to 3D space, harming the geometric coherence and restricting the rendering to training views, or are limited to small-scale 3D scene or object-centric generation. In this work, we propose a 3D generative framework based on $Σ$-Voxfield grid, a discrete representation where each occupied voxel stores a fixed number of colorized surface samples. To generate this representation, we train a semantic-conditioned diffusion model that operates on local voxel neighborhoods and uses 3D positional encodings to capture spatial structure. We scale to large scenes via progressive spatial outpainting over overlapping regions. Finally, we render the generated $Σ$-Voxfield grid with a deferred rendering module to obtain photorealistic images, enabling large-scale multiview-consistent 3D scene generation without per-scene optimization. Extensive experiments show that our approach can generate diverse large-scale urban outdoor scenes, renderable into photorealistic images with various sensor configurations and camera trajectories while maintaining moderate computation cost compared to existing approaches.
- Abstract(参考訳): スケーラブルな屋外運転シーンの生成には、複数の視点で一貫した3D表現が必要である。
既存のソリューションは、3D空間に蒸留された画像またはビデオ生成モデルに依存し、幾何学的コヒーレンスを損なうとともに、トレーニングビューにレンダリングを制限するか、小規模の3Dシーンやオブジェクト中心生成に制限される。
本研究では,各占有ボクセルが一定数の色付き表面サンプルを格納する離散表現である$Σ$-Voxfield gridに基づく3次元生成フレームワークを提案する。
この表現を生成するために,局所的なボクセル近傍で動作し,空間構造を捉えるために3次元位置符号化を利用する意味条件拡散モデルを訓練する。
重なり合う領域にプログレッシブな空間効果を生かして大きなシーンにスケールする。
最後に、生成された$Σ$-Voxfieldグリッドを遅延レンダリングモジュールでレンダリングし、フォトリアリスティックな画像を得る。
広汎な実験により,本手法は大規模都市屋外シーンを多種多様なセンサ構成とカメラトラジェクトリによるフォトリアリスティックな画像にレンダリング可能であり,既存手法に比べて計算コストの低さを維持した。
関連論文リスト
- Wonderland: Navigating 3D Scenes from a Single Image [43.99037613068823]
本研究では,映像拡散モデルからの潜伏分を利用した大規模再構成モデルを導入し,映像の3次元ガウススプラッティングをフィードフォワードで予測する。
プログレッシブ・ラーニング・ストラテジーを用いて3次元再構成モデルをトレーニングし,高品質でワイドスコープ,ジェネリックな3次元シーンの効率的な生成を可能にする。
論文 参考訳(メタデータ) (2024-12-16T18:58:17Z) - 3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation [51.64796781728106]
本稿では,2次元拡散モデル以前の自然画像と,現在のシーンのグローバルな3次元情報を利用して,高品質で新しいコンテンツを合成する生成的精細化ネットワークを提案する。
提案手法は,視覚的品質と3次元の整合性を改善した多種多様なシーン生成と任意のカメラトラジェクトリをサポートする。
論文 参考訳(メタデータ) (2024-03-14T14:31:22Z) - Denoising Diffusion via Image-Based Rendering [54.20828696348574]
実世界の3Dシーンの高速かつ詳細な再構築と生成を可能にする最初の拡散モデルを提案する。
まず、大きな3Dシーンを効率よく正確に表現できる新しいニューラルシーン表現であるIBプレーンを導入する。
第二に,2次元画像のみを用いて,この新たな3次元シーン表現の事前学習を行うためのデノイング拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-05T19:00:45Z) - Sat2Scene: 3D Urban Scene Generation from Satellite Images with Diffusion [77.34078223594686]
本稿では,3次元スパース表現に拡散モデルを導入し,それらをニューラルレンダリング技術と組み合わせることで,直接3次元シーン生成のための新しいアーキテクチャを提案する。
具体的には、まず3次元拡散モデルを用いて、所定の幾何学の点レベルのテクスチャ色を生成し、次にフィードフォワード方式でシーン表現に変換する。
2つの都市規模データセットを用いた実験により,衛星画像から写真リアルなストリートビュー画像シーケンスとクロスビュー都市シーンを生成する能力を示した。
論文 参考訳(メタデータ) (2024-01-19T16:15:37Z) - SceneWiz3D: Towards Text-guided 3D Scene Composition [134.71933134180782]
既存のアプローチでは、大規模なテキスト・ツー・イメージモデルを使用して3D表現を最適化するか、オブジェクト中心のデータセット上で3Dジェネレータをトレーニングする。
テキストから高忠実度3Dシーンを合成する新しい手法であるSceneWiz3Dを紹介する。
論文 参考訳(メタデータ) (2023-12-13T18:59:30Z) - NeuralField-LDM: Scene Generation with Hierarchical Latent Diffusion
Models [85.20004959780132]
複雑な3D環境を合成できる生成モデルであるNeuralField-LDMを紹介する。
NeuralField-LDMは,条件付きシーン生成,シーンインペインティング,シーンスタイル操作など,さまざまな3Dコンテンツ作成アプリケーションに利用できることを示す。
論文 参考訳(メタデータ) (2023-04-19T16:13:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。