論文の概要: WorldSculpt: Generating Compositional Worlds from Grounded Videos
- arxiv url: http://arxiv.org/abs/2609.05416v2
- Date: Mon, 07 Sep 2026 05:52:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:42.086368
- Title: WorldSculpt: Generating Compositional Worlds from Grounded Videos
- Title(参考訳): WorldSculpt: グラウンドドビデオから構成世界を生成する
- Authors: Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang,
- Abstract要約: 本研究では,数百個のオブジェクトを含む散在するシーンの合成3次元表現を生成する問題について検討する。
この課題は、物体が互いに強く干渉し合うような密集したシーンにおいて挑戦的であり、それぞれのビューはその幾何のごく一部しか明らかにしない。
多視点観察に先立ち、強い単物体3D生成を適応させることにより、数百個の物体からなる複雑なシーンを合成的に生成できることが示される。
- 参考スコア(独自算出の注目度): 50.427204240556854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study the problem of generating a compositional 3D representation of a cluttered scene containing hundreds of objects. The goal is to represent the scene as a collection of individual object meshes placed in a shared world frame, as required by downstream applications such as gaming, AR/VR, simulation, and robotics. This task is challenging in densely cluttered scenes, where objects heavily occlude one another and each view reveals only a fraction of their geometry. Geometry-based approaches typically reconstruct the scene as a single representation and leave incomplete geometry in occluded regions, while existing compositional methods with generative priors are largely limited to relatively simple scenes. We show that complex scenes with hundreds of objects can instead be generated compositionally by adapting a strong single-object 3D generative prior to multi-view observations. We instantiate this paradigm with Pixal3D, extending it with a multi-view conditioning pathway that grounds object generation in multiple posed observations. Although the model is finetuned entirely on single objects in canonical space, it generalizes to large scenes with severe occlusion without any scene-level training, demonstrating the feasibility and scalability of this paradigm. We further introduce UE-MeshyScene, a photorealistic benchmark of densely cluttered scenes with hundreds of objects, per-object annotations, and ground-truth meshes. Across single-object, controlled multi-object, and UE-MeshyScene evaluations, our method consistently outperforms prior approaches, with larger gains as scene complexity and occlusion increase. Finally, we demonstrate broader applicability by converting generated 3DGS worlds, such as Marble and HY-World 2.0, into compositional mesh scenes.
- Abstract(参考訳): 本研究では,数百個のオブジェクトを含む散在するシーンの合成3次元表現を生成する問題について検討する。
ゴールは、ゲーム、AR/VR、シミュレーション、ロボット工学といった下流アプリケーションに必要なように、共有ワールドフレームに配置された個々のオブジェクトメッシュの集合としてシーンを表現することである。
この課題は、物体が互いに強く干渉し合うような密集したシーンにおいて挑戦的であり、それぞれのビューはその幾何のごく一部しか明らかにしない。
幾何学に基づくアプローチは通常、シーンを単一の表現として再構築し、閉鎖された領域に不完全な幾何学を残し、生成前の既存の構成法は比較的単純なシーンに限られる。
多視点観察に先立ち、強い単物体3D生成を適応させることにより、数百個の物体からなる複雑なシーンを合成的に生成できることが示される。
我々は、このパラダイムをPixal3Dでインスタンス化し、複数の観測でオブジェクトを生成するマルチビューコンディショニングパスで拡張する。
モデルは完全に標準空間内の単一オブジェクトに微調整されているが、シーンレベルのトレーニングを伴わずに厳密な閉塞を伴う大きなシーンに一般化し、このパラダイムの実現可能性と拡張性を示している。
UE-MeshySceneは、数百のオブジェクト、オブジェクトごとのアノテーション、地表面のメッシュで密に散らばったシーンのフォトリアリスティックなベンチマークである。
単目的, 制御された多目的, UE-MeshySceneの評価では, シーンの複雑さやオクルージョンの増加とともに, 従来手法よりもずっと優れていた。
最後に,MarbleやHY-World 2.0といった生成された3DGS世界を,構成メッシュシーンに変換することで,より広範な適用性を示す。
関連論文リスト
- WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion [39.78606573330677]
テキスト・ツー・イメージとビデオのアプローチは、明示的な幾何学が欠如しているため、限られた環境スケールを超えてシーンレベルの一貫性とオブジェクトレベルの一貫性を維持するのに苦労する。
本稿では,大規模な3次元シーン合成の複雑な問題を構造合成に分解する幾何学的手法を提案する。
これにより、スケーラブルで任意の大きさのオブジェクトのリッチさと多様性の3Dシーンが実現され、堅牢な3D一貫性とフォトリアリスティックなディテールが組み合わさる。
論文 参考訳(メタデータ) (2026-03-24T09:10:08Z) - SCORP: Scene-Consistent Object Refinement via Proxy Generation and Tuning [46.441761732998536]
プロキシジェネレーションとチューニング(SCORP)によるシーン一貫性オブジェクトリファインメント(Scene-Consistent Object Refinement)について紹介する。
SCORP は、3D 生成に先立って細粒度なオブジェクトの形状と外観を復元する新しい3D拡張フレームワークである。
これは、新しいビュー合成と幾何完成タスクの両方において、最近の最先端のベースラインに対して一貫した利得を達成する。
論文 参考訳(メタデータ) (2025-06-30T13:26:21Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - Zero-Shot Multi-Object Scene Completion [59.325611678171974]
1枚のRGB-D画像から複雑なシーンにおける複数の見えない物体の完全な形状を復元する3Dシーン補完法を提案する。
提案手法は, 合成および実世界の両方のデータセットにおいて, 現在の最先端技術よりも優れている。
論文 参考訳(メタデータ) (2024-03-21T17:59:59Z) - SceneWiz3D: Towards Text-guided 3D Scene Composition [134.71933134180782]
既存のアプローチでは、大規模なテキスト・ツー・イメージモデルを使用して3D表現を最適化するか、オブジェクト中心のデータセット上で3Dジェネレータをトレーニングする。
テキストから高忠実度3Dシーンを合成する新しい手法であるSceneWiz3Dを紹介する。
論文 参考訳(メタデータ) (2023-12-13T18:59:30Z) - Object Scene Representation Transformer [56.40544849442227]
オブジェクトシーン表現変換(OSRT: Object Scene Representation Transformer)は、新しいビュー合成を通じて、個々のオブジェクト表現が自然に現れる3D中心のモデルである。
OSRTは、既存のメソッドよりもオブジェクトとバックグラウンドの多様性が大きい、はるかに複雑なシーンにスケールする。
光電場パラメトリゼーションと新しいSlot Mixerデコーダのおかげで、合成レンダリングでは桁違いに高速である。
論文 参考訳(メタデータ) (2022-06-14T15:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。