論文の概要: SpatialCrafter: Single Image World Modeling with Generative 3D Proxies
- arxiv url: http://arxiv.org/abs/2608.27073v2
- Date: Fri, 28 Aug 2026 15:48:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.099817
- Title: SpatialCrafter: Single Image World Modeling with Generative 3D Proxies
- Title(参考訳): SpaceCrafter: 生成3Dプロキシによる単一イメージワールドモデリング
- Authors: Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan,
- Abstract要約: ビデオ拡散モデル(VDM)は一般にスパース点雲や2Dパノラマのような不完全信号の条件付けに依存している。
本稿では,高忠実度画像からシーン生成のためのグローバルな3Dプロキシを導入することで,これらの問題に対処する新しい2段階フレームワークを提案する。
プロキシ生成のために,空間的に整合した幾何学的に整合した3Dプロキシを予測できるポイントアンコールスパース構造(PaSS)フローモジュールを提案する。
外観改善のために、私たちはVDMを生成デファレント・リファインダーとして再構成し、プロキシ定義シーン幾何学に基づく高周波フォトリアリスティックの詳細を合成する。
- 参考スコア(独自算出の注目度): 41.996454262653735
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Explorable image-to-scene generation is essential for applications in gaming, robotics, and virtual reality. Existing methods based on video diffusion model (VDM) commonly rely on incomplete conditioning signals such as sparse point clouds or 2D panoramas, leading to stochastic hallucinations, long-term drifts and suboptimal 3D consistency. We present SpatialCrafter, a novel two-stage framework that addresses these issues by introducing a global 3D proxy for high-fidelity image-to-scene generation. Specifically, we decompose the generation process into global proxy generation and appearance refinement. For proxy generation, we propose a Point-anchored Sparse Structure~(PaSS) Flow module that predicts a spatially aligned and geometrically consistent 3D proxy. For appearance refinement, we re-frame the VDM as a Generative Deferred Refiner which synthesizes high-frequency photorealistic details upon proxy-defined scene geometry. To better integrate the proxy with the pre-trained VDM, we introduce Parallel Geometry Injection and Proxy-Aware Corruption training strategies, which improve robustness to proxy artifacts without disrupting the pretrained generative manifold. Furthermore, as no suitable dataset exists for this explorable scene generation task, we construct a new large-scale dataset of 115K scenes. To the best of our knowledge, it is the first hybrid dataset for image-to-scene generation. Extensive experiments on both synthetic and real-world datasets show that SpatialCrafter outperforms state-of-the-art methods, mitigates long-term drift, and remains robust and consistent under rapid camera motion and extreme viewpoint changes. Our project page: \href{https://fangchuan.github.io/SpatialCrafter/}{fangchuan.github.io/SpatialCrafter/}
- Abstract(参考訳): 探索可能な画像からシーン生成は、ゲーム、ロボティクス、バーチャルリアリティーにおけるアプリケーションに不可欠である。
ビデオ拡散モデル(VDM)に基づく既存の手法は、一般にスパース点雲や2次元パノラマのような不完全条件信号に依存しており、確率的幻覚、長期的ドリフト、最適3次元一貫性をもたらす。
本研究では,高忠実度画像からシーン生成のためのグローバルな3Dプロキシを導入することで,これらの問題に対処する新しい2段階フレームワークであるSpatialCrafterを紹介する。
具体的には、生成プロセスをグローバルプロキシ生成と外観改善に分解する。
プロキシ生成のために,空間的に整合した幾何学的に整合した3Dプロキシを予測できるポイントアンコールスパース構造~(PaSS)フローモジュールを提案する。
外観改善のために、我々はVDMを生成デファレント・リファイナとして再構成し、プロキシ定義シーン幾何に基づいて高周波光リアル性の詳細を合成する。
プレトレーニングされたVDMとプロキシをよりよく統合するために,プレトレーニングされた生成多様体を乱すことなく,プロキシアーティファクトの堅牢性を向上させるParallel Geometry InjectionとProxy-Aware Corruptionトレーニング戦略を導入する。
さらに,この探索可能なシーン生成タスクに適したデータセットが存在しないため,新たに115Kシーンの大規模データセットを構築した。
我々の知る限りでは、画像からシーン生成のための最初のハイブリッドデータセットである。
合成と実世界の両方のデータセットに対する大規模な実験により、SpatialCrafterは最先端の手法より優れ、長期的なドリフトを軽減し、迅速なカメラの動きと極端な視点の変化の下で頑健で一貫性が保たれていることが示されている。
プロジェクトページ: \href{https://fangchuan.github.io/SpatialCrafter/}{fangchuan.github.io/SpatialCrafter/}
関連論文リスト
- Lyra 2.0: Explorable Generative 3D Worlds [77.45279013687427]
Lyra 2.0は、永続的で探索可能な3D世界を大規模に生成するためのフレームワークです。
空間的忘れに対処するため、フレームごとの3D形状を維持し、情報ルーティングのみに使用します。
自己拡張された履歴をトレーニングして、モデルを自身の劣化した出力に公開し、それを伝播するのではなく、ドリフトを正すように教えます。
論文 参考訳(メタデータ) (2026-04-14T17:59:44Z) - FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation [75.74617373156902]
FreeScaleは、限られた現実世界の画像シーケンスを、高品質なトレーニングデータのスケーラブルなソースに変換するフレームワークである。
フィードフォワードNVSモデルのトレーニングをスケールアップし,PSNRにおける2.7dBの顕著なゲインを達成することにより,FreeScaleの有効性を示す。
私たちの仕事は、3Dビジョンの根本的なボトルネックを克服するために、実用的で強力なデータ生成エンジンを提供します。
論文 参考訳(メタデータ) (2026-04-12T08:00:53Z) - WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation [33.369156362316055]
コンピュータビジョン、グラフィックス、ロボット工学におけるシーンモデリングの基本的なタスクとして、無制限の3Dワールドジェネレーションが登場しつつある。
本研究では,非有界な3次元世界を生成する新手法 WorldFlow3D を提案する。
論文 参考訳(メタデータ) (2026-03-31T00:08:17Z) - WorldGrow: Generating Infinite 3D World [75.81531067447203]
我々は、無限に拡張可能な3D世界、すなわちコヒーレントな幾何学と現実的な外観を持つ大規模で連続的な環境を生み出すという課題に取り組む。
本研究では,非有界な3次元シーン合成のための階層的フレームワークWorldGrowを提案する。
提案手法は,(1)高品質なシーンブロックを抽出し,シーン生成に適した3D構造化潜在表現を作成するデータキュレーションパイプライン,(2)コンテキスト認識シーン拡張を可能にする3Dブロックインペイント機構,(3)グローバルなレイアウトの妥当性と局所幾何学的/音声的忠実性の両立を保証する粗大かつ微細な生成戦略,の3つのコアコンポーネントを特徴とする。
論文 参考訳(メタデータ) (2025-10-24T17:39:52Z) - Topology Sculptor, Shape Refiner: Discrete Diffusion Model for High-Fidelity 3D Meshes Generation [14.55646181682844]
Topology Sculptor, Shape Refiner (TSSR)は、高品質なアーティストスタイルの3Dメッシュを生成する新しい方法である。
この並列生成能力は,3つの重要なイノベーションを通じて活用しています。
複雑なデータセットの実験は、TSSRが高品質な3Dアーティストスタイルのメッシュを生成することを示した。
論文 参考訳(メタデータ) (2025-10-24T08:51:48Z) - OracleGS: Grounding Generative Priors for Sparse-View Gaussian Splatting [78.70702961852119]
OracleGSは、Gaussian Splattingのスパースビューのために、生成的完全性と回帰的忠実性を調整している。
提案手法は,多視点幾何学的証拠に先立って強力な生成条件を定め,幻覚的アーティファクトをフィルタリングし,非拘束領域における可塑性完備を保存している。
論文 参考訳(メタデータ) (2025-09-27T11:19:32Z) - 3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation [51.64796781728106]
本稿では,2次元拡散モデル以前の自然画像と,現在のシーンのグローバルな3次元情報を利用して,高品質で新しいコンテンツを合成する生成的精細化ネットワークを提案する。
提案手法は,視覚的品質と3次元の整合性を改善した多種多様なシーン生成と任意のカメラトラジェクトリをサポートする。
論文 参考訳(メタデータ) (2024-03-14T14:31:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。