論文の概要: Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene Reconstruction
- arxiv url: http://arxiv.org/abs/2609.23796v2
- Date: Tue, 22 Sep 2026 09:03:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.945224
- Title: Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene Reconstruction
- Title(参考訳): Mira-Scene:3次元画像再構成のための画素アライメントレイアウト
- Abstract要約: シングルイメージの3Dオブジェクト生成は、今や高忠実な資産を生成できるが、それらをコヒーレントなシーンレイアウトに正確に配置することは、未解決の課題である。
スパースポーズの回帰を高密度で有界な対応回復に置き換える構成的3次元シーン再構成フレームワークであるMira-Sceneを提案する。
- 参考スコア(独自算出の注目度): 69.88254698306027
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Single-image 3D object generation can now produce high-fidelity assets, yet accurately placing them into a coherent scene layout remains an open challenge. A central difficulty lies in how object layout is represented. Holistic methods absorb placement into a scene-level generation process, sacrificing object-level detail. Compositional methods preserve object fidelity by decoupling geometry from layout, but typically parameterize layout as sparse, unbounded pose variables that are difficult to learn and generalize poorly under scarce scene-level supervision. We present Mira-Scene, a compositional 3D scene reconstruction framework that replaces sparse pose regression with dense, bounded correspondence recovery. At its core is the Canonical Coordinate Map (CCM), a pixel-aligned field that maps each visible object pixel to a surface coordinate in the object's bounded canonical space. When paired with a scene-space Point Cloud Map (PCM) from monocular geometry estimation, CCM induces dense canonical-to-scene correspondences from which object transformations are recovered through robust geometric alignment. Because CCM operates in bounded canonical space, it provides a stable prediction target that can be trained from scalable object-level 3D data without requiring scene-level layout annotations. Mira-Scene further introduces a multimodal diffusion transformer that jointly generates object geometry and CCMs, using modality-specific expert streams with shared attention and positional encoding to promote geometry-layout consistency. Experiments on indoor, outdoor, synthetic, and in-the-wild scenes show that Mira-Scene substantially outperforms strong baselines in layout accuracy, achieving relative gains of 39.8% in 3D-IoU and 16.5% in 2D-IoU over SAM3D, using limited open-source training data.
- Abstract(参考訳): シングルイメージの3Dオブジェクト生成は、今や高忠実な資産を生成できるが、それらをコヒーレントなシーンレイアウトに正確に配置することは、未解決の課題である。
中心的な困難は、オブジェクトレイアウトの表現方法にある。
全体論的手法は、オブジェクトレベルの詳細を犠牲にして、シーンレベルの生成プロセスに配置を吸収する。
構成的手法は、レイアウトから幾何学を分離することでオブジェクトの忠実性を保っているが、通常はレイアウトを、少ないシーンレベルの監督下では学習が困難で一般化の難しい、疎結合なポーズ変数としてパラメータ化する。
スパースポーズの回帰を高密度で有界な対応回復に置き換える構成的3次元シーン再構成フレームワークであるMira-Sceneを提案する。
中心となるCCM(Canonical Coordinate Map)は、各可視物体を対象の有界標準空間の表面座標にマッピングするピクセルアラインフィールドである。
モノクロ幾何推定からシーン空間のポイントクラウドマップ(PCM)とペアを組むと、CCMは頑健な幾何学的アライメントによってオブジェクト変換が復元される高密度の正準対場対応を誘導する。
CCMは、有界な標準空間で動作するため、シーンレベルのレイアウトアノテーションを必要とせずに、スケーラブルなオブジェクトレベルの3Dデータからトレーニング可能な、安定した予測ターゲットを提供する。
Mira-Sceneはさらに、オブジェクト幾何学とCCMを共同で生成するマルチモーダル拡散変換器を導入している。
屋内、屋外、合成、室内での実験では、Mira-Sceneはレイアウトの精度において強いベースラインをかなり上回り、3D-IoUで39.8%、SAM3Dで2D-IoUで16.5%の相対的な上昇を達成した。
関連論文リスト
- SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration [32.39337008619354]
単一画像の3Dシーン生成を3つの構造化ステージに分解するマルチエージェントオーケストレーションフレームワークを提案する。
ポイントマップから導出される疎幾何学的事前情報によって教師される幾何学的レイアウト予測器を提案する。
本手法は,幾何学的精度,空間的整合性,知覚的リアリズムにおいて,従来手法よりも常に優れていた。
論文 参考訳(メタデータ) (2026-06-07T01:38:39Z) - 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image [26.04490259188974]
合成3Dシーン生成のための新しいインプレース・コンプリート・パラダイムである3D-Fixerを紹介する。
明示的なポーズアライメントを必要とする以前の作品とは異なり、3D-Fixerはレイアウトの忠実さを維持するために空間アンカーとして断片化された幾何学を使用している。
これまでで最大のシーンレベルのデータセットであるARSG-110Kについて述べる。
論文 参考訳(メタデータ) (2026-04-06T04:11:09Z) - IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion [15.837932667195037]
IGFuseは対話型ガウスシーンを複数のスキャンから観測することで再構成する新しいフレームワークである。
本手法は,ガウス場を意識したセグメンテーションを構築し,スキャン間の双方向光度・セマンティック一貫性を実現する。
IGFuseは、密度の高い観測や複雑なパイプラインを使わずに、高忠実なレンダリングとオブジェクトレベルのシーン操作を可能にする。
論文 参考訳(メタデータ) (2025-08-18T17:59:47Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting [52.150502668874495]
GALA3D, GALA3D, 生成3D GAussian, LAyout-guided control, for effective compositional text-to-3D generation。
GALA3Dは、最先端のシーンレベルの3Dコンテンツ生成と制御可能な編集のための、ユーザフレンドリーでエンドツーエンドのフレームワークである。
論文 参考訳(メタデータ) (2024-02-11T13:40:08Z) - CommonScenes: Generating Commonsense 3D Indoor Scenes with Scene Graph
Diffusion [83.30168660888913]
シーングラフを対応する制御可能な3Dシーンに変換する完全生成モデルであるCommonScenesを提案する。
パイプラインは2つのブランチで構成されており、1つは変分オートエンコーダでシーン全体のレイアウトを予測し、もう1つは互換性のある形状を生成する。
生成されたシーンは、入力シーングラフを編集し、拡散モデルのノイズをサンプリングすることで操作することができる。
論文 参考訳(メタデータ) (2023-05-25T17:39:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。