論文の概要: Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments
- arxiv url: http://arxiv.org/abs/2607.02407v1
- Date: Thu, 02 Jul 2026 16:40:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.922604
- Title: Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments
- Title(参考訳): 非マンハッタン環境におけるテキスト駆動3次元室内シーン合成
- Authors: Xianhui Meng, Zirui Song, Yuchen Zhang, Li Zhang, Yongxuan Lv, Xiuying Chen, Kun Wang, Yan Luo, Kai Chen, Hangjun Ye, Long Chen, Jun Liu, Xiaoshuai Hao,
- Abstract要約: 大規模言語モデル(LLM)は3次元屋内環境において顕著な能力を示した。
既存のメソッドは、マンハッタン以外の設定で可視なオブジェクトレイアウトパターンをキャプチャできないことが多い。
本研究では,複雑な非マンハッタン環境において,物理的に可視な屋内シーンを生成するための新しいテキスト駆動型フレームワークを提案する。
- 参考スコア(独自算出の注目度): 38.82318963072711
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have demonstrated remarkable capabilities in 3D indoor synthesis for Manhattan environments. However, existing methods often fail to capture plausible object layout patterns in non-Manhattan settings, primarily because they struggle to model non-orthogonal spatial relationships, leading to high geometric violations and low physical fidelity. To address this challenge, we propose SPG-Layout, a novel text-driven framework designed to generate physically plausible indoor scenes within complex non-Manhattan environments. Specifically, we first utilize statistical priors of object distributions to guide the training process, enhancing environmental understanding and fidelity. Furthermore, mirroring human design workflows, we adopt a hierarchical layout strategy that prioritizes the placement of large objects, thereby substantially minimizing layout violations. By synergizing these components, SPG-Layout achieves a balanced optimization of semantic realism and physical plausibility. To evaluate performance in these complex settings, we constructed a new benchmark comprising 500 diverse non-Manhattan environments. Extensive experiments demonstrate that SPG-Layout consistently and significantly outperforms existing methods across both Manhattan and non-Manhattan environments. The code will be publicly released.
- Abstract(参考訳): 大規模言語モデル (LLM) はマンハッタン環境における3次元屋内合成において顕著な能力を示した。
しかし、既存の手法は、非マンハッタンの環境において、非直交空間関係のモデル化に苦慮し、高い幾何学的違反と低い物理的忠実さをもたらすため、可塑性なオブジェクトレイアウトパターンをキャプチャできないことが多い。
SPG-Layoutは、複雑な非マンハッタン環境において、物理的に可視な屋内シーンを生成するように設計された、新しいテキスト駆動型フレームワークである。
具体的には、まず、対象分布の統計的先行性を利用して、トレーニングプロセスのガイドを行い、環境理解と忠実性を高める。
さらに,人間の設計ワークフローを反映して,大規模オブジェクトの配置を優先する階層的なレイアウト戦略を採用し,レイアウト違反を大幅に最小化する。
これらのコンポーネントを相乗化することにより、SPG-Layoutはセマンティックリアリズムと物理的妥当性のバランスよく最適化する。
これらの複雑な環境での性能を評価するために,500種類の非マンハッタン環境からなる新しいベンチマークを構築した。
大規模な実験により、SPG-Layoutはマンハッタンと非マンハッタンの環境において、既存の手法を一貫して、そして著しく上回っていることが示された。
コードは公開されます。
関連論文リスト
- UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass [83.7071371474926]
UniSHは、統合されたフィードフォワードフレームワークで、共同でメートルスケールの3Dシーンと人間の再構築を行う。
我々のフレームワークは、シーン再構築とHMRとの違いを強く橋渡しします。
本モデルは,人間中心のシーン再構築における最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-01-03T16:06:27Z) - GOPLA: Generalizable Object Placement Learning via Synthetic Augmentation of Human Arrangement [16.549660613125877]
GOPLAは、拡張された人間のデモンストレーションから一般化可能なオブジェクト配置を学ぶ階層的なフレームワークである。
データ不足を克服するため、私たちは、人間の配置デモを多様な合成トレーニングデータに拡張するスケーラブルなパイプラインを導入しました。
提案手法は, 位置決め精度と身体的妥当性を指標として, ランナアップよりも30.04ポイントの配置成功率を向上する。
論文 参考訳(メタデータ) (2025-10-16T12:38:14Z) - DisCo-Layout: Disentangling and Coordinating Semantic and Physical Refinement in a Multi-Agent Framework for 3D Indoor Layout Synthesis [76.7196710324494]
3次元屋内レイアウト合成は仮想環境構築に不可欠である。
DisCoは、物理的および意味的な洗練を歪め、調整する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T16:30:37Z) - SPATIALGEN: Layout-guided 3D Indoor Scene Generation [37.30623176278608]
本研究では,現実的でセマンティックに整合した室内シーンを生成するマルチビューマルチモーダル拡散モデルであるSpatialGenを提案する。
3次元レイアウトと参照画像が与えられたモデルでは、任意の視点から外観(カラー画像)、幾何学(シーン座標マップ)、意味(セマンティックセグメンテーションマップ)を合成する。
私たちは、コミュニティを力づけ、屋内のシーン理解と生成の分野を前進させるために、データとモデルをオープンソース化しています。
論文 参考訳(メタデータ) (2025-09-18T14:12:32Z) - SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting [85.87902260102652]
本稿では, 連続3次元ガウシアン・アフラマンス推論の課題について紹介する。
次に,SeqSplatNetを提案する。SqSplatNetは,命令を直接3Dアベイランスマスクのシーケンスにマッピングするエンドツーエンドフレームワークである。
本手法は,1段階のインタラクションから,シーンレベルでの複雑なシーケンシャルなタスクへの可利用性推論を効果的に向上させる。
論文 参考訳(メタデータ) (2025-07-31T17:56:55Z) - Mixed Diffusion for 3D Indoor Scene Synthesis [55.94569112629208]
提案するMiDiffusionは,可塑性3次元屋内シーンを合成するための混合離散連続拡散モデルである。
床条件の3次元シーン合成において,最先端の自己回帰モデルおよび拡散モデルより優れることを示す。
論文 参考訳(メタデータ) (2024-05-31T17:54:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。