論文の概要: HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation
- arxiv url: http://arxiv.org/abs/2605.13586v1
- Date: Wed, 13 May 2026 14:21:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.100657
- Title: HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation
- Title(参考訳): HetScene:Dense Indoor Scene Generationのための不均一性を考慮した拡散
- Authors: Zini Chen, Junming Huang, Rong Zhang, Jiamin Xu, Cheng Peng, Chi Wang, Weiwei Xu,
- Abstract要約: HetSceneは、インボディードAIのための制御可能で物理的に検証可能な屋内シーンを生成するためのフレームワークである。
シーンを形作る役割に応じて、オブジェクトをプライマリオブジェクトとセカンダリオブジェクトに分解する。
テキスト記述、トップダウンのバイナリルームマスク、空間関係グラフに条件付けされたプライマリオブジェクトのみを用いて、グローバルに一貫性のある構造レイアウトを生成する。
- 参考スコア(独自算出の注目度): 25.696780353190253
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generating controllable and physically plausible indoor scenes is a pivotal prerequisite for constructing high-fidelity simulation environments for embodied AI. However, existing deeplearning-based methods usually treat all objects as homogeneous instances within a unified generation process. While effective for sparse and simplistic layouts, they struggle to model realistic layouts with dense object arrangements and complex spatial dependencies, leadingto limited scalability and degraded physical plausibility. To deal with these challenges, we revisit indoor layout generation from the perspective of structural heterogeneity and decompose the objects into primary objects and secondary objects according to their distinct roles in shaping a scene. Based on this decomposition, we propose HetScene, a heterogeneous two-stage generation framework that decouples indoor layout synthesis into Structural Layout Generation (SLG) and Contextual Layout Generation (CLG). SLG first generates globally coherent structural layouts with only primary objects conditioned on text descriptions, top-down binary room masks, and spatial relation graphs, establishing a stable global macro-skeleton of large core furniture.
- Abstract(参考訳): 制御可能で物理的に可視な屋内シーンの生成は、エンボディドAIのための高忠実度シミュレーション環境を構築するための重要な前提条件である。
しかし、既存のディープラーニングベースの手法は、通常、全てのオブジェクトを統一された生成プロセス内で均質なインスタンスとして扱う。
スパースレイアウトと単純化レイアウトには有効であるが、密集したオブジェクト配置と複雑な空間依存によるリアルレイアウトのモデル化に苦慮し、スケーラビリティの制限と物理的妥当性の低下につながった。
これらの課題に対処するため、構造的不均一性の観点から屋内レイアウト生成を再考し、シーン形成における個々の役割に応じて、オブジェクトを一次オブジェクトと二次オブジェクトに分解する。
この分解に基づいて、内部レイアウト合成を構造レイアウト生成(SLG)とコンテキストレイアウト生成(CLG)に分離する異種二段階生成フレームワークであるHetSceneを提案する。
SLGはまず、テキスト記述、トップダウンのバイナリルームマスク、空間関係グラフに条件付けされた一次オブジェクトのみを持つグローバルコヒーレントな構造配置を生成し、大きなコア家具の安定な大域マクロスケルトンを確立する。
関連論文リスト
- CasLayout: Cascaded 3D Layout Diffusion for Indoor Scene Synthesis with Implicit Relation Modeling [18.135856965440784]
既存のアプローチは、しばしば構造境界を見落としたり、冗長な生成エラーをもたらす完全に連結された関係グラフに依存したりする。
人間のデザイン認知にインスパイアされたCasは,共同シーン生成タスクを4つの条件付きサブステージに分解する,カスケード拡散フレームワークである。
実験により、Casは、実用上の制御性を改善しつつ、忠実さと多様性の最先端性能を達成することを示した。
論文 参考訳(メタデータ) (2026-04-30T03:18:26Z) - StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation [72.84181869780627]
StructDiffは、単一画像生成のための単一スケール拡散モデルに基づく生成フレームワークである。
3次元位置符号化(PE)を空間的先行として組み込んでおり、生成されたオブジェクトの位置、スケール、局所的な詳細を柔軟に制御することができる。
また、テキスト誘導画像生成、画像編集、アウトペインティング、ペイント・ツー・イメージ合成など、下流タスクにも幅広い適用性を示す。
論文 参考訳(メタデータ) (2026-04-14T10:55:43Z) - Pair2Scene: Learning Local Object Relations for Procedural Scene Generation [10.247549170637418]
Pair2Sceneは、学習したローカルルールとシーン階層と物理ベースのアルゴリズムを統合する新しい手続き生成フレームワークである。
私たちのフレームワークは、トレーニングデータを超えた複雑な環境を生成する上で、既存の手法よりも優れています。
論文 参考訳(メタデータ) (2026-04-13T17:59:55Z) - PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement [89.35154754765502]
PhyScensisは物理エンジンを動力とするエージェントベースのフレームワークで、物理的に可視なシーン構成を生成する。
本フレームワークは,微粒なテキスト記述や数値パラメータに対する強い制御性を保っている。
実験の結果,本手法はシーンの複雑さ,視覚的品質,身体的精度において,従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2026-02-16T17:55:25Z) - HiGS: Hierarchical Generative Scene Framework for Multi-Step Associative Semantic Spatial Composition [1.9131307324613616]
多段階意味空間合成のための階層的生成フレームワークであるHiGSを提案する。
HiGSでは、キーセマンティックオブジェクトを選択して、興味のある領域を細かく制御することで、シーンを反復的に拡張することができる。
構造化とコヒーレントな生成を支援するために,我々は,プログレッシブ階層空間意味グラフを導入する。
論文 参考訳(メタデータ) (2025-10-31T03:50:47Z) - RoomCraft: Controllable and Complete 3D Indoor Scene Generation [51.19602078504066]
RoomCraftは、実際の画像、スケッチ、テキスト記述をコヒーレントな3D屋内シーンに変換するマルチステージパイプラインである。
このアプローチでは,シーン生成パイプラインと制約駆動最適化フレームワークを組み合わせる。
RoomCraftは、リアルでセマンティックなコヒーレントで視覚的に魅力的な部屋レイアウトを生成する上で、既存の方法よりもはるかに優れています。
論文 参考訳(メタデータ) (2025-06-27T15:03:17Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - LAW-Diffusion: Complex Scene Generation by Diffusion with Layouts [107.11267074981905]
LAW拡散(LAW-Diffusion)と呼ばれる意味制御可能なレイアウト・AWare拡散モデルを提案する。
LAW拡散は、特にコヒーレントな対象関係を持つ最先端の生成性能をもたらすことを示す。
論文 参考訳(メタデータ) (2023-08-13T08:06:18Z) - Person-in-Context Synthesiswith Compositional Structural Space [59.129960774988284]
本研究では,コンテキスト合成におけるtextbfPersons という新たな問題を提案する。
コンテキストは、形状情報を欠いたバウンディングボックスオブジェクトレイアウトで指定され、キーポイントによる人物のポーズは、わずかに注釈付けされている。
入力構造におけるスターク差に対処するため、各(コンテキスト/人物)入力を「共有構成構造空間」に意図的に合成する2つの別個の神経枝を提案した。
この構造空間は多レベル特徴変調戦略を用いて画像空間にデコードされ、自己学習される
論文 参考訳(メタデータ) (2020-08-28T14:33:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。