論文の概要: Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs
- arxiv url: http://arxiv.org/abs/2608.07012v1
- Date: Fri, 07 Aug 2026 09:24:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.448178
- Title: Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs
- Title(参考訳): Scenix:Sparse-View 3D Scene Reconstruction by Executable Scene Programs
- Abstract要約: 実行可能シーンプログラムによるスパースビュー3Dシーン再構築フレームワークであるtextscScenix を提示する。
スパースビューを前提として、textscScenix は知覚的資産インスタンス化とクローズドループ空間改善を通じて実行可能なシーンプログラムを予測する。
さらに、各対象シーンを、入力ビューで利用可能な視覚的エビデンスと整合させる、観測一貫性のある監視を導入する。
- 参考スコア(独自算出の注目度): 36.87702450793552
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthesizing a structured and editable 3D indoor scene from a few uncalibrated RGB views requires more than generating high-quality individual assets: a system must infer the room structure, associate objects across incomplete observations, and recover a globally consistent spatial configuration. Previous methods mainly focus on 3D scene generation with text input or require continuous visual inputs with additional priors, \ e.g., human-annotated masks or accurate 3D layouts, which makes these methods labor demanding and hard to apply in general cases. We present \textsc{Scenix}, a sparse-view 3D scene reconstruction framework via executable scene programs, a structured representation that can be directly instantiated into editable 3D scenes. Given sparse views, \textsc{Scenix} predicts executable scene programs through perception-grounded asset instantiation and closed-loop spatial refinement. % We present \method, a framework that predicts an executable scene representation from sparse views and realizes it through perception-grounded asset instantiation and closed-loop spatial refinement. To support this task, we construct \dataset, a dataset of approximately 110,000 synthetic and real indoor scenes with multiview imagery, room structures, object-centric descriptions, and metric spatial annotations. We further introduce observation-consistent supervision that aligns each target scene with the visual evidence available in its input views. Experiments on held-out \textsc{XScene} scenes, real indoor images, and out-of-distribution SpatialGen cases evaluate structured scene prediction, object grounding, and spatial refinement.
- Abstract(参考訳): 構造化され編集可能な3D屋内シーンをいくつかの未調整のRGBビューから合成するには、高品質な個々の資産を生成すること以上の必要が生じる:システムは部屋の構造を推論し、不完全な観察をまたいだオブジェクトを関連付け、グローバルに一貫した空間構成を復元する必要がある。
従来はテキスト入力による3Dシーン生成に重点を置いていたり、追加の事前情報を持つ連続的な視覚入力が必要であったりした。
本稿では,編集可能な3Dシーンに直接インスタンス化可能な構造化表現である「textsc{Scenix}」を,実行可能シーンプログラムを介してスパースビュー3Dシーン再構築フレームワークとして提示する。
スパースビューを前提として, 認識基底のアセットインスタンス化と閉ループ空間改善により, 実行可能シーンプログラムを予測する。
% では,スパースビューから実行可能なシーン表現を予測し,認識された資産のインスタンス化と閉ループ空間の洗練により実現するフレームワークである \method を提示する。
このタスクを支援するために,多視点画像,部屋構造,オブジェクト中心の記述,距離空間アノテーションを備えた,約110,000の合成及び実際の屋内シーンのデータセットである \dataset を構築した。
さらに、各対象シーンを、入力ビューで利用可能な視覚的エビデンスと整合させる、観測一貫性のある監視を導入する。
実室内画像,及び分布外空間Genケースの撮影実験は,構成されたシーン予測,オブジェクトの接地,空間的精細化を評価した。
関連論文リスト
- SceneReGen: Generative Reconstruction of 3D Scenes from a Single Image [24.844593424101618]
我々は、シーン再構築を完全なオブジェクト資産の生成と組み立てとして再解釈する生成的再構築フレームワークであるSceneReGenを紹介した。
SceneReGenは、選択的なポーズ係数化を通じて生成/再構成ギャップに対処する。
SceneReGenは評価手法の中で,最高のシーンレベルCD,シーンレベルFスコア,3DバウンディングボックスIoUを実現している。
論文 参考訳(メタデータ) (2026-08-25T00:29:37Z) - SceneFrom3D: Geometry-Conditioned Outdoor 3D Scene Generation via View Scheduling with Object-Level Control [16.72440328307137]
SceneFrom3Dは、屋外の入力ジオメトリからビューを自動的にスケジュールするフレームワークである。
SceneFrom3Dは、オブジェクトレベルの条件付けによって制御性をさらに改善し、各オブジェクトを外観ガイダンスのアイデンティティイメージに割り当てる。
実験により、SceneFrom3Dは最先端の幾何学条件付き屋外3D生成を実現することが示された。
論文 参考訳(メタデータ) (2026-07-05T23:07:03Z) - SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration [32.39337008619354]
単一画像の3Dシーン生成を3つの構造化ステージに分解するマルチエージェントオーケストレーションフレームワークを提案する。
ポイントマップから導出される疎幾何学的事前情報によって教師される幾何学的レイアウト予測器を提案する。
本手法は,幾何学的精度,空間的整合性,知覚的リアリズムにおいて,従来手法よりも常に優れていた。
論文 参考訳(メタデータ) (2026-06-07T01:38:39Z) - ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment [43.63998785971779]
ReplicateAnySceneは,カジュアルな映像を合成3Dシーンに完全自動・ゼロショット変換できるフレームワークである。
私たちのパイプラインには5段階のカスケードが組み込まれており、視覚基盤モデルから一般的な事前情報を抽出し、構造的に整列する。
大規模な実験により,高品質な合成3Dシーンの生成において,既存のベースラインよりも優れた手法が示された。
論文 参考訳(メタデータ) (2026-04-12T19:42:12Z) - SDesc3D: Towards Layout-Aware 3D Indoor Scene Generation from Short Descriptions [71.54559024212976]
短いテキスト記述を前提とした室内3次元シーン生成は,インタラクティブな3次元環境構築に有望な道を提供する。
既存の作品は、そのような意味的凝縮の場合、身体的妥当性の低下と詳細性の不足に悩まされている。
SDesc3Dは,マルチビュー構造と地域機能を考慮した,短文条件付き屋内シーン生成フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T12:33:01Z) - SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views [69.08965991211704]
ユーザ中心のワークフローにおける3Dシーンの拡大について検討する。
固定シーンにおける単純なオブジェクト編集やスタイル転送とは異なり、挿入されたビューは元の再構築と3Dミスアライメントされることが多い。
パラメトリックフィードフォワード3D再構成モデルにテスト時間適応を適用したSceneExpanderを提案する。
論文 参考訳(メタデータ) (2026-03-28T02:04:48Z) - REACT3D: Recovering Articulations for Interactive Physical 3D Scenes [96.27769519526426]
REACT3Dは静的な3Dシーンを一貫した幾何学を持つシミュレーション可能なインタラクティブなレプリカに変換するフレームワークである。
室内の様々な場面における検出・分離・調音計測における最先端性能について検討した。
論文 参考訳(メタデータ) (2025-10-13T12:37:59Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description [56.69740649781989]
3Dシーン理解は、コンピュータビジョンにおける長年の課題であり、混合現実、ウェアラブルコンピューティング、そして具体化されたAIを実現する上で重要な要素である。
室内280のシーンに高品質な手動アノテーションを付加した専門的な3DデータセットであるArticulate3Dを紹介する。
我々はまた,部分分割を同時に予測できる新しい統一フレームワークUSDNetと,オブジェクトの動作属性の完全な仕様を提示する。
論文 参考訳(メタデータ) (2024-12-02T11:33:55Z) - SceneWiz3D: Towards Text-guided 3D Scene Composition [134.71933134180782]
既存のアプローチでは、大規模なテキスト・ツー・イメージモデルを使用して3D表現を最適化するか、オブジェクト中心のデータセット上で3Dジェネレータをトレーニングする。
テキストから高忠実度3Dシーンを合成する新しい手法であるSceneWiz3Dを紹介する。
論文 参考訳(メタデータ) (2023-12-13T18:59:30Z) - CommonScenes: Generating Commonsense 3D Indoor Scenes with Scene Graph
Diffusion [83.30168660888913]
シーングラフを対応する制御可能な3Dシーンに変換する完全生成モデルであるCommonScenesを提案する。
パイプラインは2つのブランチで構成されており、1つは変分オートエンコーダでシーン全体のレイアウトを予測し、もう1つは互換性のある形状を生成する。
生成されたシーンは、入力シーングラフを編集し、拡散モデルのノイズをサンプリングすることで操作することができる。
論文 参考訳(メタデータ) (2023-05-25T17:39:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。