論文の概要: HIVE-3D: Hierarchical Voxel Enhancement for High-Quality 3D Scene Generation
- arxiv url: http://arxiv.org/abs/2607.13468v1
- Date: Wed, 15 Jul 2026 05:56:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.665214
- Title: HIVE-3D: Hierarchical Voxel Enhancement for High-Quality 3D Scene Generation
- Title(参考訳): HIVE-3D:高画質3Dシーン生成のための階層型ボクセル強調
- Abstract要約: HIVE-3Dは階層型ボクセルエンハンスメントフレームワークに基づく高品質な3Dシーン生成手法である。
提案手法は従来の手法よりも優れ,最先端性能を実現している。
- 参考スコア(独自算出の注目度): 25.83082817052068
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recently, a line of works can generate impressive 3D objects from a single image, but they are limited by restricted representation resolution, making them unsuitable for 3D scene generation. In this work, we introduce HIVE-3D, a novel method for high-quality 3D scene generation based on hierarchical voxel enhancement framework. Specifically, given a single scene image as input, we first produce a coarse initial scene, then introduce image segmentation and attention-based retrieval to align 2D image components with 3D scene components. Subsequently, we organize these scene relations into a hierarchical component tree, where nodes closer to the leaves denote finer-grained components. Finally, we propose a voxel super-resolution model that generates refined voxels for the target instance while maintaining strong consistency with the coarse voxels. Equipped with this model, we perform coarse-to-fine hierarchical super-resolution on images and voxels for each component, producing a high-resolution and high-quality 3D scene. Extensive experiments demonstrate that our method significantly outperforms previous approaches, achieving state-of-the-art performance.
- Abstract(参考訳): 近年では1枚の画像から印象的な3Dオブジェクトを生成することができるが、表現解像度の制限により制限されているため、3Dシーン生成には適さない。
本稿では,階層型ボクセル拡張フレームワークに基づく高品質な3Dシーン生成手法であるHIVE-3Dを紹介する。
具体的には、1つのシーンイメージを入力として、まず粗い初期シーンを生成し、2D画像コンポーネントを3Dシーンコンポーネントに整列させるために、画像セグメント化とアテンションに基づく検索を導入する。
その後、これらのシーン関係を階層的なコンポーネントツリーに整理し、葉に近いノードはよりきめ細かいコンポーネントを表す。
最後に、粗いボクセルとの強い整合性を維持しつつ、ターゲットインスタンスに対して洗練されたボクセルを生成するボクセル超解像モデルを提案する。
このモデルを用いて、各コンポーネントのイメージとボクセルに対して粗大で微細な階層的超解像を行い、高解像度で高品質な3Dシーンを生成する。
大規模な実験により,本手法は従来の手法よりも大幅に優れ,最先端性能を実現していることが示された。
関連論文リスト
- GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction [69.35136600319714]
マルチビューRGB画像から高忠実度3Dシーンを再現する手法を提案する。
シーン再構成を条件付き3次元生成として,空間的局所化,重なり合うチャンクの集合に配置した。
切刃再建法を16%上回る高忠実度結果を得た。
論文 参考訳(メタデータ) (2026-05-22T17:49:59Z) - DecoRec: Decomposed 3D Scene Reconstruction from Single-View Images via Object-Level Diffusion [65.65756111062005]
textitDecoRecは、単一のビュー2D画像を分解された3Dシーンメッシュに高めるように設計されたシステムである。
以上の結果から,DecoRecはジオメトリと新規合成の両面において,高品質なワンビューシーン再構築を促進することが示唆された。
論文 参考訳(メタデータ) (2026-05-16T04:23:48Z) - Towards Geometric and Textural Consistency 3D Scene Generation via Single Image-guided Model Generation and Layout Optimization [14.673302810271219]
幾何学的表現と高品質なテクスチャ情報を用いた3次元シーン生成のための新しい3段階フレームワークを提案する。
提案手法は, 個々の3次元モデルの幾何学的精度とテクスチャ忠実度の観点から, 最先端の手法よりも優れているだけでなく, シーンレイアウト合成において大きな利点がある。
論文 参考訳(メタデータ) (2025-07-20T06:59:42Z) - Constructing a 3D Scene from a Single Image [31.11317559252235]
SceneFuse-3Dは、単一のトップダウンビューからコヒーレントな3Dシーンを合成するために設計されたトレーニング不要のフレームワークである。
入力画像を重なり合う領域に分解し、事前訓練された3Dオブジェクトジェネレータを用いてそれぞれを生成する。
このモジュラー設計により、3次元の監督や微調整を必要とせず、解像度のボトルネックを克服し、空間構造を維持できる。
論文 参考訳(メタデータ) (2025-05-21T17:10:47Z) - HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation [50.206100327643284]
HiSceneは、2D画像生成と3Dオブジェクト生成のギャップを埋める新しい階層的なフレームワークである。
構成構造を維持しながら2次元表現に整合した3次元コンテンツを生成する。
論文 参考訳(メタデータ) (2025-04-17T16:33:39Z) - Direct and Explicit 3D Generation from a Single Image [25.207277983430608]
マルチビュー2次元深度画像とRGB画像を用いて表面形状とテクスチャを直接生成する新しいフレームワークを提案する。
画素レベルの多視点整合性を実現するために,エピポーラの注意を潜時から画素間デコーダに組み込む。
生成した深度画素を3次元空間にバックプロジェクションすることにより、構造化された3次元表現を生成する。
論文 参考訳(メタデータ) (2024-11-17T03:14:50Z) - 3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation [51.64796781728106]
本稿では,2次元拡散モデル以前の自然画像と,現在のシーンのグローバルな3次元情報を利用して,高品質で新しいコンテンツを合成する生成的精細化ネットワークを提案する。
提案手法は,視覚的品質と3次元の整合性を改善した多種多様なシーン生成と任意のカメラトラジェクトリをサポートする。
論文 参考訳(メタデータ) (2024-03-14T14:31:22Z) - SceneWiz3D: Towards Text-guided 3D Scene Composition [134.71933134180782]
既存のアプローチでは、大規模なテキスト・ツー・イメージモデルを使用して3D表現を最適化するか、オブジェクト中心のデータセット上で3Dジェネレータをトレーニングする。
テキストから高忠実度3Dシーンを合成する新しい手法であるSceneWiz3Dを紹介する。
論文 参考訳(メタデータ) (2023-12-13T18:59:30Z) - Guide3D: Create 3D Avatars from Text and Image Guidance [55.71306021041785]
Guide3Dは拡散モデルに基づく3Dアバター生成のためのテキスト・画像誘導生成モデルである。
我々のフレームワークは、トポロジカルかつ構造的に正しい幾何と高分解能なテクスチャを生成する。
論文 参考訳(メタデータ) (2023-08-18T17:55:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。