論文の概要: Axolotl3D: a Unified Framework for Faithful 3D Shape Completion
- arxiv url: http://arxiv.org/abs/2607.20660v1
- Date: Wed, 22 Jul 2026 18:38:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.191599
- Title: Axolotl3D: a Unified Framework for Faithful 3D Shape Completion
- Title(参考訳): Axolotl3D: 忠実な3次元形状補完のための統一フレームワーク
- Abstract要約: Axolotl3Dは画像、可視性マスク、カメラパラメータ、部分点雲を条件とした3D生成モデルである。
統一的なトレーニング戦略は、大規模3Dデータから多様な条件付け規則を合成し、堅牢なクロスモーダル推論を可能にする。
Toys4KとOmniObject3Dの実験では、クリーンな設定と隠された設定の両方で最先端のパフォーマンスが実証されている。
- 参考スコア(独自算出の注目度): 1.6934548577260198
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent 3D generative models produce high-quality geometry from a single image using large-scale priors and diffusion architectures. However, they assume complete visibility and single-view inputs, limiting applicability in multi-view, occluded, or editing scenarios. Although prior works address these challenges individually, they lack a unified framework for controllable 3D completion under diverse conditioning signals. We present Axolotl3D, a multi-modal and occlusion-aware 3D generation model that jointly conditions on images, visibility masks, camera parameters, and a partial point cloud. The point cloud serves as a geometric anchor promoting faithful shape completion, while camera parameters ensure consistent multi-view alignment in a shared 3D coordinate system. A unified training strategy synthesizes diverse conditioning regimes from large-scale 3D data, enabling robust cross-modal reasoning. Experiments on Toys4K and OmniObject3D demonstrate state-of-the-art performance under both clean and occluded settings, as well as strong results in real-world reconstruction and geometry-consistent editing.
- Abstract(参考訳): 近年の3次元生成モデルは,大規模先行と拡散アーキテクチャを用いて,単一の画像から高品質な幾何を生成する。
しかし、完全な可視性とシングルビュー入力を前提としており、マルチビュー、隠蔽、編集シナリオの適用性を制限する。
以前の研究ではこれらの課題に個別に対処していたが、様々な条件信号の下で制御可能な3Dコンプリートのための統一されたフレームワークが欠如していた。
Axolotl3Dは、画像、可視性マスク、カメラパラメータ、部分点雲をジョイントな条件で生成するマルチモーダル・オクルージョン対応3D生成モデルである。
点雲は、忠実な形状の完成を促進する幾何学的アンカーとして機能し、カメラパラメータは共有3D座標系において一貫した多視点アライメントを保証する。
統一的なトレーニング戦略は、大規模3Dデータから多様な条件付け規則を合成し、堅牢なクロスモーダル推論を可能にする。
Toys4KとOmniObject3Dの実験では、クリーンな設定と隠蔽された設定の両方で最先端のパフォーマンスが実証され、実際の再構築や幾何一貫性のある編集に強い結果が得られた。
関連論文リスト
- 3DCarGen: Scalable 3D Car Generation via 3D-consistent Multi-view Synthesis [35.43901502343984]
3DCarGenは、現実世界の画像のためのスケーラブルなシングルビュー3Dカージェネレーションフレームワークである。
提案手法は,従来の手法に比べて頑健な幾何的整合性と復元忠実性を実現する。
論文 参考訳(メタデータ) (2026-06-23T07:44:14Z) - Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors [61.34273238077091]
本稿では,物体の単一画像からオービタルビデオを生成する新しい手法を提案する。
本手法は,最先端の手法と比較して,視覚的品質,形状リアリズム,多視点整合性を実現している。
論文 参考訳(メタデータ) (2026-04-14T05:35:46Z) - OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder [90.8453349494245]
本研究では,コヒーレントな3次元表現空間内で直接拡散を行うOneWorldを提案する。
OneWorldは、最先端の2Dベースの方法と比較して、クロスビューの一貫性に優れた高品質な3Dシーンを生成する。
論文 参考訳(メタデータ) (2026-03-17T03:43:37Z) - ViewMorpher3D: A 3D-aware Diffusion Framework for Multi-Camera Novel View Synthesis in Autonomous Driving [20.935790354765604]
画像拡散モデルに基づく多視点画像拡張フレームワークであるViewMorpher3Dを紹介する。
シングルビューのアプローチとは異なり、ViewMorpher3Dはカメラのポーズに条件付けされた一連のレンダリングビュー、幾何学的先行3D、時間的に隣接または空間的に重複する参照ビューを共同で処理する。
我々のフレームワークは、様々なカメラとフレキシブルな参照/ターゲットビュー構成に対応しており、多様なセンサー設定に適応できる。
論文 参考訳(メタデータ) (2026-01-12T13:44:14Z) - WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting [51.69408870574092]
汎用的な3次元幾何予測タスクのためのオールインワンフィードフォワードモデルであるWorldMirrorを提案する。
我々のフレームワークは、カメラのポーズ、内在性、深度マップなど、様々な幾何学的先入観を柔軟に統合する。
WorldMirrorは、カメラ、ポイントマップ、深さ、表面正規推定から新しいビュー合成に至るまで、さまざまなベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-12T17:59:09Z) - UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation [98.40254523605581]
UniLat3Dは、単一の潜在空間における幾何学と外観を符号化する統一されたフレームワークである。
我々の重要な貢献は、高分解能スパース特徴をコンパクトな潜在表現に圧縮する幾何学的外観統一VAEである。
UniLat3Dは、1枚の画像から数秒で高品質な3Dアセットを生成する。
論文 参考訳(メタデータ) (2025-09-29T17:21:23Z) - Constructing a 3D Scene from a Single Image [31.11317559252235]
SceneFuse-3Dは、単一のトップダウンビューからコヒーレントな3Dシーンを合成するために設計されたトレーニング不要のフレームワークである。
入力画像を重なり合う領域に分解し、事前訓練された3Dオブジェクトジェネレータを用いてそれぞれを生成する。
このモジュラー設計により、3次元の監督や微調整を必要とせず、解像度のボトルネックを克服し、空間構造を維持できる。
論文 参考訳(メタデータ) (2025-05-21T17:10:47Z) - SYM3D: Learning Symmetric Triplanes for Better 3D-Awareness of GANs [5.84660008137615]
SYM3Dは、自然と人造の物体で見られる主観対称性構造を活用するために設計された、新しい3D対応のGANである。
単視点画像のみを訓練しても, 詳細な形状やテクスチャを捉える上で, 優れた性能を示す。
論文 参考訳(メタデータ) (2024-06-10T16:24:07Z) - Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image [28.759158325097093]
Unique3Dは、シングルビュー画像から高品質な3Dメッシュを効率的に生成するための、新しい画像間3Dフレームワークである。
我々のフレームワークは、最先端世代の忠実さと強力な一般化性を備えている。
論文 参考訳(メタデータ) (2024-05-30T17:59:54Z) - LAM3D: Large Image-Point-Cloud Alignment Model for 3D Reconstruction from Single Image [64.94932577552458]
大規模再構成モデルは、単一または複数入力画像から自動3Dコンテンツ生成の領域において大きな進歩を遂げている。
彼らの成功にもかかわらず、これらのモデルはしばしば幾何学的不正確な3Dメッシュを生成し、画像データからのみ3D形状を推論する固有の課題から生まれた。
生成した3Dメッシュの忠実度を高めるために3Dポイントクラウドデータを利用する新しいフレームワークであるLarge Image and Point Cloud Alignment Model (LAM3D)を導入する。
論文 参考訳(メタデータ) (2024-05-24T15:09:12Z) - CC3D: Layout-Conditioned Generation of Compositional 3D Scenes [49.281006972028194]
本稿では,複雑な3次元シーンを2次元セマンティックなシーンレイアウトで合成する条件生成モデルであるCC3Dを紹介する。
合成3D-FRONTと実世界のKITTI-360データセットに対する評価は、我々のモデルが視覚的および幾何学的品質を改善したシーンを生成することを示す。
論文 参考訳(メタデータ) (2023-03-21T17:59:02Z) - Efficient Geometry-aware 3D Generative Adversarial Networks [50.68436093869381]
既存の3D GANは計算集約的であるか、3D一貫性のない近似を行う。
本研究では、3D GANの計算効率と画質をこれらの近似に頼らずに改善する。
本稿では,高解像度のマルチビュー一貫性画像だけでなく,高品質な3次元形状をリアルタイムに合成する,表現型ハイブリッド・明示型ネットワークアーキテクチャを提案する。
論文 参考訳(メタデータ) (2021-12-15T08:01:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。