論文の概要: PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
- arxiv url: http://arxiv.org/abs/2607.02515v1
- Date: Thu, 02 Jul 2026 17:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.966674
- Title: PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
- Title(参考訳): PointDiT:単眼形状推定のための画素空間拡散
- Authors: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer,
- Abstract要約: 最先端のシングルイメージの3D再構成手法は複雑なハイブリッドアーキテクチャと損失関数に依存していることが多い。
このようなアーキテクチャ上のオーバーヘッドと複雑な損失の定式化は不要であることを示す。
我々は,平易なViT上に構築された最小限の画素空間拡散変換器を導入し,生の3Dポイントマップパッチを直接操作する。
- 参考スコア(独自算出の注目度): 105.86385617182879
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State-of-the-art single-image 3D reconstruction methods often rely on complex hybrid architectures and loss functions, or compress geometry into latent spaces in order to leverage pre-trained latent diffusion models. In this work, we show that such architectural overhead and intricate loss formulations are unnecessary. We introduce a minimalist pixel-space Diffusion Transformer, built on a plain ViT, that operates directly on raw 3D point map patches and is conditioned on image tokens from a pre-trained DINOv3. Unlike existing latent diffusion approaches, we train our diffusion backbone entirely from scratch, eliminating the need for point map tokenizers. Despite its simplicity, our approach surpasses complex latent-based diffusion models while remaining significantly simpler than hybrid alternatives. Notably, it produces sharper geometric structure and is more robust in highly ambiguous regions, such as transparent objects.
- Abstract(参考訳): 最先端の単一イメージの3D再構成手法は、複雑なハイブリッドアーキテクチャや損失関数に依存したり、事前訓練された潜伏拡散モデルを活用するために潜伏空間に幾何学を圧縮することが多い。
本研究では,このようなアーキテクチャ上のオーバーヘッドや複雑な損失の定式化は不要であることを示す。
我々は,平板の ViT 上に構築された最小限の画素空間拡散変換器を導入し,生の 3D 点マップパッチを直接操作し,事前学習した DINOv3 の画像トークンに条件付けする。
既存の潜伏拡散アプローチとは異なり、拡散バックボーンを完全にスクラッチからトレーニングし、ポイントマップトークン化器の必要性を排除します。
その単純さにもかかわらず、我々のアプローチは複雑な潜伏拡散モデルを超えながら、ハイブリッドな代替モデルよりもはるかに単純である。
特に、よりシャープな幾何学構造を生み出し、透明な物体のような非常にあいまいな領域ではより堅牢である。
関連論文リスト
- VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching [39.72379398607968]
本稿では,全シーンの3次元構造を予測する生成フレームワークであるVolFillを紹介する。
提案手法は, スパース・トランカットされた未符号距離関数格子をコンパクトな潜在空間に圧縮するために, ハイブリッド3次元VOEを用いる。
論文 参考訳(メタデータ) (2026-05-29T15:59:20Z) - Joint Geometry-Appearance Human Reconstruction in a Unified Latent Space via Bridge Diffusion [57.09673862519791]
本稿では,幾何学と外観のモデリングを結合潜在表現に統一する新しいフレームワークである textbfJGA-LBD を紹介する。
実験により、JGA-LBDは、幾何学的忠実度と外観品質の両方の観点から、現在の最先端アプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2026-01-01T12:48:56Z) - DoubleDiffusion: Combining Heat Diffusion with Denoising Diffusion for Texture Generation on 3D Meshes [67.39455433337316]
本稿では,3次元メッシュ上でテクスチャを直接生成する手法を提案する。
この手法を生成拡散パイプラインに統合することにより,テクスチャ生成の効率を大幅に向上する。
論文 参考訳(メタデータ) (2025-01-06T21:34:52Z) - FlexiDreamer: Single Image-to-3D Generation with FlexiCubes [20.871847154995688]
FlexiDreamerは、マルチビュー生成イメージから高品質なメッシュを直接再構築する新しいフレームワークである。
提案手法では,1つの画像から3次元の下流タスクにおいて,約1分で高忠実度3Dメッシュを生成することができる。
論文 参考訳(メタデータ) (2024-04-01T08:20:18Z) - Binary Opacity Grids: Capturing Fine Geometric Detail for Mesh-Based
View Synthesis [70.40950409274312]
我々は、細い構造を再構築する能力を損なうことなく、表面への収束を促すために密度場を変更する。
また, メッシュの単純化と外観モデルの適合により, 融合型メッシュ方式を開発した。
私たちのモデルで生成されたコンパクトメッシュは、モバイルデバイス上でリアルタイムでレンダリングできます。
論文 参考訳(メタデータ) (2024-02-19T18:59:41Z) - $PC^2$: Projection-Conditioned Point Cloud Diffusion for Single-Image 3D
Reconstruction [97.06927852165464]
単一のRGB画像から物体の3次元形状を再構築することは、コンピュータビジョンにおける長年の課題である。
条件付き偏光拡散プロセスによりスパース点雲を生成する単一像3次元再構成法を提案する。
論文 参考訳(メタデータ) (2023-02-21T13:37:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。