PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
Abstractの概要
PointDiTは、単眼ジオメトリ推定を、決定論的推測や潜在拡散ではなく、密な3Dポイントマップ上の条件付きピクセル空間拡散として定式化します。このモデルは意図的にシンプルに設計されており、プレーンなVision Transformerが生のポイントマップパッチを直接処理し、凍結されたDINOv3画像トークンで条件付けされ、学習にはクリーンなポイントマップ予測によるフロー・マッチングが使用されます。本論文ではさらに、屋内と屋外のデータを統合して学習できるように、ポイントマップの正規化や空の領域に対するタスク固有の処理を導入しています。実験では、合成データのみでの学習から7つの実世界データセットへのゼロショット転移を評価し、シングルステップ、マルチステップ、およびアブレーションのバリアントを分析しています。
新規性
主な新規性は、VAEベースの潜在トークン化や従来のジオメトリシステムに共通するハイブリッドアーキテクチャを避け、ミニマリストなピクセル空間拡散Transformerを単眼ポイントマップ予測に直接適用した点にあります。さらに本研究では、3Dポイントマップの拡散においてはクリーンなデータ(x-prediction)の予測が重要であると主張し、この設定が競争力のあるワンステップ推論をサポートできることを示しています。
成果
7つの実世界評価データセットにおいて、PointDiT-Hは比較表の中で最高の深度指標(マルチステップ推論でRel_d 2.75、δ1_d 98.54)と最高の境界鮮明度BF1(10.49)を達成しましたが、ポイントマップのRel_pについてはMoGeが依然としてわずかに優れています(4.21対4.40)。ワンステップのPointDiT-Hであっても、BF1において従来手法をすでに上回っており(9.79対ベストベースライン9.41)、シングルステップ推論においてGeometryCrafterよりもはるかに高速です(72ミリ秒対1,178ミリ秒)。追加の拡散ステップは主に境界を最適化し、対照実験により、生成型の定式化が同じ条件の決定論的推測器よりもBF1を向上させることが示されています(13.92対10.90)。
論文の注目点
- PointDiTは、潜在VAEや複雑なハイブリッドジオメトリアーキテクチャに依存する代わりに、プレーンなViTを使用し、多層DINOv3特徴量で条件付けされた生の3Dポイントマップ空間で直接拡散を行う。
- この手法は主にフロー・マッチングと軽量な相対ポイント損失で学習され、アブレーション分析により、クリーンなポイントマップ予測(x-prediction)が極めて重要であり、直接的な速度予測は性能が低いことが示されている。
- 合成データのみでの学習から7つの実世界データセットへゼロショット転移でき、モデルは特に優れた幾何学的境界の品質を実現し、効率的なワンステップ推論とさらなるマルチステップの調整の両方をサポートする。