論文の概要: MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement
- arxiv url: http://arxiv.org/abs/2607.17967v2
- Date: Tue, 21 Jul 2026 10:50:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.438176
- Title: MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement
- Title(参考訳): MoGe-3: 自己ガイド型スパースボリュームリファインメントによる細粒単分子形状の推定
- Authors: Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang,
- Abstract要約: MoGe-3は、自己ガイドスパース3Dリファインメント(SSR)を用いた細部単分子形状推定モデルである
MoGe-3はファンデーションベースモデルから粗い点マップをスパース・ボクセルシェルに上げ、SSRを介して精製する。
SSRは3次元空間的局所性に基づいて特徴を集約するスパース畳み込みを採用しており、深度不連続性を越えた特徴の混合を避ける。
- 参考スコア(独自算出の注目度): 25.087145043756355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Monocular geometry estimation has recently achieved impressive performance across diverse scenes. However, state-of-the-art models still face notable distortion in local 3D structure, especially in fine details, like thin structures and small objects. We attribute this limitation to an architectural mismatch: most current models decode 3D geometry within a 2D parameterization, where feature interactions are governed by image-plane proximity rather than true 3D spatial relationships. This inadvertently mixes features from geometrically distant surfaces, resulting in over-smoothed geometry particularly around thin or elongated structure. In this paper, we propose MoGe-3, a fine-detail monocular geometry estimation model with Self-Guided Sparse 3D Refinement (SSR) that lifts monocular geometry modeling from 2D image space to 3D space for high-fidelity metric-scale point maps. MoGe-3 lifts the coarse point map from a foundation base model onto a sparse voxel shell and refines it via SSR. The SSR employs sparse convolutions that aggregate features based on 3D spatial locality, avoiding feature mixing across depth discontinuities. Extensive experiments on diverse datasets demonstrate that MoGe-3 significantly outperforms existing approaches in recovering fine detailed 3D geometry across both quantitative metrics and qualitative visualizations. Project page: https://qft-333.github.io/moge3page/
- Abstract(参考訳): 単分子幾何推定は、最近、様々な場面で印象的なパフォーマンスを達成した。
しかし、最先端のモデルは、特に細い構造や小さな物体のような細部において、局所的な3D構造において顕著な歪みに直面している。
現行のモデルの多くは、2次元パラメータ化内で3次元幾何をデコードしており、特徴的相互作用は真の3次元空間関係ではなく、画像平面近傍によって制御されている。
この不注意に幾何学的に離れた表面の特徴が混ざり合わされ、特に細長い構造や細長い構造に過度に滑らかな幾何学が生じる。
本稿では、2次元画像空間から高忠実度距離点マップのための3次元空間へモノクロモデリングをリフトするセルフガイドスパース3Dリファインメント(SSR)を用いた細粒度モノクロ幾何推定モデルMoGe-3を提案する。
MoGe-3はファンデーションベースモデルから粗い点マップをスパース・ボクセルシェルに上げ、SSRを介して精製する。
SSRは3次元空間的局所性に基づいて特徴を集約するスパース畳み込みを採用しており、深度不連続性を越えた特徴の混合を避ける。
多様なデータセットに対する大規模な実験により、MoGe-3は、定量的メトリクスと定性的視覚化の両方にわたって詳細な3D幾何学を復元する既存のアプローチよりも大幅に優れていることが示された。
プロジェクトページ:https://qft-333.github.io/moge3page/
関連論文リスト
- DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation [1.0479639406219858]
曲面表現と幾何学的最適化をシームレスに統合する3D-to-2DマッピングフレームワークであるDiffGIを提案する。
提案手法は,従来の幾何学画像やボクセルに基づく手法と比較して,再現精度と境界精度に優れる。
論文 参考訳(メタデータ) (2026-07-15T01:00:01Z) - LineGS : 3D Line Segment Representation on 3D Gaussian Splatting [0.0]
LineGSは幾何学誘導型3次元ライン再構成と3次元ガウススプラッティングモデルを組み合わせた新しい手法である。
その結果, ベースライン法と比較して, 幾何精度とモデルコンパクト性に有意な改善が認められた。
論文 参考訳(メタデータ) (2024-11-30T13:29:36Z) - Deep Geometric Moments Promote Shape Consistency in Text-to-3D Generation [27.43973967994717]
MT3Dは高忠実度3Dオブジェクトを利用して視点バイアスを克服するテキスト・ツー・3D生成モデルである。
3Dアセットから幾何学的詳細を取り入れることで、MT3Dは多様で幾何学的に一貫したオブジェクトを作成することができる。
論文 参考訳(メタデータ) (2024-08-12T06:25:44Z) - GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation [65.33726478659304]
GeoLRM(Geometry-Aware Large Restruction Model)は、512kガウスと21の入力画像で11GBのGPUメモリで高品質な資産を予測できる手法である。
従来の作品では、3D構造の本質的な空間性は無視されており、3D画像と2D画像の間の明示的な幾何学的関係は利用されていない。
GeoLRMは、3Dポイントを直接処理し、変形可能なクロスアテンション機構を使用する新しい3D対応トランスフォーマー構造を導入することで、これらの問題に対処する。
論文 参考訳(メタデータ) (2024-06-21T17:49:31Z) - GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting [81.03553265684184]
単視点画像から詳細な3Dオブジェクトを再構成するフレームワークであるGeoGS3Dを紹介する。
本稿では,GDS(Gaussian Divergence Significance)という新しい指標を提案する。
実験により、GeoGS3Dはビュー間で高い一貫性を持つ画像を生成し、高品質な3Dオブジェクトを再構成することを示した。
論文 参考訳(メタデータ) (2024-03-15T12:24:36Z) - Learning Geometry-Guided Depth via Projective Modeling for Monocular 3D Object Detection [70.71934539556916]
射影モデルを用いて幾何学誘導深度推定を学習し, モノクル3次元物体検出を推し進める。
具体的には,モノクロ3次元物体検出ネットワークにおける2次元および3次元深度予測の投影モデルを用いた原理的幾何式を考案した。
本手法は, 適度なテスト設定において, 余分なデータを2.80%も加えることなく, 最先端単分子法の検出性能を著しく向上させる。
論文 参考訳(メタデータ) (2021-07-29T12:30:39Z) - Cylinder3D: An Effective 3D Framework for Driving-scene LiDAR Semantic
Segmentation [87.54570024320354]
大規模運転シーンのLiDARセマンティックセマンティックセグメンテーションのための最先端の手法は、しばしば2D空間の点雲を投影して処理する。
3D-to-2Dプロジェクションの問題に取り組むための簡単な解決策は、3D表現を保ち、3D空間の点を処理することである。
我々は3次元シリンダー分割と3次元シリンダー畳み込みに基づくフレームワークをCylinder3Dとして開発し,3次元トポロジの関係と運転シーンの点雲の構造を利用する。
論文 参考訳(メタデータ) (2020-08-04T13:56:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。