論文の概要: VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching
- arxiv url: http://arxiv.org/abs/2605.31466v1
- Date: Fri, 29 May 2026 15:59:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.718698
- Title: VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching
- Title(参考訳): VolFill: ボリュームフローマッチングによる単視点アモーダル3次元シーン再構成
- Authors: Tuan Duc Ngo, Chuang Gan, Evangelos Kalogerakis,
- Abstract要約: 本稿では,全シーンの3次元構造を予測する生成フレームワークであるVolFillを紹介する。
提案手法は, スパース・トランカットされた未符号距離関数格子をコンパクトな潜在空間に圧縮するために, ハイブリッド3次元VOEを用いる。
- 参考スコア(独自算出の注目度): 39.72379398607968
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reconstructing the complete geometry of a scene from a single RGB image remains challenging - especially when inferring hidden structures where visual evidence is incomplete. We introduce VolFill, a generative framework that predicts the 3D structure of the complete scene rather than relying on traditional pixel-aligned regression. Our method utilizes a hybrid 3D VAE to compress sparse truncated unsigned distance function grids into a compact latent space, paired with a latent Diffusion Transformer that denoises this representation to recover the complete scene. We condition the generation on geometry foundation models, leveraging rich spatial priors for robust reasoning. Unlike existing methods limited by per-ray constraints or unstructured point-cloud queries, VolFill provides a structured representation that supports direct surface extraction and occupancy queries at scale. Extensive experiments on the SCRREAM and NRGB-D datasets demonstrate that our approach significantly outperforms current baselines, providing a robust foundation for holistic spatial understanding.
- Abstract(参考訳): 単一のRGB画像からシーンの完全な幾何学を再構築することは、特に視覚的証拠が不十分な隠れた構造を推測する場合、依然として困難である。
本稿では,従来の画素アラインレグレッションに頼るのではなく,シーン全体の3次元構造を予測する生成フレームワークであるVolFillを紹介する。
提案手法では,この表現をデノマイズして全シーンを復元する遅延拡散変換器と組み合わせて,スパース・トランカットされた符号なし距離関数格子をコンパクトな潜在空間に圧縮するために,ハイブリッド3D VAEを用いる。
我々は、ロバストな推論のために、リッチな空間的先行性を活用して、幾何学基礎モデルに基づく生成を条件とする。
線当たりの制約や非構造化のポイントクラウドクエリに制限された既存のメソッドとは異なり、VolFillは構造化された表現を提供する。
SCRREAMとNRGB-Dデータセットの大規模な実験により、我々のアプローチは現在のベースラインを著しく上回り、全体論的空間理解のための堅牢な基盤を提供することを示した。
関連論文リスト
- GeoRect4D: Geometry-Compatible Generative Rectification for Dynamic Sparse-View 3D Reconstruction [16.448484686109992]
マルチビュービデオからダイナミックな3Dシーンを再構築することは、しばしば幾何学的な崩壊、軌道のドリフト、浮き彫りのアーティファクトに繋がる、非常に不適切である。
最近の試みでは、欠落したコンテンツに幻覚を与える遺伝子前駆体を導入しているが、ナイーブな統合はしばしば構造的ドリフトと時間的不整合を引き起こす。
そこで本稿では, 疎視動的再構成のための新しい統合フレームワークであるGeoRect4Dを提案する。
論文 参考訳(メタデータ) (2026-04-22T17:12:02Z) - Fus3D: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents [10.400785196849647]
本稿では,3秒未満で非構造化画像コレクションからの高密度符号距離場(SDF)回帰のフィードフォワード法を提案する。
我々の重要な洞察は、事前訓練された多視点フィードフォワード幾何変換器の中間的特徴空間が、既に強力なジョイントワールド表現を符号化していることである。
代わりに、学習された体積抽出を通して幾何学変換器の特徴から直接3次元抽出を行う。
論文 参考訳(メタデータ) (2026-03-26T18:45:04Z) - Joint Geometry-Appearance Human Reconstruction in a Unified Latent Space via Bridge Diffusion [57.09673862519791]
本稿では,幾何学と外観のモデリングを結合潜在表現に統一する新しいフレームワークである textbfJGA-LBD を紹介する。
実験により、JGA-LBDは、幾何学的忠実度と外観品質の両方の観点から、現在の最先端アプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2026-01-01T12:48:56Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation [54.12899218104669]
3Dシーンは非常に複雑な構造を持ち、出力が密度が高く、一貫性があり、必要な全ての構造を含むことを保証する必要がある。
現在の3Dシーン生成法は、事前訓練されたテキスト・画像拡散モデルと単眼深度推定器に依存している。
クロスモーダルシーン生成のための軽量な3次元ガウススプラッティングであるBloomSceneを提案する。
論文 参考訳(メタデータ) (2025-01-15T11:33:34Z) - MonoGSDF: Exploring Monocular Geometric Cues for Gaussian Splatting-Guided Implicit Surface Reconstruction [86.87464903285208]
高品質な再構成のための神経信号距離場(SDF)とプリミティブを結合する新しい手法であるMonoGSDFを紹介する。
任意のスケールのシーンを扱うために,ロバストな一般化のためのスケーリング戦略を提案する。
実世界のデータセットの実験は、効率を保ちながら、以前の方法よりも優れています。
論文 参考訳(メタデータ) (2024-11-25T20:07:07Z) - VortSDF: 3D Modeling with Centroidal Voronoi Tesselation on Signed Distance Field [5.573454319150408]
四面体グリッド上での3次元形状特性を推定するために,明示的なSDFフィールドと浅いカラーネットワークを組み合わせた体積最適化フレームワークを提案する。
Chamfer統計による実験結果は、オブジェクト、オープンシーン、人間などの様々なシナリオにおいて、前例のない復元品質でこのアプローチを検証する。
論文 参考訳(メタデータ) (2024-07-29T09:46:39Z) - RfD-Net: Point Scene Understanding by Semantic Instance Reconstruction [19.535169371240073]
本稿では,高密度物体表面を直接点雲から検出・再構成するRfD-Netを提案する。
インスタンス再構成を大域的オブジェクトローカライゼーションと局所形状予測に分離する。
我々のアプローチは、オブジェクト再構成において、最先端の技術を一貫して上回り、メッシュIoUの11以上を改善します。
論文 参考訳(メタデータ) (2020-11-30T12:58:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。