論文の概要: Learning Spherical Occupancy Profiles for Multi-View 3D Reconstruction and Generation
- arxiv url: http://arxiv.org/abs/2608.23206v2
- Date: Tue, 25 Aug 2026 13:43:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.245299
- Title: Learning Spherical Occupancy Profiles for Multi-View 3D Reconstruction and Generation
- Title(参考訳): 多視点3次元再構成と生成のための球面操作プロファイルの学習
- Authors: YiHsuan Tsai,
- Abstract要約: 我々は、FILM条件のプロファイルヘッドに、平均視界および光線固有の画像証拠を注入する識別用1光線デコーダを訓練する。
予測されたプロファイルの形態を解析し、複数ビューの再構成と生成先行の間のコンパクトで、学習され、不確実性を意識したインターフェースを提供することを示す。
- 参考スコア(独自算出の注目度): 25.01274737585538
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study spherical occupancy profiles-the ray-wise occupancy probability profiles P(r) = T(r) o(r) distilled from multi-view 3D Gaussian reconstructions-as a unified intermediate representation for both discriminative and generative 3D reconstruction from images. On a 999-object subset of Google Scanned Objects with 48 turntable views each, we train (i) a discriminative per-ray decoder that injects global view-averaged and ray-specific image evidence into a FiLM-conditioned profile head, reaching median soft depth error 0.035 (normalized) on an independent 90-object test split, and (ii) a generative pipeline built on a profile VAE and a latent diffusion model, which supports unconditional sampling that matches the reconstruction manifold and image-conditioned multi-solution reconstruction whose per-object solution spread is quantifiable and tunable via classifier-free guidance. We further analyze the morphology of predicted profiles: post-hoc power sharpening and a learned sharpening target both recover ground-truth profile width without degrading depth, exposing a monotonic width-peak frontier in the L1-per-ray loss family and motivating a principled redefinition of morphology gates. Real-photo validation on two DTU scenes confirms the pipeline transfers to non-synthetic input. Our results suggest that ray-wise occupancy profiles offer a compact, learned, and uncertainty-aware interface between multi-view reconstruction and generative priors.
- Abstract(参考訳): 多視点3Dガウス再構成から抽出した球面占有率プロファイルP(r) = T(r) o(r)を画像から識別・生成した3D再構成の中間表現として検討した。
Google Scanned Objectsの999オブジェクトサブセットで、それぞれ48のターンテーブルビューでトレーニングします。
一 別個の90オブジェクト試験分割において、FiLM条件のプロファイルヘッドに平均画像及び平均画像の証拠を注入し、中央値のソフト深度誤差0.035(正規化)に達する差別的一線復号器
二 プロファイルVAEと潜時拡散モデルに基づいて構築された生成パイプラインで、再構成多様体に一致する無条件サンプリングと、オブジェクトごとの溶液の拡散が定量化され、分類子フリーガイダンスにより調整可能な画像条件付きマルチソリューション再構成をサポートする。
さらに,L1線損失ファミリーにおける単調な幅ピークフロンティアを露呈し,形態ゲートの原理的再定義を動機とした,熱間後パワーシャープニングと学習目標のどちらも深度を低下させることなく,地中トルースプロファイル幅を復元する。
2つのDTUシーンにおける実写真検証は、パイプラインの非合成入力への転送を確認する。
以上の結果から, 複数視点再構成と生成先行との間には, コンパクトで, 学習し, 不確実性を意識したインターフェースが提供されることが示唆された。
関連論文リスト
- GenRec: Knowing Where to Reconstruct and Where to Generate [106.48347271421765]
GenRecは、再構築世代をそのアーキテクチャ、監督、勾配フローに直接分割するフローマッチングモデルである。
観察された領域で最高の復元忠実度を達成し、また、観測されていない領域では、知覚的品質の純粋に生成的ベースラインを超越する。
論文 参考訳(メタデータ) (2026-08-18T14:31:19Z) - Predicting 3D structure by latent posterior sampling [2.3020018305241337]
本研究では,NeRFに基づく3次元シーンの表現と,拡散モデルを用いた確率的モデリングと推論を組み合わせた手法を提案する。
提案手法は,各タスクに係わる様々な不確実性のレベルをモデル化できることを示す。
実験により, 様々な種類の観測から3次元構造を正確に予測できる包括的手法が得られた。
論文 参考訳(メタデータ) (2026-05-11T16:47:25Z) - Deep Supervised LSTM for 3D morphology estimation from Multi-View RGB Images of Wheat Spikes [0.0]
二次元RGB画像から形態特性を推定することは固有の課題を示す。
本稿では,2次元画像の体積推定のためのニューラルネットワーク手法を提案する。
本モデルでは,6次元室内画像において平均絶対パーセンテージ誤差(MAPE)が6.46%に達する。
論文 参考訳(メタデータ) (2025-06-22T15:02:18Z) - Double-Shot 3D Shape Measurement with a Dual-Branch Network for Structured Light Projection Profilometry [14.749887303860717]
我々は、異なる構造光(SL)変調を処理するために、デュアルブランチ畳み込みニューラルネットワーク(CNN)-トランスフォーマーネットワーク(PDCNet)を提案する。
PDCNet内では、Transformerブランチを使用してフリンジイメージのグローバルな認識をキャプチャし、CNNブランチはスペックルイメージのローカル詳細を収集するように設計されている。
提案手法は, 自己生成データセット上で高精度な結果が得られる一方で, フランジオーダーの曖昧さを低減できる。
論文 参考訳(メタデータ) (2024-07-19T10:49:26Z) - MVD-Fusion: Single-view 3D via Depth-consistent Multi-view Generation [54.27399121779011]
本稿では,多視点RGB-D画像の生成モデルを用いて,単視点3次元推論を行うMVD-Fusionを提案する。
提案手法は,蒸留に基づく3D推論や先行多視点生成手法など,最近の最先端技術と比較して,より正確な合成を実現することができることを示す。
論文 参考訳(メタデータ) (2024-04-04T17:59:57Z) - Towards Unified 3D Object Detection via Algorithm and Data Unification [70.27631528933482]
我々は、最初の統一型マルチモーダル3Dオブジェクト検出ベンチマークMM-Omni3Dを構築し、上記のモノクロ検出器をマルチモーダルバージョンに拡張する。
設計した単分子・多モード検出器をそれぞれUniMODEとMM-UniMODEと命名した。
論文 参考訳(メタデータ) (2024-02-28T18:59:31Z) - DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection [55.48770333927732]
本稿では,拡散型異常検出(Difusion-based Anomaly Detection, DAD)フレームワークを提案する。
画素空間オートエンコーダ、安定拡散の復調ネットワークに接続する潜在空間セマンティックガイド(SG)ネットワーク、特徴空間事前学習機能抽出器から構成される。
MVTec-ADとVisAデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-12-11T18:38:28Z) - Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction [60.52716381465063]
我々は,限られた入力画像のみを用いて,スパースビュー再構成を改善するために,Deceptive-NeRF/3DGSを導入した。
具体的には,少数視点再構成によるノイズ画像から高品質な擬似観測へ変換する,偽拡散モデルを提案する。
本システムでは,拡散生成擬似観測をトレーニング画像集合に徐々に組み込んで,スパース入力観測を5倍から10倍に高めている。
論文 参考訳(メタデータ) (2023-05-24T14:00:32Z) - PC-GANs: Progressive Compensation Generative Adversarial Networks for
Pan-sharpening [50.943080184828524]
空間情報とスペクトル情報の漸進的補償によりMS画像のシャープ化を行うパンシャーピングの新しい2段階モデルを提案する。
モデル全体が三重GANで構成されており、特定のアーキテクチャに基づいて、三重GANを同時に訓練できるように、共同補償損失関数が設計されている。
論文 参考訳(メタデータ) (2022-07-29T03:09:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。