論文の概要: Reliability-Aware Monocular Depth Supervision for Sparse-View Neural Reconstruction
- arxiv url: http://arxiv.org/abs/2607.02554v1
- Date: Sat, 27 Jun 2026 07:39:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.317964
- Title: Reliability-Aware Monocular Depth Supervision for Sparse-View Neural Reconstruction
- Title(参考訳): スパースビューニューラルリコンストラクションのための信頼性を考慮した単眼深度シミュレーション
- Authors: Wei-Teng Chu, Yashasvini Gopalan, Changju Yuan,
- Abstract要約: 狭い前方の路面に沿ってカメラが移動する屋外運転シーンでは、スパースビューのニューラルリコンストラクションは困難である。
単分子深度推定器は、密集した幾何学的先行情報を提供することができるが、それらの予測はノイズが多く、画像領域にわたって一様に信頼性がない。
我々はDepth Anything V2をより密集した単分子深度として使用し、その予測をスケールシフトフィッティングを用いてメートル法深度に整列し、光度マスクを介して選択的に深度監視を行う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse-view neural reconstruction is challenging in outdoor driving scenes, where cameras usually move along a narrow forward-facing trajectory and provide limited multi-view overlap. Although monocular depth estimators can provide dense geometric priors, their predictions are noisy, and not uniformly reliable across image regions. In this work, we study monocular depth supervision for sparse-view neural reconstruction. We use Depth Anything V2 as a dense monocular depth prior, align its predictions to metric depth using scale-shift fitting, and apply depth supervision selectively through photometric masks generated from an RGB-only baseline model. We evaluate this strategy on two representative scene representations: Mip-NeRF-360 and Splatfacto. On KITTISeq02 under an every2 sparse-view setting, masked monocular depth supervision gives only marginal rendering gains for Mip-NeRF-360 and does not improve metric geometry. In contrast, Splatfacto benefits more clearly, improving PSNR from 14.903 to 15.932 and reducing RMSE from 0.542 to 0.100. Additional KITTISeq05 experiments and matched-ratio mask ablations further show that the gains for Splatfacto come from selecting reliable low-error regions rather than simply reducing the number of depth-supervised pixels. Additional experiments on the Bicycle scene show that depth supervision can improve geometry while hurting RGB rendering quality when multi-view coverage is already strong. Overall, our results suggest that monocular depth priors are useful for under-constrained sparse-view reconstruction, but should be applied selectively and with moderate weighting.
- Abstract(参考訳): 通常、カメラは狭い前方の軌道に沿って移動し、マルチビューのオーバーラップが制限される屋外運転シーンでは、スパースビューのニューラルリコンストラクションは困難である。
単分子深度推定器は、密集した幾何学的先行情報を提供することができるが、それらの予測はノイズが多く、画像領域にわたって一様に信頼性がない。
本研究では,スパースビュー神経再構成のための単眼深度監視法について検討した。
我々は,Depth Anything V2 をより密集した単分子深度として使用し,その予測をスケールシフトフィッティングを用いて計量深度に整列し,RGB のみのベースラインモデルから生成した測光マスクを通して選択的に深度監視を行う。
我々はこの戦略をMip-NeRF-360とSplatfactoの2つの代表的なシーン表現で評価する。
KITTISeq02 では、各2のスパースビュー設定の下で、マスク付き単分子深度監視により、Mip-NeRF-360 の辺縁レンダリングゲインしか得られず、計量幾何学は改善されない。
対照的に、SplatfactoはPSNRを14.903から15.932に改善し、RMSEを0.542から0.100に減らした。
追加のKITTISeq05実験と整合比マスクアブレーションにより、Splatfactoの利得は、単に深度管理ピクセルの数を減らすのではなく、信頼性の高い低エラー領域を選択することにあることが示された。
Bicycleのシーンでのさらなる実験では、マルチビューカバレッジがすでに強力である場合、深度監視はRGBレンダリング品質を損なうことなく、幾何を改善することができる。
以上の結果より, 単眼深度は低拘束下スパースビュー再建に有用であるが, 選択的かつ適度な重み付けで適用すべきであることが示唆された。
関連論文リスト
- In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting [22.674046124865196]
幾何的監督にスケールあいまいでノイズの多い奥行きを取り入れたトレーニングフレームワークを導入する。
多様なデータセットに対する実験では、幾何精度が一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-04-07T11:15:15Z) - MonoMVSNet: Monocular Priors Guided Multi-View Stereo Network [15.138039805633353]
我々は,新しい単分子特徴と深度誘導型MVSネットワークであるMonoMVSNetを提案する。
MonoMVSNetはモノラル基礎モデルから強力な先行情報を多視点幾何学に統合する。
実験により、MonoMVSNetはDTUとTurps-and-Templesデータセット上で最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2025-07-15T14:05:22Z) - A Simple yet Effective Test-Time Adaptation for Zero-Shot Monocular Metric Depth Estimation [46.037640130193566]
センサや低分解能LiDARなどの技術によって提供される3Dポイントや、IMUが提示したポーズによる構造移動を用いて、奥行きの予測を再現する新しい手法を提案する。
実験では, ゼロショット単角距離推定法, 微調整法と比較しての競合性, 深度補修法よりも頑健さが向上した。
論文 参考訳(メタデータ) (2024-12-18T17:50:15Z) - NeRF-Det++: Incorporating Semantic Cues and Perspective-aware Depth
Supervision for Indoor Multi-View 3D Detection [72.0098999512727]
NeRF-Detは、NeRFを用いた屋内マルチビュー3次元検出において、表現学習の強化による優れた性能を実現している。
セマンティックエンハンスメント(セマンティックエンハンスメント)、パースペクティブ・アウェア・サンプリング(パースペクティブ・アウェア・サンプリング)、および順序深度監視を含む3つのソリューションを提案する。
結果として得られたアルゴリズムであるNeRF-Det++は、ScanNetV2とAR KITScenesデータセットで魅力的なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-02-22T11:48:06Z) - Depth-Relative Self Attention for Monocular Depth Estimation [23.174459018407003]
ディープニューラルネットワークは、RGB情報から抽出されたサイズ、日陰、テクスチャなど、さまざまな視覚的ヒントに依存している。
本稿では,相対深度を自己注意のガイダンスとして用いたRelative Depth Transformer (RED-T) という新しい深度推定モデルを提案する。
提案モデルでは, 単分子深度推定ベンチマークにおいて, 競合する結果が得られ, RGB情報に偏りが小さいことを示す。
論文 参考訳(メタデータ) (2023-04-25T14:20:31Z) - SCADE: NeRFs from Space Carving with Ambiguity-Aware Depth Estimates [16.344734292989504]
SCADEは、スパースで制約のない入力ビューにおけるNeRF再構成品質を改善する新しい技術である。
本研究では,各視点に対して,深度推定の連続的マルチモーダル分布を予測する新しい手法を提案する。
実験により,本手法はスパースビューから高忠実度ノベルビューの合成を可能にすることが示された。
論文 参考訳(メタデータ) (2023-03-23T18:00:07Z) - Monocular Visual-Inertial Depth Estimation [66.71452943981558]
単眼深度推定と視覚慣性計測を統合した視覚慣性深度推定パイプラインを提案する。
提案手法は, 疎度度に対する大域的スケールとシフトアライメントを行い, 続いて学習に基づく高密度アライメントを行う。
本研究では,TartanAir と VOID のデータセットを用いて,密集したスケールアライメントによるRMSE の最大30%の削減を観測した。
論文 参考訳(メタデータ) (2023-03-21T18:47:34Z) - DARF: Depth-Aware Generalizable Neural Radiance Field [51.29437249009986]
本稿では,Depth-Aware Dynamic Smpling(DADS)戦略を用いたDARF(Depth-Aware Generalizable Neural Radiance Field)を提案する。
筆者らのフレームワークは,数枚の入力画像で,画素レベルと幾何学レベルの両方の見えないシーンを推測する。
DARFは、最先端の一般化可能なNeRF法と比較して、レンダリング品質と深さ推定を改善しつつ、サンプルを50%削減する。
論文 参考訳(メタデータ) (2022-12-05T14:00:59Z) - NVS-MonoDepth: Improving Monocular Depth Prediction with Novel View
Synthesis [74.4983052902396]
単眼深度推定を改善するために,3つの主要なステップに分割した新しいトレーニング手法を提案する。
実験により,KITTIおよびNYU-Depth-v2データセット上での最先端ないし同等の性能が得られた。
論文 参考訳(メタデータ) (2021-12-22T12:21:08Z) - Weakly-Supervised Monocular Depth Estimationwith Resolution-Mismatched
Data [73.9872931307401]
単眼深度推定ネットワークをトレーニングするための弱教師付きフレームワークを提案する。
提案フレームワークは, 共有重量単分子深度推定ネットワークと蒸留用深度再構成ネットワークから構成される。
実験結果から,本手法は教師なし・半教師付き学習ベース方式よりも優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2021-09-23T18:04:12Z) - D3VO: Deep Depth, Deep Pose and Deep Uncertainty for Monocular Visual
Odometry [57.5549733585324]
D3VOは、深度、ポーズ、不確実性推定という3つのレベルでディープネットワークを利用する、単眼の視覚計測のための新しいフレームワークである。
まず,ステレオビデオを用いた自己監督型単眼深度推定ネットワークを提案する。
入力画像上の画素の光度不確かさをモデル化し、深度推定精度を向上させる。
論文 参考訳(メタデータ) (2020-03-02T17:47:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。