論文の概要: GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation
- arxiv url: http://arxiv.org/abs/2608.02068v1
- Date: Mon, 03 Aug 2026 11:10:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.505642
- Title: GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation
- Title(参考訳): GIFT:非ランベルト単分子深度推定のための幾何不変ファインチューニング
- Authors: Xianghui Fan, Zhaoyu Chen, Bingqian Wu, Dayu Li, Xin Zeng, Huanran Cui, Guangzhen Xu, Xiangru Huang, Hang Yang,
- Abstract要約: パラメータ効率のよいポストトレーニングフレームワークであるGIFT(Geometry-Invariant Fine-Tuning)を提案する。
GIFTは、一般深度推定能力を保ちながら、非ランベルト深度幻覚を抑制するために幾何学的変化を利用する。
我々のベンチマークと独立した実世界のデータセットの実験は、GIFTが鏡や透明な物体の深さ予測を改善することを示した。
- 参考スコア(独自算出の注目度): 13.01134597581607
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monocular depth foundation models, benefiting from large-scale synthetic training data, have demonstrated strong generalization. However, they often hallucinate depth on non-Lambertian surfaces, estimating reflected content in mirrors or transmitted content behind glass rather than the physical surface itself. Adapting these models with real-world data is challenging because conventional depth sensors are also unreliable in such regions. We observe that while the appearance of a non-Lambertian surface varies with its reflected or transmitted environment, its underlying geometry remains unchanged. Based on this observation, we propose GIFT (Geometry-Invariant Fine-Tuning), a parameter-efficient post-training framework that requires no measured depth labels. We collect groups of RGB images under controlled appearance changes while keeping the camera and target geometry fixed. GIFT exploits geometric invariance across these observations to suppress non-Lambertian depth hallucinations while retaining general depth estimation capability. We further construct a controlled benchmark that evaluates non-Lambertian depth recovery, robustness to appearance changes, and performance retention in other regions. Experiments on our benchmark and an independent real-world dataset demonstrate that GIFT improves depth prediction for mirrors and transparent objects while largely preserving the base model's performance, providing a practical and low-cost approach for adapting monocular depth foundation models to non-Lambertian scenes.
- Abstract(参考訳): 大規模合成学習データから恩恵を受ける単分子深度基礎モデルは、強力な一般化を証明している。
しかし、彼らはしばしば非ランベルト面の奥行きを幻覚させ、鏡やガラスの裏側で反射した内容を物理面自体よりも推定する。
従来の深度センサもそのような領域では信頼性が低いため、これらのモデルに実世界のデータを適用することは困難である。
我々は、非ランベルト面の出現はその反射や伝達環境によって異なるが、その基礎となる幾何は変わっていないことを観察する。
そこで本研究では,パラメータ効率のよいポストトレーニングフレームワークであるGIFT(Geometry-Invariant Fine-Tuning)を提案する。
我々は、カメラとターゲット形状を固定しながら、制御された外観変化の下でRGB画像のグループを収集する。
GIFTはこれらの観測における幾何学的不変性を利用して、一般深度推定能力を保ちながら、非ランベルト深度幻覚を抑制する。
さらに,非ランバータディープリカバリ,外観変化に対するロバスト性,および他の領域における性能保持性を評価する制御されたベンチマークを構築した。
我々のベンチマークと独立した実世界のデータセット実験により、GIFTは鏡や透明物体の深度予測を改良し、ベースモデルの性能を保ちながら、非ランベルトのシーンに単眼深度基礎モデルを適用するための実用的で低コストなアプローチを提供する。
関連論文リスト
- ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning [66.42476564611607]
拡散モデルは、反復的妄想を通して、世界規模で滑らかな場として深度を復元できると仮定する。
本稿では,構造的自己回帰生成として深度推定を定式化するARDepthを提案する。
提案手法は高い性能を達成し,スケールにわたって構造的に一貫した深度予測を実現する。
論文 参考訳(メタデータ) (2026-07-14T07:06:46Z) - AnchorD: Metric Grounding of Monocular Depth Using Factor Graphs [16.622717763906262]
現在利用可能な深度センサーは、透明、スペクトル、一般のランベルト面の誤差を生じやすい。
本研究では,深度基礎モデルから単分子深度推定の先行値をアンカーする学習自由深度接地フレームワークを提案する。
本手法はパッチワイドアフィンアライメントを行い,実世界深度で局所的に単分子予測を行う。
論文 参考訳(メタデータ) (2026-05-04T14:48:52Z) - In Depth We Trust: Reliable Monocular Depth Supervision for Gaussian Splatting [22.674046124865196]
幾何的監督にスケールあいまいでノイズの多い奥行きを取り入れたトレーニングフレームワークを導入する。
多様なデータセットに対する実験では、幾何精度が一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-04-07T11:15:15Z) - PolGS++: Physically-Guided Polarimetric Gaussian Splatting for Fast Reflective Surface Reconstruction [76.9760302941819]
PolGS++は高速反射面再構成のための偏光ガウス散乱フレームワークである。
本稿では,アングル・オブ・ポラライゼーション(AoP)に基づくタンジェント空間の整合性制約を実現するための,奥行き誘導型可視マスク取得機構を提案する。
論文 参考訳(メタデータ) (2026-03-11T14:11:42Z) - MDE-VIO: Enhancing Visual-Inertial Odometry Using Learned Depth Priors [8.2208199207543]
本稿では,アフィン不変深度一貫性と対方向順序制約を強制する新しいフレームワークを提案する。
このアプローチは、計量スケールを頑健に回復しながら、エッジデバイスの計算限界に厳密に固執する。
論文 参考訳(メタデータ) (2026-02-11T19:53:06Z) - Underwater Monocular Metric Depth Estimation: Real-World Benchmarks and Synthetic Fine-Tuning with Vision Foundation Models [0.0]
実世界の水中データセットを用いたゼロショットおよび微調整単分子メートル法深度推定モデルのベンチマークを示す。
その結果,地上データ(実データや合成データ)に基づいて訓練した大規模モデルでは,水中での作業は不十分であることがわかった。
本研究では,水中における単分子距離深度推定の詳細な評価と可視化を行う。
論文 参考訳(メタデータ) (2025-07-02T21:06:39Z) - Neural Reflectance for Shape Recovery with Shadow Handling [88.67603644930466]
本論文は,非ランベルト的かつ空間的に変化する表面材料を用いて,シーンの形状を復元することを目的とする。
本研究では, 未知の3次元形状と未知の面点の両方をパラメータ化するために, 座標に基づく深部反射率(多層パーセプトロン)を提案する。
このネットワークは、観測された光度差と表面上の影を利用して、表面形状と一般的な非ランベルト反射率の両方を回復することができる。
論文 参考訳(メタデータ) (2022-03-24T07:57:20Z) - Virtual Normal: Enforcing Geometric Constraints for Accurate and Robust
Depth Prediction [87.08227378010874]
深度予測における高次3次元幾何学的制約の重要性を示す。
単純な幾何学的制約を強制する損失項を設計することにより、単眼深度推定の精度とロバスト性を大幅に改善する。
The-of-the-art results of learning metric depth on NYU Depth-V2 and KITTI。
論文 参考訳(メタデータ) (2021-03-07T00:08:21Z) - 3D Dense Geometry-Guided Facial Expression Synthesis by Adversarial
Learning [54.24887282693925]
本稿では,3次元密度(深度,表面正規度)情報を表現操作に用いる新しいフレームワークを提案する。
既製の最先端3D再構成モデルを用いて深度を推定し,大規模RGB-Depthデータセットを作成する。
実験により,提案手法は競争ベースラインと既存の芸術を大きなマージンで上回ることを示した。
論文 参考訳(メタデータ) (2020-09-30T17:12:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。