論文の概要: EagleDepth: Efficient Fine-Grained Depth Estimation via Pixel Diffusion Decoder
- arxiv url: http://arxiv.org/abs/2610.04554v1
- Date: Sat, 03 Oct 2026 14:44:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 18:52:50.920712
- Title: EagleDepth: Efficient Fine-Grained Depth Estimation via Pixel Diffusion Decoder
- Title(参考訳): EagleDepth: ピクセル拡散デコーダによる高効率微細粒度推定
- Abstract要約: EagleDepthは高分解能単分子深度推定のための効率的なフレームワークである。
我々のキーとなる考え方は、ピクセル空間内で最終深度マップを直接生成しながら、奥行きを意識した潜伏表現をガイダンスとして保持することである。
一般的に使われている5つの深度推定データセットと高分解能のSynth4Kデータセットにおいて、我々のフレームワークは最先端の深度推定性能を実現する。
- 参考スコア(独自算出の注目度): 12.166995971554472
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recovering detailed geometry from high-resolution images is critical for precise perception of the surroundings and objects. However, existing methods which use latent-space modeling and VAE reconstruction can compromise geometric details. Furthermore, decoding from latent codes introduces substantial inference overhead. To address those issues, we present EagleDepth, an efficient framework for high-resolution monocular depth estimation that combines the geometric priors of latent diffusion with fine-grained pixel-space generation. Our key idea is to retain depth-aware latent representations as guidance while generating the final depth map directly in pixel space. We train the latent and pixel components sequentially: first, we fine-tune a pretrained latent diffusion model using paired RGB--depth supervision; then, we adapt a pretrained pixel diffusion decoder, PiD, to predict depth conditioned on the learned features. Training of the pixel component starts at 1024 resolution and continues across multiple resolutions up to 4K. The latent branch processes resized, lower-resolution RGB images, while the pixel branch generates depth at the target resolution, bypassing the original VAE decoder. This design preserves learned geometric knowledge without requiring the latent backbone to operate at the output resolution. On five commonly used depth estimation datasets and the high-resolution Synth4K dataset, our framework achieves state-of-the-art depth estimation performance, with faster inference and better preservation of fine structures and object boundaries.
- Abstract(参考訳): 高解像度画像から詳細な幾何学を復元することは、周囲や物体の正確な認識に不可欠である。
しかし、潜在空間モデリングとVAE再構成を用いた既存の手法は、幾何学的詳細を損なう可能性がある。
さらに、遅延コードからの復号化は、かなりの推論オーバーヘッドをもたらす。
これらの問題に対処するため,高分解能単分子深度推定のための効率的なフレームワークであるEagleDepthを提案する。
我々のキーとなる考え方は、ピクセル空間内で最終深度マップを直接生成しながら、奥行きを意識した潜伏表現をガイダンスとして保持することである。
まず、ペアリングされたRGB-奥行き監視を用いて、事前学習された遅延拡散モデルを微調整し、事前訓練された画素拡散デコーダ(PiD)を適用し、学習した特徴に基づいて深度を推定する。
ピクセルコンポーネントのトレーニングは1024解像度から始まり、最大4Kまでの複数の解像度を継続する。
潜在ブランチプロセスは、解像度の低いRGBイメージを再サイズし、画素ブランチはターゲット解像度で深さを生成し、元のVAEデコーダをバイパスする。
この設計は、出力解像度で操作するために潜伏したバックボーンを必要とせずに、学習した幾何学的知識を保存する。
一般的に用いられる5つの深度推定データセットと高分解能のSynth4Kデータセットに基づいて,我々のフレームワークは,高速な推測と微細構造とオブジェクト境界の保存により,最先端の深度推定性能を実現する。
関連論文リスト
- UDPNet: Unleashing Depth-based Priors for Robust Image Dehazing [77.10640210751981]
UDPNetは、大規模で事前訓練された深度推定モデルDepthAnything V2から深度に基づく事前情報を活用する一般的なフレームワークである。
提案手法は,様々なシナリオにまたがる深度認識デハージングのための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2026-01-11T13:29:02Z) - InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields [62.49846959186119]
本稿では,神経暗黙の場として深度を表すInfiniDepthを紹介する。
連続した2次元座標で奥行きを問合えることができ、任意の解像度ときめ細かい深さの推定が可能となる。
InfiniDepthは、合成ベンチマークと実世界のベンチマークの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-06T18:57:06Z) - An End-to-End Room Geometry Constrained Depth Estimation Framework for Indoor Panorama Images [50.84536164535991]
既存の手法ではピクセルレベルの精度に重点を置いており、部屋の角が乱れ、ノイズ感度が低下する。
室内形状制約に基づく奥行き推定フレームワークを提案する。
本フレームワークには,部屋形状に基づく背景深度解決戦略と,背景分割誘導型融合機構の2つの戦略が組み込まれている。
論文 参考訳(メタデータ) (2025-10-09T05:52:48Z) - High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy [23.431898388115044]
高精細度画像から細粒度オブジェクトを抽出する作業として,DIS(High-precision Dichotomous Image segmentation)がある。
既存の方法はジレンマに直面し、非拡散法は効率的に機能するが、弱い意味論による誤検出や誤検出に悩まされる。
単眼深度推定モデルから擬似深度情報を得ると,本質的な意味理解が得られる。
論文 参考訳(メタデータ) (2025-03-08T07:02:28Z) - Learning Pixel-wise Continuous Depth Representation via Clustering for
Depth Completion [0.0]
我々はCluDeと呼ばれる新しいクラスタリングベースのフレームワークを提案し、ピクセル単位で連続的な深度表現を学習する。
CluDeはピクセル単位で連続的な深度表現を利用することで、オブジェクト境界付近の深度スミアリングをうまく低減する。
CluDeはVOIDデータセットの最先端のパフォーマンスを達成し、KITTIデータセットの分類ベースのメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-02-21T07:18:23Z) - Single Image Depth Prediction Made Better: A Multivariate Gaussian Take [163.14849753700682]
本稿では,画素ごとの深度を連続的にモデル化する手法を提案する。
提案手法の精度(MG)は,KITTI深度予測ベンチマークリーダーボードの上位に位置する。
論文 参考訳(メタデータ) (2023-03-31T16:01:03Z) - Attention Attention Everywhere: Monocular Depth Prediction with Skip
Attention [6.491470878214977]
単眼深度推定(MDE)は、1枚のRGB画像から画素幅の深さを予測することを目的としている。
コンピュータビジョン問題における注目のメリットの実証から着想を得て,注意に基づくエンコーダとデコーダの融合を提案する。
論文 参考訳(メタデータ) (2022-10-17T13:14:47Z) - PDC: Piecewise Depth Completion utilizing Superpixels [0.0]
現在のアプローチは、いくつかの既知の欠点のあるCNNベースのメソッドに依存することが多い。
深層学習なしで完全に機能する小説『Piecewise Depth Completion』(PDC)を提案する。
本評価では,提案した処理ステップがKITTIデータセットに与える影響と,本手法の全体的な性能に与える影響について述べる。
論文 参考訳(メタデータ) (2021-07-14T13:58:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。