論文の概要: Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
- arxiv url: http://arxiv.org/abs/2609.08084v1
- Date: Tue, 08 Sep 2026 00:52:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.541124
- Title: Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
- Title(参考訳): Marigold V2:単眼深度推定のための拡散変換器の再検討
- Authors: Igor Pavlovic, Thiemo Wandel, Anton Obukhov, Luca Bartolomei, Andrey Davydov, Fabio Tosi, Matteo Poggi, Sabine Süsstrunk, Dengxin Dai,
- Abstract要約: 最新の画像生成および編集モデルを再開発する一連の手法であるMarigoldを、最先端の単眼深度推定器に再検討する。
我々のレシピは、事前訓練されたマルチステップフローマッチングモデルから単一ステップの推論を目標とし、必要に応じて量子化を行い、安価な実行環境を維持しながらモデルキャパシティを保存する。
その結果,AbsRel は KITTI や ETH3D よりも16~26% 向上した。
- 参考スコア(独自算出の注目度): 68.73567966621631
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Monocular depth estimation is a ubiquitous yet highly ill-posed computer vision task, with downstream applications in scene reconstruction, computational photography, and robotics, among others. Despite the field's maturity, recent models still struggle to generalize to out-of-distribution inputs and to produce sharp and detailed depth maps. In this paper, we revisit Marigold, a set of techniques for repurposing modern image generation and editing models, powered by the diffusion transformer (DiT) architecture, into state-of-the-art monocular depth estimators. Our recipes target single-step inference from pretrained multi-step flow-matching models, with quantization where needed, preserving model capacity while remaining cheap to run. We analyze the artifacts of naive training and identify two effective remedies: aligning the model's internal representations with semantic features extracted from ground-truth, and adopting a 2-stage fine-tuning protocol built around a novel Sinkhorn-based loss. The results are crisper, cleaner depth maps that generalize well out-of-distribution, with 16-26% improvement in AbsRel over the previous best on KITTI and ETH3D. Qualitatively, our model resolves fur, foliage, and hair-thin edges that have eluded prior models. Furthermore, Marigold V2 achieves state-of-the-art results when applied to other dense regression tasks, such as surface normals estimation and intrinsic image decomposition. Project website: https://hf.co/spaces/huawei-bayerlab/marigold-v2-web
- Abstract(参考訳): 単眼深度推定は、シーン再構成、計算写真、ロボット工学など、ユビキタスだが非常に不適切なコンピュータビジョンタスクである。
この分野の成熟にもかかわらず、近年のモデルは、分布外入力への一般化と、鋭く詳細な深度マップの作成に苦慮している。
本稿では,拡散変圧器(DiT)アーキテクチャを応用した最新の画像生成・編集モデルを,最先端のモノクロ深度推定器に再構成する手法であるMarigoldを再検討する。
我々のレシピは、事前訓練されたマルチステップフローマッチングモデルから単一ステップの推論を目標とし、必要に応じて量子化を行い、安価な実行環境を維持しながらモデルキャパシティを保存する。
そこで,本研究では, モデルの内部表現と, 地下構造から抽出した意味的特徴の整合性, シンクホーンに基づく新たな損失を伴って構築された2段階の微調整プロトコルの適用という2つの効果的な対策を, ナイーブトレーニングの成果物として分析し, 効果的に評価する。
その結果,AbsRel は KITTI や ETH3D よりも16~26% 向上した。
定性的には、われわれのモデルは、以前のモデルから脱落した毛皮、葉、毛の細い縁を解消する。
さらに、Marigold V2は、表面正規化推定や本質的な画像分解など、他の高次回帰タスクに適用した場合、最先端の結果を得る。
プロジェクトウェブサイト:https://hf.co/spaces/huawei-bayerlab/marigold-v2-web
関連論文リスト
- Re-Depth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting [14.53203375098443]
テスト時のセルフスーパービジョンフレームワークであるRe-Depth Anythingを紹介します。
DA-V2を大規模2次元拡散モデルの強力な先行モデルと融合する。
本手法は,入力画像に直接ラベルのない精錬を行う。
論文 参考訳(メタデータ) (2025-12-19T18:59:56Z) - From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z) - Exploring Diffusion Transformer Designs via Grafting [82.91123758506876]
計算予算の少ない新しいアーキテクチャを実現するために,事前に訓練された拡散変換器(DiT)を編集する簡単な手法であるグラフト方式を提案する。
演算子置換からアーキテクチャ再構成に至るまで,事前訓練したDiTをグラフトすることで,新しい拡散モデルの設計を探索できることが示されている。
論文 参考訳(メタデータ) (2025-06-05T17:59:40Z) - RI3D: Few-Shot Gaussian Splatting With Repair and Inpainting Diffusion Priors [13.883695200241524]
RI3Dは拡散モデルのパワーを生かした新しい手法であり、入力画像のスパースセットが与えられた場合、高品質な新規ビューを再構築する。
我々の重要な貢献は、ビュー合成プロセスを可視領域を再構築し、行方不明領域を幻覚させる2つのタスクに分けることである。
我々は、様々な場面において最先端のアプローチよりも優れた、目に見える領域と欠落する領域の両方で、詳細なテクスチャで結果を生成する。
論文 参考訳(メタデータ) (2025-03-13T20:16:58Z) - DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features [65.8738034806085]
DistillNeRFは、自動運転シーンにおける3D環境を理解するための自己教師型学習フレームワークである。
本手法は,スパースで単一フレームのマルチビューカメラ入力からリッチなニューラルシーン表現を予測する一般化可能なフィードフォワードモデルである。
論文 参考訳(メタデータ) (2024-06-17T21:15:13Z) - Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation [20.230238670888454]
本稿では,アフィン不変な単分子深度推定法であるMarigoldを紹介する。
合成トレーニングデータのみを使用して、単一のGPU上で数日で微調整できる。
特定のケースで20%以上のパフォーマンス向上を含む、幅広いデータセットで最先端のパフォーマンスを提供する。
論文 参考訳(メタデータ) (2023-12-04T18:59:13Z) - Bayesian Image Reconstruction using Deep Generative Models [7.012708932320081]
本研究では,最先端(sota)生成モデルを用いて強力な画像先行モデルを構築する。
BRGM (Bayesian Reconstruction through Generative Models) と呼ばれる本手法では,1つの事前学習されたジェネレータモデルを用いて,異なる画像復元タスクを解く。
論文 参考訳(メタデータ) (2020-12-08T17:11:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。