論文の概要: DepthART: Scaling Foundation Monocular Depth to Tiny Models
- arxiv url: http://arxiv.org/abs/2607.17099v1
- Date: Sun, 19 Jul 2026 06:54:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.356838
- Title: DepthART: Scaling Foundation Monocular Depth to Tiny Models
- Title(参考訳): DepthART: ファウンデーションのモノクルの深さをTinyモデルにスケーリングする
- Authors: Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe,
- Abstract要約: DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
- 参考スコア(独自算出の注目度): 51.10174763031444
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent geometric foundation models (e.g., Metric3D, Depth Anything and UniDepth) have substantially improved monocular depth estimation (MDE) in both cross-scene generalization and metric-scale prediction, yet these gains have not translated to tiny models. We bridge this gap with DepthART (Depth Anything Rethought for Tiny Models), which is a compact MDE model for on-device deployment across diverse scenes. We first identify two capacity-driven bottlenecks in tiny models: (i) overfitting to dataset-specific distribution bias and (ii) unstable metric adaptation under camera shift, where full fine-tuning easily damages transferable geometry. Accordingly, DepthART combines two simple but effective strategies: a bias-resistant data sampling scheme to reduce distribution bias under the same training budget, and a camera-conditioned fine-tuning protocol that freezes the distilled encoder and adjusts metric scale conditioned on intrinsics while better preserving cross-dataset generalization. Across datasets, DepthART consistently surpasses previous tiny baselines in both zero-shot generalization and metric accuracy (e.g., zero-shot $δ_1$=0.964 for DepthART-S on NYUD v2), and in some cases approaches heavy models. We further provide a scalable model family, with DepthART-S reaching 347/245 FPS (strict FP32) on an RTX A6000 at $224^2/448^2$, 102 FPS (TF32) on a Orin NX 8GB, and over 15 FPS (FP32) on a Jetson Nano 4GB.
- Abstract(参考訳): 最近の幾何学的基礎モデル(例:Metric3D、Depth Anything、UniDepth)は、クロスシーンの一般化とメートル法スケールの予測の両方において、単分子深度推定(MDE)を大幅に改善しているが、これらは小さなモデルに変換されていない。
私たちはこのギャップをDepthART (Depth Anything Rethinkt for Tiny Models)で埋めています。
私たちはまず、小さなモデルで2つのキャパシティ駆動ボトルネックを特定します。
一 データセット固有の分布バイアスに過度に適合すること
(II) カメラシフト下での不安定なメートル法適応では、フル微調整は転送可能な幾何に容易にダメージを与える。
したがって、DepthARTは、同じトレーニング予算下で分布バイアスを削減するバイアス耐性データサンプリングスキームと、蒸留エンコーダを凍結し、内在的に条件付けられたメトリックスケールを調整し、クロスデータセットの一般化をよりよく保存するカメラ条件の微調整プロトコルの2つの単純な方法を組み合わせた。
データセット全体にわたって、DepthARTはゼロショットの一般化とメートル法精度(例えば、NYUD v2のDepthART-Sではゼロショット$δ_1$=0.964)の両方において、それまでの小さなベースラインを一貫して上回り、場合によってはヘビーモデルにアプローチする。
RTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで224^2/448^2$、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達する。
関連論文リスト
- UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler [62.06785782635153]
ドメインをまたいだ単一の画像からメートル法3Dシーンを再構成できる新しいモデルUniDepthV2を提案する。
UniDepthV2は、追加情報なしで、入力画像から推論時にメートル法3Dポイントを直接予測する。
我々のモデルは擬似球面出力表現を利用し、カメラと深度表現をアンタングル化する。
論文 参考訳(メタデータ) (2025-02-27T14:03:15Z) - Enhanced Encoder-Decoder Architecture for Accurate Monocular Depth Estimation [0.0]
本稿では,拡張エンコーダデコーダアーキテクチャを用いた新しい深層学習手法を提案する。
マルチスケールの特徴抽出を取り入れ、様々な物体の大きさと距離の深さ予測精度を高める。
KITTIデータセットによる実験結果から,本モデルでは0.019秒でかなり高速な推定時間を達成できた。
論文 参考訳(メタデータ) (2024-10-15T13:46:19Z) - Metric3Dv2: A Versatile Monocular Geometric Foundation Model for Zero-shot Metric Depth and Surface Normal Estimation [74.28509379811084]
Metric3D v2は、ゼロショット距離深さと1枚の画像からの表面正規推定のための幾何学的基礎モデルである。
距離深度推定と表面正規度推定の両方の解を提案する。
本手法は, ランダムに収集したインターネット画像上での計測3次元構造の正確な復元を可能にする。
論文 参考訳(メタデータ) (2024-03-22T02:30:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。