論文の概要: ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
- arxiv url: http://arxiv.org/abs/2607.08771v1
- Date: Thu, 09 Jul 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.632559
- Title: ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device
- Title(参考訳): ZipDepth:あらゆるデバイスに軽量のゼロショット単眼深度を提供する
- Abstract要約: ZipDepthは、単一ドメインと自己管理パラダイムと軽量な代替品とのギャップを埋める、コンパクトな単分子深度ネットワークである。
ZipDepthは、サーバGPUから電力制約のあるデバイスまで、リアルタイムで動作し、ゼロショット精度とデプロイメント効率の最良のトレードオフを達成する。
- 参考スコア(独自算出の注目度): 51.39111895181487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monocular depth estimation has seen remarkable progress through foundation models achieving robust zero-shot generalization, yet their computational demands place them far beyond the reach of embedded and mobile platforms. Lightweight alternatives exist, but have been developed almost exclusively within single-domain, self-supervised paradigms, failing silently under domain shift. We present ZipDepth, a compact monocular depth network that bridges this gap by combining an efficient reparameterizable encoder-decoder with large-scale knowledge distillation from a foundation model over a large multi-domain training set. Comprising just 6.1M parameters, ZipDepth runs at real-time rates from server GPUs to power-constrained devices, achieving the best trade-off between zero-shot accuracy and deployment efficiency among lightweight models across five benchmarks, taking a significant step towards the accuracy of foundation models with 50x more parameters.
- Abstract(参考訳): 単眼深度推定は、堅牢なゼロショットの一般化を実現する基礎モデルを通じて顕著な進歩を遂げてきたが、その計算要求は組み込みプラットフォームやモバイルプラットフォームのリーチをはるかに超えている。
軽量な代替手段は存在するが、ほとんどは単一ドメインの自己管理パラダイム内で開発され、ドメインシフトの下で静かに失敗している。
本稿では,このギャップを埋めるコンパクトな単分子深度ネットワークZipDepthについて,大規模なマルチドメイントレーニングセット上の基礎モデルからの大規模知識蒸留と,効率的な再パラメータ化可能なエンコーダデコーダを組み合わせることで紹介する。
ZipDepthはわずか6.10Mのパラメータで、サーバGPUから電力制約のあるデバイスまでリアルタイムで動作し、5つのベンチマークにわたる軽量モデル間のゼロショット精度とデプロイメント効率の最良のトレードオフを達成し、50倍のパラメータを持つ基礎モデルの正確性に向けて大きな一歩を踏み出した。
関連論文リスト
- MolmoAct2: Action Reasoning Models for Real-world Deployment [67.6315757474802]
MolmoAct2は、実用的なデプロイメントのために構築された、完全にオープンなアクション推論モデルである。
空間的および具体的推論に特化した VLM バックボーンである MolmoER を紹介する。
低コストプラットフォームにまたがる3つの新しいデータセットをリリースする。
論文 参考訳(メタデータ) (2026-05-04T17:51:21Z) - $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design [72.55935017828891]
我々は Le-DETR (textbfLow- Cost and textbfEfficient textbfDEtection textbfTRansformer) を提案する。
ImageNet1KとCOCO 2017トレーニングデータセットのみを使用して、リアルタイム検出で新しいtextbfSOTAを実現する。
YOLOv12-L/X を textbf+0.6/-0.1 mAP で上回り、同様の速度と textbf+20% のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-02-24T15:29:55Z) - PointODE: Lightweight Point Cloud Learning with Neural Ordinary Differential Equations on Edge [0.8403582577557918]
本稿では,残差接続を持つブロックの連続的スタックに基づいて,ポイントクラウド特徴抽出のためのパラメータ効率のよいアーキテクチャを提案する。
PointODEは、合成データセットと実世界のデータセットの両方の最先端モデルと競合する精度を示す。
論文 参考訳(メタデータ) (2025-05-31T07:34:54Z) - Lightweight Deep Learning Framework for Accurate Particle Flow Energy Reconstruction [8.598010350935596]
本稿では,ディープラーニング再構築の枠組みを体系的に評価する。
重み付き平均2乗と誤差構造類似度指数を組み合わせたハイブリッド損失関数を設計する。
我々は,モーダル時間的相関とエネルギー変位非線形性を捉えるモデルの能力を強化する。
論文 参考訳(メタデータ) (2024-10-08T11:49:18Z) - Fast Ensembling with Diffusion Schrödinger Bridge [17.334437293164566]
ディープ・アンサンブル(Deep Ensemble、DE)アプローチは、様々な初期点からニューラルネットワークを訓練し、様々な局所最適点に向かって収束させることにより、ディープ・ニューラルネットワークの性能を高めるための簡単な手法である。
本稿では,Diffusion Bridge Network (DBN) と呼ばれる新しい手法を提案する。
この軽量ニューラルネットワークDBNで重アンサンブルを置換することにより、CIFAR-10、CIFAR-100、TinyImageNetなどのベンチマークデータセットの精度と不確実性を維持しながら、計算コストを削減した推論を実現した。
論文 参考訳(メタデータ) (2024-04-24T11:35:02Z) - Parameter-efficient Tuning of Large-scale Multimodal Foundation Model [68.24510810095802]
我々はこれらの課題を克服するために、クロスモーダル転送(Aurora)のための優雅なプロンプトフレームワークを提案する。
既存のアーキテクチャの冗長性を考慮すると、まずモード近似を用いて0.1Mのトレーニング可能なパラメータを生成し、マルチモーダルプロンプトチューニングを実装する。
6つのクロスモーダルベンチマークの徹底的な評価は、最先端のベンチマークを上回るだけでなく、完全な微調整アプローチよりも優れていることを示している。
論文 参考訳(メタデータ) (2023-05-15T06:40:56Z) - Rethinking Lightweight Salient Object Detection via Network Depth-Width
Tradeoff [26.566339984225756]
既存の有能なオブジェクト検出手法では、より深いネットワークが採用され、性能が向上する。
本稿では,U字形構造を3つの相補枝に分解することで,新しい3方向デコーダフレームワークを提案する。
提案手法は,5つのベンチマークにおいて効率と精度のバランスが良くなることを示す。
論文 参考訳(メタデータ) (2023-01-17T03:43:25Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。