論文の概要: JEPADepth: Masked Predictive Representation Learning for Self-Supervised Monocular Depth Estimation
- arxiv url: http://arxiv.org/abs/2607.26600v1
- Date: Wed, 29 Jul 2026 08:23:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.581338
- Title: JEPADepth: Masked Predictive Representation Learning for Self-Supervised Monocular Depth Estimation
- Title(参考訳): JEPADepth: 自己監督型単眼深度推定のためのマスク付き予測表現学習
- Abstract要約: JEPADepthは、補完的なトレーニングの目的を取り入れた、自己監督型の単眼深度フレームワークである。
本稿では,DINOv3 Vision Transformerエンコーダの表現空間において,マスク付き予測損失を計算した標準光度パイプラインを拡張した。
予測器は、構造化マスキングの下の可視的コンテキスト領域埋め込みからターゲット領域埋め込みを推定し、推論時にターゲットエンコーダと共に破棄し、展開コストを加算しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-supervised monocular depth estimation typically relies on photometric reconstruction losses that couple depth, pose, and appearance assumptions. In this paper, we propose JEPADepth, a self-supervised monocular depth framework that incorporates a complementary training objective inspired by Image Joint-Embedding Predictive Architectures (I-JEPA) for self-supervised depth learning. Our method augments a standard photometric pipeline with a masked prediction loss computed in the representation space of a pretrained DINOv3 Vision Transformer encoder. A predictor infers target-region embeddings from visible context-region embeddings under structured masking, and is discarded along with the target encoder at inference time, adding no deployment cost. On KITTI, adding the JEPA objective consistently improves performance over the same DINOv3-based photometric baseline, without changing the inference-time architecture. Compared to prior monocular self-supervised methods, JEPADepth is competitive with state-of-the-art transformer-based approaches and outperforms strong CNN-based baselines on the standard benchmark. In zero-shot transfer (trained on KITTI and evaluated without fine-tuning), JEPADepth achieves the best or near-best performance among the compared methods on both Make3D and Cityscapes across multiple metrics.
- Abstract(参考訳): 自己監督された単眼深度推定は、一般的に、深さ、ポーズ、外観の仮定を合わせた光度再構成損失に依存する。
本稿では,画像統合埋め込み予測アーキテクチャ(I-JEPA)にインスパイアされた補完的学習目標を組み込んだ,自己教師型単眼深度学習フレームワークJEPADepthを提案する。
本稿では,DINOv3 Vision Transformerエンコーダの表現空間において,マスク付き予測損失を計算した標準光度パイプラインを拡張した。
予測器は、構造化マスキングの下の可視的コンテキスト領域埋め込みからターゲット領域埋め込みを推定し、推論時にターゲットエンコーダと共に破棄し、展開コストを加算しない。
KITTIでは、JEPAの目的を追加することで、推論時アーキテクチャを変更することなく、同じDINOv3ベースの測光ベースライン上でのパフォーマンスが一貫して向上する。
JEPADepthは従来のモノラルな自己管理手法と比較すると、最先端のトランスフォーマーベースのアプローチと競合し、標準ベンチマークでは強力なCNNベースのベースラインを上回っている。
ゼロショット転送(KITTIでトレーニングされ、微調整なしで評価される)では、JEPADepthは、複数のメトリクスでMake3DとCityscapesを比較したメソッドの中で、ベストまたはほぼベストのパフォーマンスを達成する。
関連論文リスト
- Large Depth Completion Model from Sparse Observations [28.01552819701954]
LDCM(Large Depth Completion Model, Large Depth Completion Model)は、スパース観測による単視点距離深度推定のための、シンプルで効果的で堅牢なフレームワークである。
LDCMは変圧器を用いて計量精度の高い密度深度マップを生成する。
論文 参考訳(メタデータ) (2026-05-28T15:50:29Z) - Learning 3D Reconstruction with Priors in Test Time [38.04707926304637]
本稿では,事前学習した画像のみのネットワークを再トレーニングしたり修正したりすることなく,3Dタスクを改善するための事前処理を組み込んだマルチビュートランスフォーマー(MVT)のテストタイムフレームワークを提案する。
提案手法は,ベースMVTよりも高いマージンで連続的に性能を向上する。
論文 参考訳(メタデータ) (2026-04-04T22:10:28Z) - Visual Autoregressive Modelling for Monocular Depth Estimation [69.01449528371916]
本稿では,視覚的自己回帰(VAR)に基づく単眼深度推定手法を提案する。
提案手法は,大規模テキスト・画像VARモデルに適応し,スケールワイド・コンディショナル・アップサンプリング機構を導入する。
本研究では,屋内ベンチマークにおける制約付きトレーニング条件下での最先端性能と,屋外データセットに適用した場合の強い性能について報告する。
論文 参考訳(メタデータ) (2025-12-27T17:08:03Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler [62.06785782635153]
ドメインをまたいだ単一の画像からメートル法3Dシーンを再構成できる新しいモデルUniDepthV2を提案する。
UniDepthV2は、追加情報なしで、入力画像から推論時にメートル法3Dポイントを直接予測する。
我々のモデルは擬似球面出力表現を利用し、カメラと深度表現をアンタングル化する。
論文 参考訳(メタデータ) (2025-02-27T14:03:15Z) - RadOcc: Learning Cross-Modality Occupancy Knowledge through Rendering
Assisted Distillation [50.35403070279804]
マルチビュー画像を用いた3次元シーンの占有状況とセマンティクスを推定することを目的とした,新たな課題である3D占有予測手法を提案する。
本稿では,RandOccを提案する。Rendering Assisted distillation paradigm for 3D Occupancy prediction。
論文 参考訳(メタデータ) (2023-12-19T03:39:56Z) - FG-Depth: Flow-Guided Unsupervised Monocular Depth Estimation [17.572459787107427]
そこで本研究では,典型的な測光損失を代替する流量蒸留損失と,不適切な画素を除去するための前向きフローベースマスクを提案する。
提案手法は,KITTIとNYU-Depth-v2の両方のデータセットの最先端結果を実現する。
論文 参考訳(メタデータ) (2023-01-20T04:02:13Z) - Multi-Frame Self-Supervised Depth with Transformers [33.00363651105475]
本稿では,コストボリューム生成のためのトランスフォーマーアーキテクチャを提案する。
深度分布型エピポーラサンプリングを用いて、マッチング候補を選択する。
私たちは、一連の自己と横断的なレイヤを通じて予測を洗練します。
論文 参考訳(メタデータ) (2022-04-15T19:04:57Z) - Depth-conditioned Dynamic Message Propagation for Monocular 3D Object
Detection [86.25022248968908]
モノラル3Dオブジェクト検出の問題を解決するために、コンテキストと奥行きを認識する特徴表現を学びます。
KITTIベンチマークデータセットにおける単眼的アプローチにおける最新の結果を示す。
論文 参考訳(メタデータ) (2021-03-30T16:20:24Z) - SynDistNet: Self-Supervised Monocular Fisheye Camera Distance Estimation
Synergized with Semantic Segmentation for Autonomous Driving [37.50089104051591]
モノクル深度推定のための最先端の自己教師型学習アプローチは、通常、スケールの曖昧さに悩まされる。
本稿では,魚眼カメラ画像とピンホールカメラ画像の自己教師付き単眼距離推定を改善するための,新しいマルチタスク学習手法を提案する。
論文 参考訳(メタデータ) (2020-08-10T10:52:47Z) - D3VO: Deep Depth, Deep Pose and Deep Uncertainty for Monocular Visual
Odometry [57.5549733585324]
D3VOは、深度、ポーズ、不確実性推定という3つのレベルでディープネットワークを利用する、単眼の視覚計測のための新しいフレームワークである。
まず,ステレオビデオを用いた自己監督型単眼深度推定ネットワークを提案する。
入力画像上の画素の光度不確かさをモデル化し、深度推定精度を向上させる。
論文 参考訳(メタデータ) (2020-03-02T17:47:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。