論文の概要: Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors
- arxiv url: http://arxiv.org/abs/2608.04737v1
- Date: Wed, 05 Aug 2026 12:02:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.877679
- Title: Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors
- Title(参考訳): スパース直接飛行時センサからの高密度距離補完
- Authors: Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim,
- Abstract要約: 直接飛行時間(dToF)センサーは高精度な計量深度を提供する。
VR/XR、ロボット工学、そして密度の高いメートル法深度を必要とする3D知覚タスクには適していない。
スパースdToF測定による高密度距離深度化のための一般化可能なフレームワークを提案する。
- 参考スコア(独自算出の注目度): 31.4906223000791
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct Time-of-Flight (dToF) sensors provide highly accurate metric depth and are more robust than indirect ToF systems in challenging real-world conditions. However, their high manufacturing cost and limited photodiode array size produce depth maps that are extremely sparse, low-resolution, and noisy, making them unsuitable for VR/XR, robotics, and 3D perception tasks that require dense metric depth. Existing monocular and depth completion methods struggle to handle the unique sampling patterns and hardware artifacts of dToF devices, and their performance often deteriorates significantly under severe sparsity or noise. We present a generalizable framework for dense metric depth completion from sparse dToF measurements, capable of operating across diverse sensor types, sparsity levels, and noise conditions. Our model employs a depth-guided dual-branch Vision Transformer encoder that processes RGB images and sparse dToF measurements separately, while a masked joint attention module allows depth tokens to reliably guide image features without being overwritten by them. A lightweight decoder reconstructs dense metric depth efficiently, without diffusion-based or refinement-heavy post-processing. To address the scarcity of paired training data, we introduce a comprehensive dToF simulation pipeline that reproduces the characteristics of flash, sub-VGA flash, and rotating sensors, including hardware-induced degradation, irregular sparsity, and realistic noise distributions. Trained entirely on synthetic data, our model achieves strong zero-shot generalization across 6 datasets and 3 real dToF devices, outperforming state-of-the-art approaches in both accuracy and computational efficiency. This establishes a robust and practical solution for dense metric depth completion from sparse direct ToF sensors. Our code and models are open-sourced. See https://vclab.kaist.ac.kr/cvpr2026p3.
- Abstract(参考訳): ダイレクト・タイム・オブ・フライ(dToF)センサーは、高精度なメートル法深度を提供し、現実世界の状況に挑戦する際の間接的なToFシステムよりも堅牢である。
しかし、製造コストが高く、光ダイオードアレイのサイズが限られているため、非常に疎く、解像度が低く、ノイズの多い深度マップが作成され、VR/XR、ロボット工学、そして密度の深い深度を必要とする3D知覚タスクには適さない。
既存の単分子および深度補完法は、dToFデバイスのユニークなサンプリングパターンやハードウェアアーティファクトを扱うのに苦労し、その性能は、重度の間隔やノイズの下で著しく劣化することが多い。
本稿では,様々なセンサタイプ,空間レベル,騒音条件にまたがって動作可能な,疎度dToF測定による高密度距離深度化のための一般化可能なフレームワークを提案する。
我々のモデルでは、RGB画像とスパースdToF計測を別々に処理する深度誘導型デュアルブランチビジョントランスフォーマーエンコーダを採用しており、マスク付き共同注意モジュールは、画像特徴をオーバーライトすることなく確実にガイドすることができる。
軽量デコーダは拡散ベースや精細性の高い後処理をすることなく、高密度なメートル法深度を効率的に再構成する。
組合わせトレーニングデータの不足に対処するために,ハードウェアによる劣化,不規則さ,現実的な雑音分布を含むフラッシュ,サブVGAフラッシュ,回転センサの特性を再現する,総合的なdToFシミュレーションパイプラインを導入する。
完全合成データに基づくモデルでは、6つのデータセットと3つの実際のdToFデバイスにまたがる強力なゼロショットの一般化を実現し、精度と計算効率の両方において最先端のアプローチより優れている。
これにより、粗い直接ToFセンサから高密度なメートル法深度を完了するための堅牢で実用的なソリューションが確立される。
私たちのコードとモデルはオープンソースです。
https://vclab.kaist.ac.kr/cvpr2026p3を参照。
関連論文リスト
- UDPNet: Unleashing Depth-based Priors for Robust Image Dehazing [77.10640210751981]
UDPNetは、大規模で事前訓練された深度推定モデルDepthAnything V2から深度に基づく事前情報を活用する一般的なフレームワークである。
提案手法は,様々なシナリオにまたがる深度認識デハージングのための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2026-01-11T13:29:02Z) - Geometry-Aware Sparse Depth Sampling for High-Fidelity RGB-D Depth Completion in Robotic Systems [0.20999222360659608]
RGB-Dとステレオビジョンセンサーは、操作、検査、ナビゲーションを行う産業用ロボットシステムに広く使われている。
現在の深度補完法は、センサの限界と環境条件によりノイズ、不完全、あるいは偏りのある深度マップを生成する。
そこで本研究では,RGB-D点クラウド上でのPCAに基づく表面正規分布推定を利用して,画素毎の深度信頼性を算出した正規誘導型スパースサンプリング手法を提案する。
実験により、我々の幾何学的認識されたスパース深度は精度を向上し、エッジや不連続に近いアーティファクトを削減し、より現実的なトレーニング条件を生成することが示された。
論文 参考訳(メタデータ) (2025-12-09T04:14:05Z) - FreqPDE: Rethinking Positional Depth Embedding for Multi-View 3D Object Detection Transformers [91.59069344768858]
周波数対応位置深度埋め込み (FreqPDE) を導入し, 空間情報と2次元画像特徴を付加して3次元検出変換器デコーダを提案する。
FreqPDEは2D画像特徴と3D位置埋め込みを組み合わせることで、クエリデコーディングのための3D深度認識機能を生成する。
論文 参考訳(メタデータ) (2025-10-17T07:36:54Z) - DEPTHOR++: Robust Depth Enhancement from a Real-World Lightweight dToF and RGB Guidance [14.818201604060144]
DEPTHOR++は実用的で斬新な深度補完フレームワークである。
3つの重要な側面からのdToF入力に頑健さを増す。
ZJU-L5データセットと実世界のサンプルに基づいて、トレーニング戦略は既存の深度補完モデルを大幅に強化する。
論文 参考訳(メタデータ) (2025-09-30T16:41:11Z) - DGFusion: Depth-Guided Sensor Fusion for Robust Semantic Perception [57.77346327566903]
意味知覚に対する最先端のセンサー融合アプローチは、しばしば入力の空間的範囲にわたってセンサーデータを均一に扱う。
本稿では,深度情報の統合による条件認識融合を改良する,深度誘導型マルチモーダル融合法を提案する。
提案手法は,挑戦的なMUSESデータセットとDELIVERデータセット上で,最先端のパノプティクスとセマンティックセマンティックセグメンテーション性能を実現する。
論文 参考訳(メタデータ) (2025-09-11T20:03:00Z) - Self-Supervised Enhancement for Depth from a Lightweight ToF Sensor with Monocular Images [7.317782580649895]
本稿では,自己教師型学習フレームワークであるSelfToFを提案する。
提案手法は,NYUおよびScanNetデータセットの広範な実験により検証され,効率的かつ効果的である。
論文 参考訳(メタデータ) (2025-06-16T12:57:58Z) - Multi-Modal Neural Radiance Field for Monocular Dense SLAM with a
Light-Weight ToF Sensor [58.305341034419136]
単眼カメラと軽量ToFセンサを備えた初の高密度SLAMシステムを提案する。
本稿では,RGBカメラと軽量ToFセンサの両方の信号のレンダリングをサポートするマルチモーダル暗黙のシーン表現を提案する。
実験により,本システムは軽量なToFセンサの信号をうまく利用し,競合的な結果が得られることが示された。
論文 参考訳(メタデータ) (2023-08-28T07:56:13Z) - Consistent Direct Time-of-Flight Video Depth Super-Resolution [9.173767380836852]
飛行時間(dToF)センサーは、次世代のオンデバイス3Dセンシングを約束している。
低分解能dToFイメージングによる空間的曖昧性を緩和する最初の多フレーム融合方式を提案する。
動的オブジェクトと現実的なdToFシミュレータを備えた,最初の合成RGB-dToFビデオデータセットであるDyDToFを紹介する。
論文 参考訳(メタデータ) (2022-11-16T04:16:20Z) - DELTAR: Depth Estimation from a Light-weight ToF Sensor and RGB Image [39.389538555506256]
我々は,高分解能かつ高精度な深度測定機能を備えた軽量ToFセンサを実現する新しい手法であるDELTARを提案する。
DELTARの中核として、深度分布用にカスタマイズされた特徴抽出器と注意に基づくニューラルアーキテクチャを提案し、色とToF領域からの情報を効率的に融合させる。
実験により,提案手法は深度分解能と深度超解像のために設計された既存のフレームワークよりも精度が高く,コモディティレベルのRGB-Dセンサで同等の性能が得られることが示された。
論文 参考訳(メタデータ) (2022-09-27T13:11:37Z) - Joint Learning of Salient Object Detection, Depth Estimation and Contour
Extraction [91.43066633305662]
RGB-D Salient Object Detection (SOD) のための新しいマルチタスク・マルチモーダルフィルタトランス (MMFT) ネットワークを提案する。
具体的には、深度推定、健全な物体検出、輪郭推定の3つの相補的なタスクを統合する。マルチタスク機構は、タスク認識の特徴を補助タスクから学習するためのモデルを促進する。
実験の結果、複数のデータセット上での深度に基づくRGB-D SOD法をはるかに上回るだけでなく、高品質の深度マップと塩分濃度を同時に正確に予測できることがわかった。
論文 参考訳(メタデータ) (2022-03-09T17:20:18Z) - A Single Stream Network for Robust and Real-time RGB-D Salient Object
Detection [89.88222217065858]
我々は、深度マップを用いて、RGBと深度の間の早期融合と中核融合を誘導する単一ストリームネットワークを設計する。
このモデルは、現在の最も軽量なモデルよりも55.5%軽く、32 FPSのリアルタイム速度で384倍の384ドルの画像を処理している。
論文 参考訳(メタデータ) (2020-07-14T04:40:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。