論文の概要: NAIMA: Semantics Aware RGB Guided Depth Super-Resolution
- arxiv url: http://arxiv.org/abs/2604.04407v1
- Date: Mon, 06 Apr 2026 04:14:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:19.087028
- Title: NAIMA: Semantics Aware RGB Guided Depth Super-Resolution
- Title(参考訳): NAIMA: セマンティクスはRGBのガイド付きスーパーリゾリューションを意識している
- Authors: Tayyab Nasir, Daochang Liu, Ajmal Mian,
- Abstract要約: ガイドド・ディープ・スーパーレゾリューション(GDSR)は、低解像度の深度マップと高解像度のRGB画像に頼って、より微細な構造を復元するマルチモーダルな深度マップ・スーパーレゾリューションのアプローチである。
本稿では,事前学習された視覚変換器トークンの埋め込みから生成される,グローバルな文脈的セマンティックプリエントを導入するソリューションを提案する。
- 参考スコア(独自算出の注目度): 50.15623093332659
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Guided depth super-resolution (GDSR) is a multi-modal approach for depth map super-resolution that relies on a low-resolution depth map and a high-resolution RGB image to restore finer structural details. However, the misleading color and texture cues indicating depth discontinuities in RGB images often lead to artifacts and blurred depth boundaries in the generated depth map. We propose a solution that introduces global contextual semantic priors, generated from pretrained vision transformer token embeddings. Our approach to distilling semantic knowledge from pretrained token embeddings is motivated by their demonstrated effectiveness in related monocular depth estimation tasks. We introduce a Guided Token Attention (GTA) module, which iteratively aligns encoded RGB spatial features with depth encodings, using cross-attention for selectively injecting global semantic context extracted from different layers of a pretrained vision transformer. Additionally, we present an architecture called Neural Attention for Implicit Multi-token Alignment (NAIMA), which integrates DINOv2 with GTA blocks for a semantics-aware GDSR. Our proposed architecture, with its ability to distill semantic knowledge, achieves significant improvements over existing methods across multiple scaling factors and datasets.
- Abstract(参考訳): ガイドド・ディープ・スーパーレゾリューション(GDSR)は、低解像度の深度マップと高解像度のRGB画像に頼って、より微細な構造を復元するマルチモーダルな深度マップ・スーパーレゾリューションのアプローチである。
しかし、RGB画像の深度不連続を示す色やテクスチャの手がかりは、しばしば、生成した深度マップ内のアーティファクトやぼやけた深度境界につながる。
本稿では,事前学習された視覚変換器トークンの埋め込みから生成される,グローバルな文脈的セマンティックプリエントを導入するソリューションを提案する。
予め学習したトークンの埋め込みから意味知識を抽出する手法は,関連する単分子深度推定タスクにおいて有効であることを示す。
予め訓練された視覚変換器の異なる層から抽出した大域的意味コンテキストを選択的に注入するクロスアテンションを用いて、符号化されたRGB空間特徴と深度符号化を反復的に整列するガイドトークン注意(GTA)モジュールを提案する。
さらに,DINOv2とGTAブロックを統合し,意味論的に認識されたGDSRを実現するアーキテクチャであるNeural Attention for Implicit Multi-token Alignment (NAIMA)を提案する。
提案アーキテクチャは,セマンティック知識を抽出する機能を備え,複数のスケーリング要因やデータセットをまたいだ既存手法に対する大幅な改善を実現している。
関連論文リスト
- DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model [43.46585348441687]
DeepSightは3次元シーン理解を強化するために設計された最初の専用深度MLLMである。
RGB画像エンコーディングをテキストと整合させる従来の手法とは異なり,本手法は深度画像の特徴を生かしている。
論文 参考訳(メタデータ) (2026-03-06T09:43:12Z) - Learning Hierarchical Color Guidance for Depth Map Super-Resolution [168.1463802622881]
深度マップ超解像(DSR)を実現する階層カラー誘導ネットワークを提案する。
一方、低レベルのディテール埋め込みモジュールは、奥行き特徴の高周波カラー情報を補うように設計されている。
一方,再建過程における意味的一貫性を維持するため,高レベルの抽象的ガイダンスモジュールが提案されている。
論文 参考訳(メタデータ) (2024-03-12T03:44:46Z) - RigNet++: Semantic Assisted Repetitive Image Guided Network for Depth
Completion [31.70022495622075]
画像案内ネットワークにおける繰り返し設計を探索し、徐々に十分に深度を復元する。
前者では,複雑な環境の識別画像の特徴を抽出するために,高密度繰り返し時間ガラスネットワーク(DRHN)を設計する。
後者では,動的畳み込みに基づく反復誘導(RG)モジュールを提案する。
さらに,領域認識型空間伝搬ネットワーク(RASPN)を提案する。
論文 参考訳(メタデータ) (2023-09-01T09:11:20Z) - Cross-modality Discrepant Interaction Network for RGB-D Salient Object
Detection [78.47767202232298]
本稿では,RGB-D SODのためのクロスモダリティ離散相互作用ネットワーク(CDINet)を提案する。
2つのコンポーネントは、効果的な相互モダリティ相互作用を実装するように設計されている。
我々のネットワークは、定量的にも質的にも15ドルの最先端の手法より優れています。
論文 参考訳(メタデータ) (2021-08-04T11:24:42Z) - BridgeNet: A Joint Learning Network of Depth Map Super-Resolution and
Monocular Depth Estimation [60.34562823470874]
本稿では,DSR(Deep Map Super- resolution)とMDE(Monocular depth Estimation)の併用学習ネットワークを提案する。
1つは特徴符号化プロセスのために設計された高周波アテンションブリッジ(HABdg)で、これはDSRタスクを誘導するMDEタスクの高周波情報を学ぶ。
もう一つは、深度マップ再構築プロセス用に設計されたコンテンツガイダンスブリッジ(CGBdg)であり、MDEタスクのためにDSRタスクから学んだコンテンツガイダンスを提供する。
論文 参考訳(メタデータ) (2021-07-27T01:28:23Z) - High-resolution Depth Maps Imaging via Attention-based Hierarchical
Multi-modal Fusion [84.24973877109181]
誘導DSRのための新しい注意に基づく階層型マルチモーダル融合ネットワークを提案する。
本手法は,再現精度,動作速度,メモリ効率の点で最先端手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-04-04T03:28:33Z) - Semantic-Guided Representation Enhancement for Self-supervised Monocular
Trained Depth Estimation [39.845944724079814]
自己教師付き深度推定は,画像列のみを入力として,高品質の深度マップを作成する上で大きな効果を示した。
しかし、その性能は通常、限界深度表現能力のために境界領域や細い構造を持つ物体を推定する際に低下する。
局所的および大域的な深度特徴表現を促進する意味誘導深度表現拡張法を提案する。
論文 参考訳(メタデータ) (2020-12-15T02:24:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。