論文の概要: Depth-Dominant Skeleton Detection for Natural Scenes
- arxiv url: http://arxiv.org/abs/2608.16367v1
- Date: Mon, 17 Aug 2026 10:17:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.632504
- Title: Depth-Dominant Skeleton Detection for Natural Scenes
- Title(参考訳): 自然シーンにおける深度優位な骨格検出
- Abstract要約: 深度画像は本質的に色やテクスチャに敏感であり、鮮明な地域輪郭や地域間関係を提供することができる。
そこで本研究では,深度画像が支配的モダリティとして機能し,RGB画像が空間補助として機能する新しい骨格検出パラダイムを提案する。
- 参考スコア(独自算出の注目度): 14.451705133115624
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: To date, all natural scene skeleton detection follows the paradigm of taking RGB images as the sole input; despite notable progress, methods under this paradigm suffer significant performance degradation on complex-content images. We observe that depth images are inherently insensitive to color and texture, and can provide clear regional contours and inter-region spatial relationships, which naturally alleviates the difficulty of skeleton detection in complex scenarios. Motivated by this observation, this paper proposes for the first time a novel skeleton detection paradigm where depth images serve as the dominant modality and RGB images act as the auxiliary, and accordingly presents a model DDSkel (short for Depth-Dominant Skeleton Detection) under this paradigm. DDSkel employs an asymmetric encoder design to fuse RGB information into depth features, with the RGB modality branch having only 12% the parameters of the depth modality branch. DDSkel has a simple structure without intricate designs. Nevertheless, with only 36% of the trainable parameters of the current best method, DDSkel outperforms all state-of-the-art approaches on SymPASCAL, the most challenging dataset with a large volume of complex images.
- Abstract(参考訳): これまでは、RGBイメージを唯一の入力として扱うというパラダイムに従って、すべての自然なシーンスケルトン検出が行われてきた。
深度画像は本質的に色やテクスチャに敏感であり、複雑なシナリオにおける骨格検出の難しさを自然に軽減し、鮮明な地域輪郭と地域間空間関係を提供することができる。
本研究は, 深度画像が支配的モダリティとして機能し, RGB画像が補助的役割を果たす新しい骨格検出パラダイムを初めて提案し, 本パラダイムに基づいてDDSkel(depth-Dominant Skeleton Detection)モデルを提案する。
DDSkelは、RGB情報を深度特徴に融合させる非対称エンコーダ設計を採用しており、RGBモダリティ分岐は深さモダリティ分岐のパラメータの12%しか持たない。
DDSkelは複雑な設計をせずに単純な構造を持つ。
しかし、現在のベストメソッドのトレーニング可能なパラメータの36%しかなく、DDSkelは複雑な画像の量の多い最も困難なデータセットであるSymPASCALにおいて、最先端のアプローチをすべて上回っている。
関連論文リスト
- Depth-to-Image Synthesis-Driven Generative Unguided Depth Completion [10.33984444207182]
GUDC(Depth-to-Image Synthesis-Driven Generative Unguided Depth Completion)を提案する。
キーとなるアイデアは、コントロールネットの強力な深度条件生成機能を利用して、スパース深度から直接擬似イメージを合成することです。
本研究では,擬似画像から情報的意味的手がかりを適応的に抽出する擬似画像意味的注意融合モジュールを提案する。
論文 参考訳(メタデータ) (2026-09-05T10:20:22Z) - NAIMA: Semantics Aware RGB Guided Depth Super-Resolution [50.15623093332659]
ガイドド・ディープ・スーパーレゾリューション(GDSR)は、低解像度の深度マップと高解像度のRGB画像に頼って、より微細な構造を復元するマルチモーダルな深度マップ・スーパーレゾリューションのアプローチである。
本稿では,事前学習された視覚変換器トークンの埋め込みから生成される,グローバルな文脈的セマンティックプリエントを導入するソリューションを提案する。
論文 参考訳(メタデータ) (2026-04-06T04:14:59Z) - StarryGazer: Leveraging Monocular Depth Estimation Models for Domain-Agnostic Single Depth Image Completion [56.28564075246147]
StarryGazerは、単一のスパース深度画像とRGB画像から高密度深度画像を予測するフレームワークである。
我々は、相対深度画像を生成するために、事前訓練されたMDEモデルを用いる。
モデルの精度とロバスト性を改善するために、相対深度マップとRGBイメージを組み込んだ合成ペアを用いて改良ネットワークを訓練する。
論文 参考訳(メタデータ) (2025-12-15T09:56:09Z) - DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization [43.974708665104565]
本稿では,RGB-Dシーン解析に特化して設計された半教師付き学習フレームワークDepthMatchを紹介する。
本稿では,RGB-D画像対におけるテクスチャと空間的特徴の潜伏関係を明らかにするために,補間パッチ混在拡大法を提案する。
また,従来の複合核融合モジュールを代替する軽量空間先行インジェクタを設計し,不均一な特徴核融合の効率を向上する。
論文 参考訳(メタデータ) (2025-05-26T14:26:31Z) - Depth-Guided Semi-Supervised Instance Segmentation [62.80063539262021]
Semi-Supervised Instance (SSIS)は、トレーニング中にラベルなしデータの量を活用することを目的としている。
従来のフレームワークは主に、ラベルなし画像のRGB情報を利用して擬似ラベルを生成する。
この制限を克服するために、Depth-Guided (DG)フレームワークを導入します。
論文 参考訳(メタデータ) (2024-06-25T09:36:50Z) - Symmetric Uncertainty-Aware Feature Transmission for Depth
Super-Resolution [52.582632746409665]
カラー誘導DSRのためのSymmetric Uncertainty-aware Feature Transmission (SUFT)を提案する。
本手法は最先端の手法と比較して優れた性能を実現する。
論文 参考訳(メタデータ) (2023-06-01T06:35:59Z) - Spherical Space Feature Decomposition for Guided Depth Map
Super-Resolution [123.04455334124188]
誘導深度マップ超解像(GDSR)は、低解像度(LR)深度マップに高解像度(HR)RGB画像を含む追加情報を加えることを目的としている。
本稿では,この問題を解決するために,Spherical Space Feature Decomposition Network (SSDNet)を提案する。
提案手法は,4つのテストデータセットの最先端結果と実世界のシーンへの一般化を実現する。
論文 参考訳(メタデータ) (2023-03-15T21:22:21Z) - Discrete Cosine Transform Network for Guided Depth Map Super-Resolution [19.86463937632802]
目標は、高解像度(HR)RGB画像を使用してエッジとオブジェクトの輪郭に関する余分な情報を提供し、低解像度の深度マップをHR画像にアップサンプリングできるようにすることです。
本稿では,4つのコンポーネントから構成されるDCTNet(Digital Discrete Cosine Transform Network)を提案する。
本手法は,最新手法を越しに,正確かつ人事深度マップを生成できることを示した。
論文 参考訳(メタデータ) (2021-04-14T17:01:03Z) - High-resolution Depth Maps Imaging via Attention-based Hierarchical
Multi-modal Fusion [84.24973877109181]
誘導DSRのための新しい注意に基づく階層型マルチモーダル融合ネットワークを提案する。
本手法は,再現精度,動作速度,メモリ効率の点で最先端手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-04-04T03:28:33Z) - Unpaired Single-Image Depth Synthesis with cycle-consistent Wasserstein
GANs [1.0499611180329802]
実環境深度のリアルタイム推定は、様々な自律システムタスクにとって必須のモジュールである。
本研究では、生成型ニューラルネットワークの分野における最近の進歩を、教師なしの単一画像深度合成に活用する。
論文 参考訳(メタデータ) (2021-03-31T09:43:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。