論文の概要: DTFormer: Text-Guided Semantic Alignment for RGB-D Segmentation
- arxiv url: http://arxiv.org/abs/2610.07014v1
- Date: Sun, 04 Oct 2026 14:06:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.507015
- Title: DTFormer: Text-Guided Semantic Alignment for RGB-D Segmentation
- Title(参考訳): DTFormer: RGB-Dセグメンテーションのためのテキストガイドセマンティックアライメント
- Abstract要約: 本稿では,新しい三モーダル(RGB-D-Text)セマンティックセマンティックセグメンテーションフレームワークDTFormerを提案する。
DTFormerはシンプルで効率的なまま、一貫したゲインを提供します。
- 参考スコア(独自算出の注目度): 43.63863326496588
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: RGB-D semantic segmentation has made notable progress by fusing RGB and Depth, yet mainstream models still learn features almost exclusively from pixel-level supervision, lacking direct high-level semantic constraints. This raises a central question-can external knowledge such as language priors inject stronger semantic discriminability into mainstream RGB-D segmentation models. We present DTFormer, a novel tri-modal (RGB-D-Text) semantic segmentation framework. At its core is Text-guided Semantic Alignment Module (TSAM) that first encodes textual cues into a set of semantic prototypes and then explicitly aligns multi-modal RGB-D features with these prototypes at multiple encoder and decoder layers. This design imposes strong semantic regularization on representation learning, guiding the network toward more discriminative features. Extensive experiments on multiple benchmarks show that DTFormer delivers consistent gains while remaining simple and efficient. Our results demonstrate that explicit semantic alignment offers an effective and practical route to improving RGB-D semantic segmentation. The code will be released upon acceptance.
- Abstract(参考訳): RGB-Dセマンティックセマンティックセグメンテーションは、RGBとDepthを融合することで顕著な進歩を遂げているが、主流のモデルは、ほとんどピクセルレベルの監視から学習し、直接的な高レベルのセマンティック制約を欠いている。
これにより、言語事前のような外的知識がメインストリームのRGB-Dセグメンテーションモデルに強い意味的差別性を注入する。
本稿では,新しい三モーダル(RGB-D-Text)セマンティックセマンティックセグメンテーションフレームワークDTFormerを提案する。
中心となるのはText-guided Semantic Alignment Module (TSAM) で、まずテキストキューをセマンティックプロトタイプにエンコードし、次に複数のエンコーダ層とデコーダ層でこれらのプロトタイプとマルチモーダルなRGB-D機能を明示的にアライメントする。
この設計は、表現学習に強い意味規則化を課し、ネットワークをより差別的な特徴へと導く。
複数のベンチマークに関する大規模な実験は、DTFormerがシンプルで効率的なまま一貫したゲインを提供することを示している。
本研究は,RGB-Dセマンティックセマンティックセグメンテーションを改善するために,明示的セマンティックアライメントが効果的かつ実用的な方法であることを示す。
コードは受理時にリリースされます。
関連論文リスト
- IAM: Enhancing RGB-D Instance Segmentation with New Benchmarks [4.3266254914862445]
RGB-Dセグメンテーションは、RGBのみの手法よりもリッチなシーン理解を約束する。
インスタンスレベルのRGB-Dセグメンテーションデータセットは比較的少ない。
インスタンスレベルで区別された3つのRGB-Dインスタンスセグメンテーションベンチマークを導入する。
本稿では,RGB-Dデータ統合のための簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2025-01-03T08:03:24Z) - Semantic-Aware Frame-Event Fusion based Pattern Recognition via Large
Vision-Language Models [15.231177830711077]
セマンティックラベル,RGBフレーム,イベントストリームを統合した新しいパターン認識フレームワークを提案する。
セマンティックなラベルを扱うために,素早い工学を通して言語記述に変換する。
マルチモーダルトランスフォーマーネットワークを用いたRGB/Event機能とセマンティック機能を統合する。
論文 参考訳(メタデータ) (2023-11-30T14:35:51Z) - DFormer: Rethinking RGBD Representation Learning for Semantic
Segmentation [76.81628995237058]
DFormerは、RGB-Dセグメンテーションタスクの転送可能な表現を学ぶための新しいフレームワークである。
ImageNet-1Kから画像深度ペアを使用してバックボーンを事前トレーニングする。
DFormerは2つのRGB-Dタスクで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-09-18T11:09:11Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Attention-based Dual Supervised Decoder for RGBD Semantic Segmentation [16.721758280029302]
RGBDセマンティックセグメンテーションのための新しいアテンションベースデュアル教師付きデコーダを提案する。
エンコーダでは、マルチレベルペア補完情報を抽出し、融合するための、シンプルで効果的な注意に基づくマルチモーダル融合モジュールを設計する。
本手法は最先端の手法に対して優れた性能を発揮する。
論文 参考訳(メタデータ) (2022-01-05T03:12:27Z) - Cross-modality Discrepant Interaction Network for RGB-D Salient Object
Detection [78.47767202232298]
本稿では,RGB-D SODのためのクロスモダリティ離散相互作用ネットワーク(CDINet)を提案する。
2つのコンポーネントは、効果的な相互モダリティ相互作用を実装するように設計されている。
我々のネットワークは、定量的にも質的にも15ドルの最先端の手法より優れています。
論文 参考訳(メタデータ) (2021-08-04T11:24:42Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。