論文の概要: Bridging Modalities and Tasks: A Unified Hierarchical ViT for SAR-to-Optical Translation and Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2609.04726v1
- Date: Fri, 04 Sep 2026 04:50:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.91478
- Title: Bridging Modalities and Tasks: A Unified Hierarchical ViT for SAR-to-Optical Translation and Semantic Segmentation
- Title(参考訳): ブリッジングのモダリティと課題:SAR-to-Optical Translationとセマンティックセグメンテーションのための統一階層型ViT
- Abstract要約: 合成開口レーダ(SAR)画像は、全天候、昼夜の観測能力を有する。
SAR-to-optical (S2O)変換のための生成モデルは視覚的解釈性を改善することができるが、既存の手法は意味構造に関する制約を無視することが多い。
我々は,S2O画像の翻訳とセマンティックセグメンテーションを協調的に最適化する,BMT (Bridging Modalities and Tasks) と呼ばれる統合協調型デュアルタスク学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 6.274164868115626
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic Aperture Radar (SAR) images have all-weather, day-and-night observation capabilities. However, compared with optical images, their speckle noise and non-intuitive scattering mechanism limit the interpretability of the images. Generative models for SAR-to-optical (S2O) conversion can improve visual interpretability, but existing methods often ignore the constraints on semantic structure, which are necessary for downstream tasks, for the sake of visual effects. We propose a unified collaborative dual-task learning framework, termed BMT (Bridging Modalities and Tasks), that jointly optimizes S2O image translation and semantic segmentation through a shared hierarchical Vision Transformer. The framework integrates: (1) a LocalViTBlock that fuses global self-attention with spatial depthwise convolution through a learnable gating mechanism; (2) an enhanced output module combining multi-scale refinement processing, color correction and anti-aliasing, which calibrates channel-level color statistics through feature fusion; (3) a ControlNet-style conditional injection mechanism that encodes SAR wavelet features and segmentation labels into a multi-scale feature pyramid and injects them at each encoder layer through zero-initialized convolution; (4) a bounded Kendall uncertainty weighting scheme that prevents either task from dominating the shared representation. We evaluate the framework under both paired and unpaired translation settings, on the public WHU-OPT-SAR paired dataset and a self-constructed unpaired ship dataset built from HRSID and DIOR, respectively. The experimental results show that the proposed method achieves competitive S2O translation quality and semantic segmentation performance. The dataset and source code have been publicly released at https://github.com/Lewisyuaner/BMT-S2O-main.
- Abstract(参考訳): 合成開口レーダ(SAR)画像は、全天候、昼夜の観測能力を有する。
しかし、光学画像と比較して、スペックルノイズや非直観的散乱機構は画像の解釈可能性を制限する。
SAR-to-optical (S2O)変換のための生成モデルは、視覚的解釈性を改善することができるが、既存の手法では、視覚効果のために下流タスクに必要な意味構造に関する制約を無視することが多い。
本稿では,共有階層型視覚変換器によるS2O画像翻訳とセマンティックセマンティックセグメンテーションを共同で最適化する,BMT(Bridging Modalities and Tasks)と呼ばれる協調型デュアルタスク学習フレームワークを提案する。
本フレームワークは,(1)学習可能なゲーティング機構を通じて,グローバルな自己意図と空間的奥行きの畳み込みを融合させるローカルViTBlock,(2)マルチスケールの精細化処理,色補正,アンチエイリアス処理を組み合わせた出力モジュール,(3)SARウェーブレットの特徴とセグメンテーションラベルを多スケールの特徴ピラミッドに符号化し,各エンコーダ層にゼロ初期化コンボリューションを通じてそれらを注入するコントロールネットスタイルの条件注入機構,(4)共有表現を支配できない有界ケンドール不確実性重み付けスキーム,などを統合する。
HRSID と DIOR を併用した自己構築型船体データセットと WHU-OPT-SAR の組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組組 組
実験の結果,提案手法は競合するS2O翻訳品質とセマンティックセグメンテーション性能を実現することがわかった。
データセットとソースコードはhttps://github.com/Lewisyuaner/BMT-S2O-mainで公開されている。
関連論文リスト
- Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing [55.13802890769086]
我々は、専用のRGB-Event解析用に特別に設計された最初の統一バックボーンであるEvitaを紹介する。
深いモーダルなシナジーを達成するため、Evitaはすべてのエンコーダ層に直接固有のコラーニングモジュール群を組み込む。
Evitaは、リアルタイムマルチモーダル認識において、より優れた精度とレイテンシのトレードオフを提供しながら、新しい最先端メトリクスを確立する。
論文 参考訳(メタデータ) (2026-07-10T06:52:09Z) - Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment [0.4790056963046066]
MST-CLIPIQAは、明示的な表現分離によって階層的な視覚言語アライメントを実現するマルチスケールの2ストリームフレームワークである。
アーキテクチャは2つのCLIPエンコーダを補完的なパッチの粒度で利用し、グローバルなセマンティックコヒーレンスをキャプチャする。
実験によって新しい最先端の結果が確立され、品質では1.11パーセントのSRCC、テキスト画像対応予測では2.35パーセントのSRCCが平均的に改善された。
論文 参考訳(メタデータ) (2026-06-15T14:40:30Z) - Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion [31.189038928192648]
Co2Sは半教師付きRSセグメンテーションフレームワークで、ビジョン言語モデルと自己教師型モデルとを融合する。
テキスト埋め込みと学習可能なクエリを利用した,明示的でシンプルなセマンティックコガイダンス機構が導入された。
6つの一般的なデータセットに対する実験は,提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2025-12-28T18:24:19Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - ASANet: Asymmetric Semantic Aligning Network for RGB and SAR image land cover classification [5.863175733097434]
特徴レベルでの非対称性の問題に対処するため,非対称セマンティックアライニングネットワーク (ASANet) という新しいアーキテクチャを提案する。
提案するASANetは,2つのモード間の特徴相関を効果的に学習し,特徴差によるノイズを除去する。
我々は、新しいRGB-SARマルチモーダルデータセットを構築し、ASANetは1.21%から17.69%の改善で他の主流メソッドよりも優れています。
論文 参考訳(メタデータ) (2024-12-03T00:03:33Z) - Cross-Modal Bidirectional Interaction Model for Referring Remote Sensing Image Segmentation [50.433911327489554]
リモートセンシング画像セグメンテーション(RRSIS)の目標は、参照式によって識別された対象オブジェクトの画素レベルマスクを生成することである。
上記の課題に対処するため、クロスモーダル双方向相互作用モデル(CroBIM)と呼ばれる新しいRRSISフレームワークが提案されている。
RRSISの研究をさらに推し進めるために、52,472個の画像言語ラベル三重項からなる新しい大規模ベンチマークデータセットRISBenchを構築した。
論文 参考訳(メタデータ) (2024-10-11T08:28:04Z) - Spatial Semantic Recurrent Mining for Referring Image Segmentation [63.34997546393106]
高品質なクロスモーダリティ融合を実現するために,Stextsuperscript2RMを提案する。
これは、言語特徴の分散、空間的意味的再帰的分離、パーセマンティック・セマンティック・バランシングという三部作の作業戦略に従う。
提案手法は他の最先端アルゴリズムに対して好適に機能する。
論文 参考訳(メタデータ) (2024-05-15T00:17:48Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z) - Scale-Semantic Joint Decoupling Network for Image-text Retrieval in
Remote Sensing [23.598273691455503]
リモートセンシング画像テキスト検索のためのSJDN(Scale-Semantic Joint Decoupling Network)を提案する。
提案するSSJDNは,4つのベンチマークリモートセンシングデータセットを用いて行った数値実験において,最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2022-12-12T08:02:35Z) - Semantic Image Synthesis via Diffusion Models [174.24523061460704]
Denoising Diffusion Probabilistic Models (DDPM) は様々な画像生成タスクにおいて顕著な成功を収めた。
セマンティック画像合成に関する最近の研究は、主に事実上のGANベースのアプローチに従っている。
意味画像合成のためのDDPMに基づく新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-30T18:31:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。