論文の概要: Robust Multispectral Semantic Segmentation under Missing or Full Modalities via Structured Latent Projection
- arxiv url: http://arxiv.org/abs/2604.15856v1
- Date: Fri, 17 Apr 2026 09:05:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.844293
- Title: Robust Multispectral Semantic Segmentation under Missing or Full Modalities via Structured Latent Projection
- Title(参考訳): 構造的潜在射影による欠損・完全モード下でのロバスト多スペクトルセマンティックセマンティックセグメンテーション
- Abstract要約: 現実世界の展開では、センサーの故障、取得の問題、大気条件の難しさにより、いくつかのモダリティが利用できない可能性がある。
既存のマルチモーダルセグメンテーションモデルは、通常、入力間で共有表現を学ぶことで、欠落したモダリティに対処する。
我々は、モダリティ不変情報とモダリティ固有情報の両方を保存するために設計されたマルチモーダルセマンティックセマンティックセマンティクスモデルCBC-SLPを用いて、この制限に取り組む。
- 参考スコア(独自算出の注目度): 5.097809301149341
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal remote sensing data provide complementary information for semantic segmentation, but in real-world deployments, some modalities may be unavailable due to sensor failures, acquisition issues, or challenging atmospheric conditions. Existing multimodal segmentation models typically address missing modalities by learning a shared representation across inputs. However, this approach can introduce a trade-off by compromising modality-specific complementary information and reducing performance when all modalities are available. In this paper, we tackle this limitation with CBC-SLP, a multimodal semantic segmentation model designed to preserve both modality-invariant and modality-specific information. Inspired by the theoretical results on modality alignment, which state that perfectly aligned multimodal representations can lead to sub-optimal performance in downstream prediction tasks, we propose a novel structured latent projection approach as an architectural inductive bias. Rather than enforcing this strategy through a loss term, we incorporate it directly into the architecture. In particular, to use the complementary information effectively while maintaining robustness under random modality dropout, we structure the latent representations into shared and modality-specific components and adaptively transfer them to the decoder according to the random modality availability mask. Extensive experiments on three multimodal remote sensing image sets demonstrate that CBC-SLP consistently outperforms state-of-the-art multimodal models across full and missing modality scenarios. Besides, we empirically demonstrate that the proposed strategy can recover the complementary information that may not be preserved in a shared representation. The code is available at https://github.com/iremulku/Multispectral-Semantic-Segmentation-via-Structured-Latent-Projection-CBC -SLP-.
- Abstract(参考訳): マルチモーダルリモートセンシングデータはセマンティックセグメンテーションの補完的な情報を提供するが、実世界の展開では、センサーの故障、取得の問題、大気条件の難しさのためにいくつかのモダリティが利用できない可能性がある。
既存のマルチモーダルセグメンテーションモデルは、通常、入力間で共有表現を学ぶことで、欠落したモダリティに対処する。
しかし、このアプローチは、モダリティ固有の補完情報を妥協し、すべてのモダリティが利用できる場合に性能を低下させることでトレードオフをもたらすことができる。
本稿では、モダリティ不変情報とモダリティ固有情報の両方を保存するために設計されたマルチモーダルセマンティックセマンティックセグメンテーションモデルであるCBC-SLPを用いて、この制限に対処する。
マルチモーダル表現の完全整合が下流予測タスクにおける準最適性能をもたらすというモーダリティアライメントの理論結果に着想を得て,アーキテクチャ上の帰納的バイアスとして,新しい構造的潜在射影手法を提案する。
この戦略を損失期間で実施するのではなく、アーキテクチャに直接組み込むのです。
特に、ランダムなモダリティ・アベイラビリティ・マスクに従って、共振器表現を共有およびモダリティ特化成分に構成し、デコーダに適応的に転送する。
3つのマルチモーダルリモートセンシング画像セットに対する大規模な実験により、CBC-SLPは、完全なモダリティシナリオと欠落したモードシナリオにおいて、最先端のマルチモーダルモデルよりも一貫して優れていることが示された。
さらに,提案手法が共有表現に保存されない相補的情報を復元できることを実証的に実証した。
コードはhttps://github.com/iremulku/Multispectral-Semantic-Segmentation-via-Structured-Latent-Projection-CBC -SLP-で公開されている。
関連論文リスト
- MODAL: Multi-Modal Object Re-ID via Model-Driven Sparse Decoupling and Text-Image Differential Filtering [51.99452481869329]
MODALは、スパース符号理論と微分抑圧原理を組み合わせた、新しいマルチモーダルオブジェクト再識別フレームワークである。
MODALの中核となるコンポーネントは、モデル駆動のディープアンロール方式で開発されたマルチモーダル特徴スパースデカップリングモジュールである。
MODALは原則的な機能障害から恩恵を受け、不完全なモダリティシナリオにおけるパフォーマンス低下を自然に軽減します。
4つのデータセットの実験では、MODALが最先端のパフォーマンスを達成し、透明性が優れていることが示されている。
論文 参考訳(メタデータ) (2026-08-15T07:41:10Z) - RePercENT: Scaling Disentangled Representation Learning Beyond Two Modalities [34.35941675436447]
RePercENTは、2つのモダリティを超えて、スケーラブルなペアワイズ・アンタングルをアンロックするように設計された、自己管理型のフレームワークである。
提案手法は, 事前抽出した埋め込みを直接操作し, 広範囲なジョイント・プレトレーニングの必要性を解消する。
さまざまなモダリティやタスクにわたって、RePercENTは、競合性能を維持しながら、アンタングルされたコンポーネントの回復に成功した。
論文 参考訳(メタデータ) (2026-06-03T17:10:39Z) - Modality-Agnostic Prompt Learning for Multi-Modal Camouflaged Object Detection [61.36976558603528]
本稿では,Segment Anything Model(SAM)のためのモダリティに依存しないマルチモーダルプロンプトを生成する新しいフレームワークを提案する。
具体的には,データ駆動型コンテンツドメインと知識駆動型プロンプトドメインとのインタラクションを通じて,マルチモーダル学習をモデル化する。
さらに,微粒なプロンプトキューを組み込むことで,粗い予測をキャリブレーションする軽量マスクリファインモジュールを導入する。
論文 参考訳(メタデータ) (2026-04-14T07:13:28Z) - Orthogonalized Multimodal Contrastive Learning with Asymmetric Masking for Structured Representations [4.67724003380452]
マルチモーダル学習は異種情報源からの情報を統合することを目的としており、そこでは信号はモダリティ間で共有され、個々のモダリティに特有であり、相互作用を通してのみ現れる。
自己教師型マルチモーダルコントラスト学習は目覚ましい進歩を遂げてきたが、既存の手法のほとんどは冗長なクロスモーダル信号を捉え、しばしばモダリティ固有の(一意的な)情報や相互作用駆動の(シネルジスティックな)情報を無視している。
最近の拡張は、この視点を広げるが、それらは相乗的相互作用を明示的にモデル化したり、異なる情報コンポーネントを絡み合った方法で学習することに失敗し、不完全な表現と潜在的な情報漏洩につながる。
基本的枠組みである textbfCOrAL を導入する。
論文 参考訳(メタデータ) (2026-02-16T18:06:53Z) - From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation [59.27094165576015]
疎度な意思決定から高密度な推論トレースへ移行する新しい学習パラダイム(UniMod)を提案する。
モノリシックな意思決定タスクを多次元境界学習プロセスに再構成し,エビデンス,モダリティ評価,リスクマッピング,政策決定,応答生成を含む構造化軌道を構築する。
タスク固有のパラメータを分離し、トレーニングダイナミクスを再バランスさせ、マルチタスク学習における多様な目的間の干渉を効果的に解消する、特別な最適化戦略を導入する。
論文 参考訳(メタデータ) (2026-01-28T09:29:40Z) - Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge [16.958159611661813]
Latent Denoising Diffusion Bridge Model (LDDBM)は、モーダル翻訳のための汎用フレームワークである。
共用ラテント空間で演算することにより、任意のモード間のブリッジを、整列次元を必要とせずに学習する。
提案手法は任意のモダリティペアをサポートし,マルチビューから3次元形状生成,画像超解像,マルチビューシーン合成など,多様なMTタスクに強く依存する。
論文 参考訳(メタデータ) (2025-10-23T17:59:54Z) - NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching [64.10695425442164]
NExT-OMNI(英語版)は、離散フローパラダイムによる統一モデリングを実現するオープンソース・オムニモーダル・ファンデーション・モデルである。
NExT-OMNIは、大規模なインターリーブ付きテキスト、画像、ビデオ、オーディオデータに基づいて訓練され、マルチモーダル生成および理解ベンチマーク上で競合するパフォーマンスを提供する。
さらなる研究を進めるために、トレーニングの詳細、データプロトコル、およびコードとモデルチェックポイントの両方をオープンソース化する。
論文 参考訳(メタデータ) (2025-10-15T16:25:18Z) - U3M: Unbiased Multiscale Modal Fusion Model for Multimodal Semantic Segmentation [63.31007867379312]
U3M: An Unbiased Multiscale Modal Fusion Model for Multimodal Semanticsを紹介する。
我々は,グローバルな特徴とローカルな特徴の効果的な抽出と統合を保証するために,複数のスケールで機能融合を採用している。
実験により,本手法は複数のデータセットにまたがって優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-24T08:58:48Z) - Unified Multi-modal Unsupervised Representation Learning for
Skeleton-based Action Understanding [62.70450216120704]
教師なしの事前訓練は骨格に基づく行動理解において大きな成功を収めた。
我々はUmURLと呼ばれる統一マルチモーダル非教師なし表現学習フレームワークを提案する。
UmURLは効率的な早期融合戦略を利用して、マルチモーダル機能を単一ストリームで共同でエンコードする。
論文 参考訳(メタデータ) (2023-11-06T13:56:57Z) - SimMMDG: A Simple and Effective Framework for Multi-modal Domain
Generalization [13.456240733175767]
SimMMDGは、マルチモーダルシナリオにおけるドメインの一般化を実現する上での課題を克服するためのフレームワークである。
我々は,共同性を確保し,距離制約を課すために,モダリティ共有特徴に対する教師付きコントラスト学習を採用する。
本研究では,EPIC-KitchensデータセットとHuman-Animal-CartoonデータセットのマルチモーダルDGにおいて,理論的に支持され,高い性能を実現している。
論文 参考訳(メタデータ) (2023-10-30T17:58:09Z) - Continual Road-Scene Semantic Segmentation via Feature-Aligned Symmetric Multi-Modal Network [15.196758664999455]
我々は、密結合した特徴表現と対称情報共有スキームを強制することにより、マルチモーダルなセマンティックセマンティックセマンティクスのタスクを再構築する。
また,安全クリティカルな環境においても,提案手法の有効性と信頼性を実証する,アドホックなクラス増分連続学習手法も導入する。
論文 参考訳(メタデータ) (2023-08-09T04:46:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。