論文の概要: Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation
- arxiv url: http://arxiv.org/abs/2607.23673v1
- Date: Sun, 26 Jul 2026 14:21:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.184648
- Title: Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation
- Title(参考訳): マルチモーダルリモートセンシング画像生成のためのコントラストパラメータ分散
- Abstract要約: マルチモーダルリモートセンシング画像生成のためのコントラストパラメータ分散フレームワークを提案する。
1つのテキストプロンプトから複数のモーダルをまたいだ意味的一貫性と構造的整合性の画像を生成する。
提案手法は, 生成品質, 意味的整合性, 構造的整合性の観点から, 最先端のリモートセンシング画像生成手法より優れている。
- 参考スコア(独自算出の注目度): 11.968715761366989
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing remote sensing image generation methods are largely confined to single-modality synthesis and therefore fail to exploit the complementary information inherent in multimodal imagery. To address this limitation, we propose a contrastive parameter disentanglement framework for multimodal remote sensing image generation, which generates semantically consistent and structurally aligned images across multiple modalities, including optical, infrared, and synthetic aperture radar (SAR), from a single text prompt. Specifically, we introduce a contrastive parameter disentanglement module that disentangles shared semantics from modality-specific attributes at the parameter level within an orthogonal core subspace. Based on this module, we develop a disentangled optimization strategy that first constrains the parameter matrix A of the LoRA adapter to capture modality-invariant semantics through a multimodal contrastive objective and then guides multiple parameter matrices B to learn modality-specific attributes under text conditioning. This strategy enables the simultaneous generation of multimodal images with consistent semantic content and distinct modality characteristics. Furthermore, to ensure structural alignment across the generated images, we devise a query-key structure transfer mechanism that jointly models multimodal sampling trajectories during inference by transferring structural correlation priors from an anchor modality to the remaining modalities. Extensive experiments demonstrate that our method outperforms state-of-the-art remote sensing image generation approaches in terms of generation quality, semantic consistency, and structural alignment, while also achieving superior performance in the downstream object classification task.
- Abstract(参考訳): 既存のリモートセンシング画像生成法は、主に単一モダリティ合成に限られており、そのため、マルチモーダル画像に固有の補完情報を活用できない。
この制限に対処するために,光,赤外線,合成開口レーダ(SAR)を含む複数のモードにまたがるセマンティック一貫性と構造的に整合した画像を単一のテキストプロンプトから生成するマルチモーダルリモートセンシング画像生成のためのコントラッシブ・パラメータ・ディコンタングルメント・フレームワークを提案する。
具体的には、直交コア部分空間内のパラメータレベルにおいて、モダリティ固有の属性から共有セマンティクスをアンタングルするコントラッシブパラメータ非アンタングルメントモジュールを導入する。
このモジュールをベースとして、まずLoRAアダプタのパラメータ行列Aを制約し、マルチモーダルなコントラスト目的を通してモダリティ不変セマンティクスをキャプチャし、次に複数のパラメータ行列Bを誘導し、テキスト条件下でモダリティ固有の属性を学習する。
この戦略により、一貫した意味的内容と異なるモダリティ特性を持つマルチモーダル画像の同時生成が可能となる。
さらに、生成した画像間の構造的アライメントを確保するために、アンカーモダリティから残りのモダリティへの構造的相関を転送することで、推論中に複数モーダルサンプリングトラジェクトリを共同でモデル化するクエリキー構造移動機構を考案する。
大規模な実験により,本手法は,下流オブジェクト分類タスクにおいて優れた性能を達成しつつ,生成品質,セマンティック一貫性,構造アライメントの観点から,最先端のリモートセンシング画像生成手法よりも優れた性能を示した。
関連論文リスト
- MODAL: Multi-Modal Object Re-ID via Model-Driven Sparse Decoupling and Text-Image Differential Filtering [51.99452481869329]
MODALは、スパース符号理論と微分抑圧原理を組み合わせた、新しいマルチモーダルオブジェクト再識別フレームワークである。
MODALの中核となるコンポーネントは、モデル駆動のディープアンロール方式で開発されたマルチモーダル特徴スパースデカップリングモジュールである。
MODALは原則的な機能障害から恩恵を受け、不完全なモダリティシナリオにおけるパフォーマンス低下を自然に軽減します。
4つのデータセットの実験では、MODALが最先端のパフォーマンスを達成し、透明性が優れていることが示されている。
論文 参考訳(メタデータ) (2026-08-15T07:41:10Z) - Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information [10.086588302174263]
我々は、DeepMORSE(DeepMORSE)と呼ばれる原理的アプローチを提案する。
DeepMORSEは、モダリティ共有自己表現モデルを通じて、クロスモーダル構造を発見し、同時にモダリティ固有の部分空間の結合に対応する構造化表現を学習する。
広く使用されている6つの画像クラスタリングベンチマークでDeepMORSEを評価し、3%を超えるパフォーマンス改善を観察した。
論文 参考訳(メタデータ) (2026-08-09T02:23:49Z) - SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models [31.77829987533264]
我々はtextbfSemantic-textbfPixel の自己アライメントと textbfRouting (textbfSPAR) を備えた新しい統合マルチモーダルフレームワークを提案する。
画素レベルの再構成とセマンティック認識を一致させるため,非対称な二重ストリーム統一トークン化器を導入する。軽量なセマンティックストリームは識別的特徴をアンカーし,トランスフォーマー拡張されたピクセルストリームは細粒度の視覚的詳細をコンパクトな潜在空間に復元する。
論文 参考訳(メタデータ) (2026-06-22T08:48:19Z) - Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation [22.845591588026366]
本稿では,高レベルの概念からきめ細かい外観まで,明示的で構造化された監視を提供するフレームワークを提案する。
概念レベルでは、VAEの参照機能をランダムに省略するVAEドロップアウトトレーニング戦略を導入する。
外観レベルでは、VLM由来の対応文を対応認識型マスキングアテンションモジュールに統合する。
論文 参考訳(メタデータ) (2026-02-03T12:13:29Z) - CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval [54.15776146365823]
Composed Image Retrieval (CIR)では、ユーザーは参照画像と操作テキストの両方を使用してターゲットイメージを検索できる。
CSMCIRは3つの相乗的コンポーネントを通して効率的なクエリターゲットアライメントを実現する統一表現フレームワークである。
論文 参考訳(メタデータ) (2026-01-07T09:21:38Z) - Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach [99.80480649258557]
DiTFuseは命令駆動のフレームワークで、単一のモデル内でセマンティクスを意識した融合を実行する。
パブリックなIVIF、MFF、MEFベンチマークの実験では、より優れた量的および質的な性能、よりシャープなテクスチャ、より優れたセマンティック保持が確認されている。
論文 参考訳(メタデータ) (2025-12-08T05:04:54Z) - UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception [54.53657134205492]
UniAlignmentは単一の拡散変換器内での統一されたマルチモーダル生成フレームワークである。
固有モード意味アライメントとクロスモーダル意味アライメントの両方を組み込むことで、モデルのクロスモーダル一貫性と命令追従ロバスト性を高める。
本稿では、複雑なテキスト命令下でのマルチモーダルなセマンティック一貫性を評価するために設計された新しいベンチマークであるSemGen-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-28T09:11:30Z) - OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model [16.850096473419505]
マルチモーダルリモートセンシング画像登録は、データ融合と解析のために異なるセンサからの画像を整列する。
画像間変換によるモダリティギャップを橋渡しする,新しいマルチモーダル画像登録フレームワークOSDM-MRegを提案する。
論文 参考訳(メタデータ) (2025-04-08T13:32:56Z) - OminiControl: Minimal and Universal Control for Diffusion Transformer [68.3243031301164]
我々は,Diffusion Transformer(DiT)アーキテクチャに画像条件をどのように統合するかを再考する,新しいアプローチであるOminiControlを提案する。
OminiControlは3つの重要なイノベーションを通じて、これらの制限に対処する。
論文 参考訳(メタデータ) (2024-11-22T17:55:15Z) - Unified Frequency-Assisted Transformer Framework for Detecting and
Grounding Multi-Modal Manipulation [109.1912721224697]
本稿では、DGM4問題に対処するため、UFAFormerという名前のUnified Frequency-Assisted TransFormerフレームワークを提案する。
離散ウェーブレット変換を利用して、画像を複数の周波数サブバンドに分解し、リッチな顔偽造品をキャプチャする。
提案する周波数エンコーダは、帯域内およびバンド間自己アテンションを組み込んだもので、多種多様なサブバンド内および多種多様なフォージェリー特徴を明示的に集約する。
論文 参考訳(メタデータ) (2023-09-18T11:06:42Z) - Semantic Image Synthesis via Diffusion Models [174.24523061460704]
Denoising Diffusion Probabilistic Models (DDPM) は様々な画像生成タスクにおいて顕著な成功を収めた。
セマンティック画像合成に関する最近の研究は、主に事実上のGANベースのアプローチに従っている。
意味画像合成のためのDDPMに基づく新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-30T18:31:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。