論文の概要: ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation
- arxiv url: http://arxiv.org/abs/2609.00968v1
- Date: Tue, 01 Sep 2026 09:25:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.519593
- Title: ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation
- Title(参考訳): ReFlowSET: SAR-to-EO画像変換のための表現型潜在フローマッチング
- Authors: Jeonghyeok Do, Seungchul Lee, Munchurl Kim,
- Abstract要約: SAR-to-EO画像変換は、合成開口レーダ(SAR)観測から電気光学(EO)画像を生成することを目的としている。
既存の遅延拡散法は、典型的には所定のオートエンコーダを継承するが、再構成の忠実度はコーデックやモダリティによって大きく異なる。
本稿では,共同SAR-EO再構築監査を通じて,その継承を選択する条件付き遅延フローマッチングフレームワークであるReFlowSETを紹介する。
- 参考スコア(独自算出の注目度): 29.763721439976337
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: SAR-to-EO image translation aims to generate electro-optical (EO) imagery from synthetic aperture radar (SAR) observations. Existing latent diffusion approaches typically inherit a predetermined autoencoder, although reconstruction fidelity can vary substantially across codecs and modalities. Because the latent codec affects the round-trip preservation of both SAR conditions and EO targets, codec selection constitutes a fundamental design choice; nevertheless, existing methods largely rely on codecs pretrained on natural images. To remedy this, we introduce ReFlowSET, a conditional latent flow-matching framework that selects its codec through a joint SAR--EO reconstruction audit. Rather than inheriting a heavyweight pretrained generator, ReFlowSET trains a substantially smaller conditional DiT from scratch in the selected latent space, using dual-stream SAR conditioning followed by joint feature refinement. To provide semantic guidance for this from-scratch training, intermediate noisy-EO features are aligned with clean target-EO representations extracted by a frozen vision foundation model. This alignment is used only during training and introduces no additional inference cost. Experiments on QXS-SAROPT and SAR2Opt demonstrate state-of-the-art performance across diverse perceptual fidelity and distributional metrics. Code and pretrained weights are publicly available at https://github.com/KAIST-VICLab/ReFlowSET.
- Abstract(参考訳): SAR-to-EO画像変換は、合成開口レーダ(SAR)観測から電気光学(EO)画像を生成することを目的としている。
既存の遅延拡散法は、典型的には所定のオートエンコーダを継承するが、再構成の忠実度はコーデックやモダリティによって大きく異なる。
遅延コーデックはSAR条件とEO目標の両方のラウンドトリップ保存に影響を与えるため、コーデックの選択は基本的な設計上の選択となっている。
そこで我々は,共同SAR-EO再構築監査を通じてコーデックを選択する条件付き潜在フローマッチングフレームワークReFlowSETを紹介する。
ReFlowSETは重い予訓練発電機を継承する代わりに、選択された潜在空間のスクラッチからかなり小さな条件付きDiTを訓練し、デュアルストリームSARコンディショニングと継手機能改善を施した。
このオフスクラッチトレーニングのセマンティックガイダンスを提供するため、凍結した視覚基盤モデルにより抽出されたクリーンターゲットEO表現に中間ノイズEO特徴を一致させる。
このアライメントはトレーニングでのみ使用され、追加の推論コストを導入しない。
QXS-SAROPTとSAR2Optの実験は、様々な知覚の忠実度と分布のメトリクスで最先端のパフォーマンスを示す。
コードと事前トレーニングされたウェイトはhttps://github.com/KAIST-VICLab/ReFlowSETで公開されている。
関連論文リスト
- Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution [80.28905986756685]
DiMOO-SRは光リアル画像超解法のための多モード離散拡散フレームワークである。
広く使われている実世界のSRベンチマークの実験では、DiMOO-SRはいくつかの並列デコードステップで競合する知覚品質を達成する。
論文 参考訳(メタデータ) (2026-07-20T07:01:01Z) - V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising [65.5867130156805]
統合JTフレームワークにおける視覚的コデノゲーションの体系的研究であるV-Coについて述べる。
本研究は,視覚的コデノジングを効果的に行うための4つの重要な要素を明らかにする。
V-Coは、基礎となる画素空間拡散ベースラインと強い前の画素拡散法より優れている。
論文 参考訳(メタデータ) (2026-03-17T17:01:54Z) - Quantitative Comparison of Fine-Tuning Techniques for Pretrained Latent Diffusion Models in the Generation of Unseen SAR Images [0.0]
我々は、SAR(Synthetic Aperture Radar)のモダリティに、オープンソースのテキスト・ツー・イメージ基盤モデルを適用する。
我々は,UNet拡散バックボーン,変分オートエンコーダ(VAE)およびテキストエンコーダの完全な微調整とパラメータ効率の低いローランド適応(LoRA)を比較した。
この結果から,テキストエンコーダと学習トークン埋め込みベストにLoRAを併用したハイブリッド戦略フルUNetチューニングが,SAR形状とテクスチャを保存できることが示唆された。
論文 参考訳(メタデータ) (2025-06-16T09:48:01Z) - SING: Semantic Image Communications using Null-Space and INN-Guided Diffusion Models [52.40011613324083]
近年, 無線画像伝送において, 共用音源チャネル符号化システム (DeepJSCC) が顕著な性能を発揮している。
既存の手法では、送信された画像とレシーバーの再構成されたバージョンとの間の歪みを最小限に抑えることに重点を置いており、しばしば知覚的品質を見落としている。
逆問題として,破損した再構成画像から高品質な画像の復元を定式化する新しいフレームワークであるSINGを提案する。
論文 参考訳(メタデータ) (2025-03-16T12:32:11Z) - C-DiffSET: Leveraging Latent Diffusion for SAR-to-EO Image Translation with Confidence-Guided Reliable Object Generation [23.63992950769041]
C-DiffSETは、訓練済みの遅延拡散モデル(LDM)を自然画像で広く訓練したフレームワークである。
顕著なことに、事前訓練されたVAEエンコーダは、SAR入力のノイズレベルが異なる場合でも、同じ潜時空間でSARとEOの画像を整列する。
論文 参考訳(メタデータ) (2024-11-16T12:28:40Z) - Diffusion-Aided Joint Source Channel Coding For High Realism Wireless Image Transmission [24.372996233209854]
DiffJSCCは条件拡散復調法により高現実性画像を生成する新しいフレームワークである。
768x512ピクセルのコダック画像を3072のシンボルで再現できる。
論文 参考訳(メタデータ) (2024-04-27T00:12:13Z) - JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement [69.6035373784027]
低照度画像強調(LLIE)は条件付き拡散モデルを用いて有望な性能を実現している。
従来手法は、タスク固有の条件戦略の十分な定式化の重要性を無視するものであった。
本稿では,Retinex および semantic-based pre-processing condition を付加した新しいアプローチである JoReS-Diff を提案する。
論文 参考訳(メタデータ) (2023-12-20T08:05:57Z) - Conditioning Trick for Training Stable GANs [70.15099665710336]
本稿では,GANトレーニング中の不安定性問題に対応するため,ジェネレータネットワークに正規性から逸脱する条件付け手法を提案する。
我々は、生成元をシュア分解のスペクトル領域で計算された実サンプルの正規化関数から逸脱するように強制する。
論文 参考訳(メタデータ) (2020-10-12T16:50:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。