論文の概要: SANA I2I: A Text Free Flow Matching Framework for Paired Image to Image Translation with a Case Study in Fetal MRI Artifact Reduction
- arxiv url: http://arxiv.org/abs/2604.00298v1
- Date: Tue, 31 Mar 2026 22:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.753592
- Title: SANA I2I: A Text Free Flow Matching Framework for Paired Image to Image Translation with a Case Study in Fetal MRI Artifact Reduction
- Title(参考訳): SANA I2I:画像翻訳のためのテキストフリーフローマッチングフレームワーク : 胎児MRIアーチファクトリダクションのケーススタディ
- Authors: Italo Felix Santos, Gilson Antonio Giraldi, Heron Werner Junior,
- Abstract要約: テキストフリーの高解像度画像画像生成フレームワークであるSANA-I2Iを提案する。
胎児MRIの運動アーティファクト低減のための課題について,提案手法の評価を行った。
- 参考スコア(独自算出の注目度): 0.7850626323769984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose SANA-I2I, a text-free high-resolution image-to-image generation framework that extends the SANA family by removing textual conditioning entirely. In contrast to SanaControlNet, which combines text and image-based control, SANA-I2I relies exclusively on paired source-target images to learn a conditional flow-matching model in latent space. The model learns a conditional velocity field that maps a target image distribution to another one, enabling supervised image translation without reliance on language prompts. We evaluate the proposed approach on the challenging task of fetal MRI motion artifact reduction. To enable paired training in this application, where real paired data are difficult to acquire, we adopt a synthetic data generation strategy based on the method proposed by Duffy et al., which simulates realistic motion artifacts in fetal magnetic resonance imaging (MRI). Experimental results demonstrate that SANA-I2I effectively suppresses motion artifacts while preserving anatomical structure, achieving competitive performance few inference steps. These results highlight the efficiency and suitability of our proposed flow-based, text-free generative models for supervised image-to-image tasks in medical imaging.
- Abstract(参考訳): 本研究では,テキストコンディショニングを完全に取り除き,SANAファミリーを拡張したテキストフリーの高解像度画像画像生成フレームワークであるSANA-I2Iを提案する。
テキストと画像ベースの制御を組み合わせたSanaControlNetとは対照的に、SANA-I2Iはペアのソースターゲット画像にのみ依存して、潜時空間における条件付きフローマッチングモデルを学ぶ。
このモデルは,対象画像分布を他の画像にマッピングする条件速度場を学習し,言語プロンプトに依存することなく,教師付き画像翻訳を可能にする。
胎児MRIの運動アーティファクト低減のための課題について,提案手法の評価を行った。
このアプリケーションにおいて、実際のペアデータを取得するのが困難であるペアトレーニングを実現するために、Duffyらによって提案された方法に基づく合成データ生成戦略を採用し、胎児磁気共鳴画像(MRI)における現実的な運動アーティファクトをシミュレートする。
実験により, SANA-I2Iは解剖学的構造を保ちつつ, 動作アーチファクトを効果的に抑制し, 競争性能を向上できることを示す。
これらの結果は,医用画像撮影における教師付き画像・画像タスクのためのフローベース・テキストフリー生成モデルの効率性と適合性を強調した。
関連論文リスト
- Benchmarking GANs, Diffusion Models, and Flow Matching for T1w-to-T2w MRI Translation [3.9672323132974525]
I2Iアプローチは、診断品質を維持しながらMRIコントラストを合成することを目的としている。
本稿では,生成的獲得モデル,拡散モデル,フローベースマッチング技術に関する包括的なフレームワークを提案する。
結果は、フローベースのモデルはデータセットや単純なタスクに過度に適合する傾向があり、既存のメソッドにマッチしたり、超えたりするためにより多くのデータを必要とする可能性があることを示唆している。
論文 参考訳(メタデータ) (2025-07-19T10:58:02Z) - DILLEMA: Diffusion and Large Language Models for Multi-Modal Augmentation [0.13124513975412253]
本稿では,大規模言語モデルと制御条件拡散モデルを活用した視覚ニューラルネットワークのテストフレームワークを提案する。
私たちのアプローチは、キャプションモデルを用いて画像から詳細なテキスト記述に変換することから始まります。
これらの記述は、テキストから画像への拡散プロセスを通じて、新しいテスト画像を生成するために使用される。
論文 参考訳(メタデータ) (2025-02-05T16:35:42Z) - SAM-I2I: Unleash the Power of Segment Anything Model for Medical Image Translation [0.9626666671366836]
SAM-I2Iは,Segment Anything Model 2 (SAM2) に基づく新しい画像から画像への変換フレームワークである。
マルチコントラストMRIデータセットを用いた実験により、SAM-I2Iは最先端の手法より優れており、より効率的かつ正確な医用画像翻訳を提供することが示された。
論文 参考訳(メタデータ) (2024-11-13T03:30:10Z) - FashionR2R: Texture-preserving Rendered-to-Real Image Translation with Diffusion Models [14.596090302381647]
本稿では,レンダリングの制御に基づく拡散モデルから生成するパワーを利用して,レンダリング画像のフォトリアリズム向上について検討する。
ドメイン知識注入(Domain Knowledge Injection, DKI)と現実画像生成(Realistic Image Generation, RIG)という2つの段階から構成される。
論文 参考訳(メタデータ) (2024-10-18T12:48:22Z) - Layered Rendering Diffusion Model for Controllable Zero-Shot Image Synthesis [15.76266032768078]
本稿では,テキストクエリに依存する拡散モデルにおける空間制御性向上のための革新的な手法を提案する。
まず、摂動分布の基本的な空間的キューとして視覚誘導を導入する。
本稿では,複数のレイヤからなる画像レンダリングプロセスを構築する汎用フレームワークであるLayered Rendering Diffusion (LRDiff)を提案する。
論文 参考訳(メタデータ) (2023-11-30T10:36:19Z) - MindDiffuser: Controlled Image Reconstruction from Human Brain Activity
with Semantic and Structural Diffusion [7.597218661195779]
我々はMindDiffuserと呼ばれる2段階の画像再構成モデルを提案する。
ステージ1では、VQ-VAE潜在表現とfMRIからデコードされたCLIPテキスト埋め込みが安定拡散される。
ステージ2では、fMRIからデコードされたCLIP視覚特徴を監視情報として利用し、バックパゲーションによりステージ1でデコードされた2つの特徴ベクトルを継続的に調整し、構造情報を整列させる。
論文 参考訳(メタデータ) (2023-08-08T13:28:34Z) - Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images [60.34381768479834]
近年の拡散モデルの発展により、自然言語のテキストプロンプトから現実的なディープフェイクの生成が可能になった。
我々は、最先端拡散モデルにより生成されたディープフェイク検出に関する体系的研究を開拓した。
論文 参考訳(メタデータ) (2023-04-02T10:25:09Z) - fRegGAN with K-space Loss Regularization for Medical Image Translation [42.253647362909476]
GAN(Generative Adversarial Network)は、現実的な画像の生成において顕著な成功を収めている。
GANは低周波の周波数バイアスに悩まされる傾向にあり、それによって生成された画像の重要な構造が取り除かれる。
本稿では,fRegGANと呼ばれる教師付きRegGANアプローチに基づく新しい周波数対応画像画像変換フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-28T12:49:10Z) - IMAGINE: Image Synthesis by Image-Guided Model Inversion [79.4691654458141]
IMGE-Guided Model INvErsion (IMAGINE) と呼ばれるインバージョンベースの手法を導入し、高品質で多様な画像を生成します。
我々は,事前学習した分類器から画像意味論の知識を活用し,妥当な世代を実現する。
IMAGINEは,1)合成中の意味的特異性制約を同時に実施し,2)ジェネレータトレーニングなしでリアルな画像を生成し,3)生成過程を直感的に制御する。
論文 参考訳(メタデータ) (2021-04-13T02:00:24Z) - Learning Deformable Image Registration from Optimization: Perspective,
Modules, Bilevel Training and Beyond [62.730497582218284]
マルチスケールの伝搬により微分同相モデルを最適化する,新しいディープラーニングベースのフレームワークを開発した。
我々は,脳MRIデータにおける画像-アトラス登録,肝CTデータにおける画像-画像登録を含む,3次元ボリュームデータセットにおける画像登録実験の2つのグループを実行する。
論文 参考訳(メタデータ) (2020-04-30T03:23:45Z) - Unlimited Resolution Image Generation with R2D2-GANs [69.90258455164513]
本稿では,任意の解像度の高品質な画像を生成するための新しいシミュレーション手法を提案する。
この方法では、フル長のミッション中に収集したソナースキャンと同等の大きさのソナースキャンを合成することができる。
生成されたデータは、連続的で、現実的に見え、また、取得の実際の速度の少なくとも2倍の速さで生成される。
論文 参考訳(メタデータ) (2020-03-02T17:49:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。