論文の概要: DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation
- arxiv url: http://arxiv.org/abs/2607.29337v1
- Date: Fri, 31 Jul 2026 12:14:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.700795
- Title: DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation
- Title(参考訳): DualDiT:OCT画像とセグメンテーションマスク生成のための条件付きデュアル出力拡散変換器
- Abstract要約: OCTBスキャンとセグメンテーションマスクの結合合成のための条件付き二重出力拡散変換器(DualDiT)を提案する。
我々はDualDiTをDDPMとLCMの2つの適応拡散基線と比較した。
DualDiTは最高の生成品質(FID 56.14, sFID 114.35)を達成し、DDPMとLCMを上回った。
- 参考スコア(独自算出の注目度): 33.471662487272006
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background and Objective: Generating realistic medical images with anatomically accurate segmentation masks helps address the shortage of annotated data in medical imaging, particularly in optical coherence tomography (OCT) of mouse eyes, where manual retinal layer delineation is labour-intensive due to tiny structures and required expertise, resulting in scarce datasets. While diffusion models perform well in medical image synthesis, joint image-mask generation has relied mainly on U-Net-based denoisers, leaving diffusion transformers largely unexplored. Methods: We propose a conditional dual-output Diffusion Transformer (DualDiT) for joint synthesis of OCT B-scans and segmentation masks of the upper retinal cell layers in ex vivo mouse retina. DualDiT encodes both modalities into a shared latent space via a pretrained VAE, concatenates their latent representations, and performs conditional diffusion over the joint tensor. We compared DualDiT against two adapted diffusion baselines: DDPM and LDM. Generative quality was assessed via Fréchet Inception Distance (FID) and spatial FID (sFID); practical utility via synthetic data augmentation for downstream U-Net segmentation; and perceptual realism via evaluation by three domain experts. Results: DualDiT achieved the best generative quality (FID 56.14, sFID 114.35), outperforming DDPM and LDM. Expert panels misclassified 46% of synthetic samples as real and 42% of real samples as synthetic. Adding DualDiT-generated images and masks improved Dice and IoU scores on a held-out segmentation test set. Conclusions: DualDiT shows that transformer-based diffusion models can effectively learn the joint distribution of OCT images and segmentation masks, surpassing DDPM- and LDM-based baselines in generative fidelity, downstream utility, and perceptual realism, highlighting its potential for data augmentation in annotation-scarce medical imaging.
- Abstract(参考訳): 背景と目的: 解剖学的に正確なセグメンテーションマスクで現実的な医療画像を生成することは、特にマウスの眼の光コヒーレンス断層撮影(OCT)において、注釈付きデータの不足に対処するのに役立つ。
拡散モデルは医用画像合成においてよく機能するが、合同画像マスク生成は主にU-Netベースのデノイザーに依存しており、拡散変換器はほとんど探索されていない。
方法:両出力拡散変換器(DualDiT)を用いたOCT Bスキャンと上網膜細胞層分画マスクの複合合成法を提案する。
DualDiTは、両方のモダリティを事前訓練されたVAEを介して共有潜在空間に符号化し、それらの潜在表現を連結し、関節テンソル上で条件拡散を行う。
我々はDualDiTをDDPMとLCMの2つの適応拡散基線と比較した。
生成的品質はFréchet Inception Distance (FID) と空間的FID (sFID) を用いて評価された。
結果: DualDiT は最高生成品質 (FID 56.14, sFID 114.35) を達成し, DDPM と LDM を上回った。
専門家パネルは、合成サンプルの46%を実検体、42%を人工検体と誤分類した。
DualDiTの生成した画像とマスクを追加することで、ホールドアウトセグメンテーションテストセットでDiceとIoUのスコアが改善された。
結論: DualDiT は OCT 画像とセグメンテーションマスクの結合分布を効果的に学習し, DDPM および LDM ベースラインを越え, 生成的忠実度, 下流ユーティリティ, 知覚的リアリズムを克服し, アノテーションスカース医療画像におけるデータ拡張の可能性を強調した。
関連論文リスト
- PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement [60.81732730684265]
本稿では,高忠実度仮想コントラスト拡張(VCE)のための体積拡散フレームワークPHASORを紹介する。
我々は、CTボリュームをコヒーレントシーケンスとして扱うことにより、ビデオ拡散モデルを利用して、構造的コヒーレンスとボリューム精度を向上させる。
まず, 解剖学的意味論に固有の拡張パターンを固定し, 臓器特異的なメモリを付加して, より詳細な情報を収集する。
第二に、インテンシティ・フェイズ・アウェアメント・アライメント・アライメント(IP-REPA)は、不完全な空間アライメントの影響を緩和しつつ、複雑なコントラスト信号を強調する。
論文 参考訳(メタデータ) (2026-04-01T15:57:18Z) - FOSCU: Feasibility of Synthetic MRI Generation via Duo-Diffusion Models for Enhancement of 3D U-Nets in Hepatic Segmentation [10.129958145676412]
Duo-Diffusion は ControlNet を用いた3次元潜伏拡散モデルである。
高分解能で解剖学的にリアルな合成MRIボリュームと対応するセグメンテーションラベルを生成する。
空間的な一貫性と正確な解剖学的詳細を保証するために、セグメンテーション条件の拡散を用いる。
論文 参考訳(メタデータ) (2026-03-31T07:09:51Z) - Lung Nodule Image Synthesis Driven by Two-Stage Generative Adversarial Networks [3.735262910545115]
本稿では,合成データの多様性と空間的制御性を高めるために,TSGAN(二段階生成対向ネットワーク)を提案する。
第1段階では、StyleGANは、肺結節と組織背景をコードするセグメンテーションマスク画像を生成するために使用される。
第2段階では、DL-Pix2Pixモデルを使用してマスクマップをCT画像に変換する。
元のデータセットと比較すると、精度は4.6%向上し、mAPは4%向上した。
論文 参考訳(メタデータ) (2026-02-02T14:45:11Z) - Dual-Encoder Transformer-Based Multimodal Learning for Ischemic Stroke Lesion Segmentation Using Diffusion MRI [5.332404648315838]
ISLES 2022データセットからのマルチモーダル拡散MRIを用いて虚血性脳梗塞の分節について検討した。
U-Net、Swin-UNet、TransUNetなど、最先端の畳み込みとトランスフォーマーベースのアーキテクチャがベンチマークされている。
その結果、トランスフォーマーベースのモデルは畳み込みベースラインよりも優れており、提案したデュアルエンコーダのTransUNetは、テストセットで85.4%のDiceスコアに達した。
論文 参考訳(メタデータ) (2025-12-23T15:24:31Z) - Diffusion-Guided Mask-Consistent Paired Mixing for Endoscopic Image Segmentation [57.37991748282666]
本稿では, 試料混合と拡散合成の強度を融合した拡散誘導型パラダイムを提案する。
各実画像について、合成対を同じマスクの下で生成し、その対をマスク一貫性ペアドミキシング(MCPMix)の制御可能な入力として使用する。
これは、共有幾何学の下で合成および実際の外観を円滑にブリッジする中間サンプルの連続的な族を生成する。
論文 参考訳(メタデータ) (2025-11-05T06:14:19Z) - MedDiff-FT: Data-Efficient Diffusion Model Fine-tuning with Structural Guidance for Controllable Medical Image Synthesis [19.36433173105439]
MedDiff-FTは、拡散基盤モデルを微調整して、構造的依存性と領域特異性を持つ医用画像を生成する、制御可能な医用画像生成法である。
このフレームワークは、生成品質、多様性、計算効率を効果的にバランスさせ、医療データ拡張のための実用的なソリューションを提供する。
論文 参考訳(メタデータ) (2025-07-01T02:22:32Z) - MedSegFactory: Text-Guided Generation of Medical Image-Mask Pairs [29.350200296504696]
MedSegFactoryは、モダリティとタスクをまたいだペア化された医療画像とセグメンテーションマスクを生成する汎用的なフレームワークである。
既存のセグメンテーションツールを強化するためにイメージマスクペアを提供する、無制限のデータリポジトリとして機能することを目指している。
論文 参考訳(メタデータ) (2025-04-09T13:56:05Z) - Prototype Learning Guided Hybrid Network for Breast Tumor Segmentation in DCE-MRI [58.809276442508256]
本稿では,畳み込みニューラルネットワーク(CNN)とトランスフォーマー層を組み合わせたハイブリッドネットワークを提案する。
プライベートおよびパブリックなDCE-MRIデータセットの実験結果から,提案したハイブリッドネットワークは最先端の手法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-08-11T15:46:00Z) - ArSDM: Colonoscopy Images Synthesis with Adaptive Refinement Semantic
Diffusion Models [69.9178140563928]
大腸内視鏡検査は臨床診断や治療に不可欠である。
注釈付きデータの不足は、既存の手法の有効性と一般化を制限する。
本稿では, 下流作業に有用な大腸内視鏡画像を生成するために, 適応Refinement Semantic Diffusion Model (ArSDM)を提案する。
論文 参考訳(メタデータ) (2023-09-03T07:55:46Z) - MedSegDiff-V2: Diffusion based Medical Image Segmentation with
Transformer [53.575573940055335]
我々は、MedSegDiff-V2と呼ばれるトランスフォーマーベースの拡散フレームワークを提案する。
画像の異なる20種類の画像分割作業において,その有効性を検証する。
論文 参考訳(メタデータ) (2023-01-19T03:42:36Z) - Multifold Acceleration of Diffusion MRI via Slice-Interleaved Diffusion
Encoding (SIDE) [50.65891535040752]
本稿では,Slice-Interleaved Diffusionと呼ばれる拡散符号化方式を提案する。
SIDEは、拡散重み付き(DW)画像ボリュームを異なる拡散勾配で符号化したスライスでインターリーブする。
また,高いスライスアンサンプデータからDW画像を効果的に再構成するためのディープラーニングに基づく手法を提案する。
論文 参考訳(メタデータ) (2020-02-25T14:48:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。