論文の概要: MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion
- arxiv url: http://arxiv.org/abs/2607.28565v1
- Date: Thu, 30 Jul 2026 17:30:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.691921
- Title: MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion
- Title(参考訳): MIND:医療画像融合のための拡散変換器によるマルチモーダルインテント駆動ネットワーク
- Abstract要約: 医用画像融合は、様々な画像モダリティからの補完情報を統合して臨床診断を支援することを目的としている。
医用画像融合のためのDiffusion Transformers (DiT) を用いたマルチモーダルインテント駆動ネットワーク MIND を提案する。
MINDはより優れた融合品質を提供し、下流脳腫瘍のセグメンテーション精度を大幅に改善し、フレキシブルな相互融合を可能にする。
- 参考スコア(独自算出の注目度): 9.316249658450124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical image fusion aims to integrate complementary information from diverse imaging modalities to support clinical diagnosis. Existing methods typically apply uniform fusion rules globally, lacking a deep understanding of diagnostic intents and pathological structures. To address these limitations, we propose MIND, a Multimodal Intent-Driven Network via Diffusion Transformers (DiTs) for medical image fusion. Specifically, we utilize BioMedGPT to generate intent-driven fusion texts from source images, guiding the fusion process with pathology-aware diagnostic intents. To combat the loss of 2D spatial continuity caused by 1D sequence flattening in DiTs, we design a Multi-scale Latent Adapter. This module explicitly extracts source image features before serialization, injecting them into the network via strict dimensional alignment to effectively supplement image features. To resolve the semantic shift caused by decoupling image outputs from diagnostic intents, we design a medical semantic consistency loss. This loss ensures deep semantic locking between fused images and fusion texts while maintaining the stability of the underlying physical manifold reconstruction. Comprehensive experiments on the Harvard, BraTS, and GFP datasets reveal that MIND delivers superior fusion quality, significantly improves downstream brain tumor segmentation accuracy, and enables flexible interactive fusion, holding significant promise for intent-driven intelligent clinical decision support systems.
- Abstract(参考訳): 医用画像融合は、様々な画像モダリティからの補完情報を統合して臨床診断を支援することを目的としている。
既存の方法では、診断意図や病理構造を深く理解していないため、世界中に均一な融合規則を適用するのが一般的である。
これらの制約に対処するため,Diffusion Transformers (DiT) による医用画像融合のためのマルチモーダルインテント駆動ネットワーク MIND を提案する。
具体的には、BioMedGPTを用いて、ソース画像からインテント駆動型融合テキストを生成し、その融合過程を病理診断意図で導く。
DiTの1次元配列平坦化による2次元空間連続性の損失に対処するため,マルチスケールラテントアダプタを設計した。
このモジュールは、直列化前のソース画像の特徴を明示的に抽出し、厳密な次元アライメントを通じてネットワークに注入し、画像の特徴を効果的に補完する。
診断意図から画像出力を分離することで生じる意味変化を解決するために,医用意味一貫性損失を設計する。
この損失は、基礎となる物理多様体再構成の安定性を維持しつつ、融合画像と融合テキスト間の深いセマンティックロックを保証する。
Harvard、BraTS、GFPデータセットに関する総合的な実験によると、MINDはより優れた融合品質を提供し、下流の脳腫瘍のセグメンテーション精度を大幅に改善し、フレキシブルなインタラクティブな融合を可能にし、インテント駆動のインテリジェントな臨床診断支援システムに対する大きな約束を果たす。
関連論文リスト
- AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication [61.10547481840624]
強力なマルチモーダル画像融合モデルは、高品質で臨床的に代表されるマルチモーダルトレーニングデータに依存している。
現在の画像融合モデルは、知的財産権を保護するための機構を組み込まずに融合出力を生成する。
組込み認証を用いた最初の認可可能な医用画像融合モデルであるAMIFを提案する。
論文 参考訳(メタデータ) (2026-03-25T13:34:22Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach [99.80480649258557]
DiTFuseは命令駆動のフレームワークで、単一のモデル内でセマンティクスを意識した融合を実行する。
パブリックなIVIF、MFF、MEFベンチマークの実験では、より優れた量的および質的な性能、よりシャープなテクスチャ、より優れたセマンティック保持が確認されている。
論文 参考訳(メタデータ) (2025-12-08T05:04:54Z) - DM-FNet: Unified multimodal medical image fusion via diffusion process-trained encoder-decoder [13.87371547830489]
マルチモーダル医用画像融合(MMIF)は複数のソース画像から最も有意義な情報を抽出する。
既存のMMIF法は、従来の訓練中に詳細な特徴を捉える能力に制限がある。
本研究では,2段階拡散モデルに基づく融合ネットワーク(DM-FNet)を提案する。
論文 参考訳(メタデータ) (2025-06-18T07:55:06Z) - SMFusion: Semantic-Preserving Fusion of Multimodal Medical Images for Enhanced Clinical Diagnosis [11.356721356096564]
医用先行知識を融合プロセスに組み込んだ,意味誘導型医用画像融合手法を提案する。
融合画像から診断報告を生成し,医療情報の保存性を評価する。
実験結果から, 定性評価と定量的評価の両方において, 提案手法が優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-05-18T06:15:00Z) - FusionINN: Decomposable Image Fusion for Brain Tumor Monitoring [6.45135260209391]
本稿では,新しい分解可能な画像融合フレームワークFusionINNを紹介する。
融合画像の分解可能性について初めて検討する。
我々のアプローチは、高速で質的に優れた融合結果を提供する。
論文 参考訳(メタデータ) (2024-03-23T08:54:03Z) - A New Multimodal Medical Image Fusion based on Laplacian Autoencoder
with Channel Attention [3.1531360678320897]
ディープラーニングモデルは、非常に堅牢で正確なパフォーマンスでエンドツーエンドの画像融合を実現した。
ほとんどのDLベースの融合モデルは、学習可能なパラメータや計算量を最小限に抑えるために、入力画像上でダウンサンプリングを行う。
本稿では,ラープラシア・ガウス統合とアテンションプールを融合したマルチモーダル医用画像融合モデルを提案する。
論文 参考訳(メタデータ) (2023-10-18T11:29:53Z) - Three-Dimensional Medical Image Fusion with Deformable Cross-Attention [10.26573411162757]
マルチモーダル医療画像融合は、医療画像処理のいくつかの領域において重要な役割を担っている。
従来の融合法は、特徴を組み合わせて融合像を再構成する前に、それぞれのモダリティを独立して処理する傾向にある。
本研究では,これらの制限を是正するために設計された,革新的な教師なしの相互学習融合ネットワークを提案する。
論文 参考訳(メタデータ) (2023-10-10T04:10:56Z) - Equivariant Multi-Modality Image Fusion [124.11300001864579]
エンドツーエンドの自己教師型学習のための同変多モードImAge融合パラダイムを提案する。
我々のアプローチは、自然画像応答が特定の変換に等しくなるという以前の知識に根ざしている。
実験により、EMMAは赤外線可視画像と医用画像に高品質な融合結果をもたらすことが確認された。
論文 参考訳(メタデータ) (2023-05-19T05:50:24Z) - MedSegDiff-V2: Diffusion based Medical Image Segmentation with
Transformer [53.575573940055335]
我々は、MedSegDiff-V2と呼ばれるトランスフォーマーベースの拡散フレームワークを提案する。
画像の異なる20種類の画像分割作業において,その有効性を検証する。
論文 参考訳(メタデータ) (2023-01-19T03:42:36Z) - An Attention-based Multi-Scale Feature Learning Network for Multimodal
Medical Image Fusion [24.415389503712596]
マルチモーダル医療画像は、医師が診断する患者についての豊富な情報を提供する可能性がある。
画像融合技術は、マルチモーダル画像からの補完情報を単一の画像に合成することができる。
医用画像融合タスクのための新しいDilated Residual Attention Networkを提案する。
論文 参考訳(メタデータ) (2022-12-09T04:19:43Z) - CoCoNet: Coupled Contrastive Learning Network with Multi-level Feature Ensemble for Multi-modality Image Fusion [68.78897015832113]
我々は、赤外線と可視画像の融合を実現するために、CoCoNetと呼ばれるコントラスト学習ネットワークを提案する。
本手法は,主観的評価と客観的評価の両面において,最先端(SOTA)性能を実現する。
論文 参考訳(メタデータ) (2022-11-20T12:02:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。