論文の概要: XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems
- arxiv url: http://arxiv.org/abs/2606.14766v1
- Date: Mon, 08 Jun 2026 20:26:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.059937
- Title: XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems
- Title(参考訳): XMedFusion: 自律医療システムのための知識誘導型マルチモーダル知覚・推論フレームワーク
- Abstract要約: XMedFusionは、自律的な医療システムのためのインテリジェントな認識と推論モジュールとして設計されたモジュール型AIフレームワークである。
視覚知覚剤は、画像的根拠を抽出し、知識グラフ構築剤は、臨床的に関連した所見を構造化し、検索誘導起草プロセスは、一貫した報告構造を確保する。
合成剤は、推論駆動検証により視覚的および構造化された証拠を反復的に統合し、信頼性及び解釈可能な診断出力を生成する。
- 参考スコア(独自算出の注目度): 1.3531581769895988
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous medical and robotic systems increasingly rely on intelligent perception and reasoning capabilities to interpret visual data and support clinical decision making. Radiology report generation represents a critical component of such automated diagnostic workflows, yet existing end-to-end multimodal models often suffer from weak visual grounding, resulting in unreliable interpretations and omission of subtle clinical findings. This paper presents XMedFusion, a modular AI framework designed as an intelligent perception and reasoning module for autonomous medical systems. The proposed framework decomposes visual information into coordinated functional components that emulate expert-driven analysis, including a visual perception agent that extracts image-grounded evidence, a knowledge graph construction agent that structures clinically relevant findings, and a retrieval-guided drafting process that ensures a consistent reporting structure. A synthesis agent iteratively integrates visual and structured evidence through reasoning-driven verification to produce reliable and interpretable diagnostic outputs. Experimental evaluation on a public chest radiograph dataset demonstrates significant improvements over baseline vision-language models, achieving gains from 0.0493 to 0.3359 in BLEU-1, 0.0863 to 0.2440 in ROUGE-L, and 0.0829 to 0.1708 in METEOR, along with substantial improvements in semantic evaluation metrics such as Consistency (2.38 to 7.80) and Accuracy (2.34 to 6.93). The results highlight the effectiveness of structured multi-agent perception and reasoning for enhancing robustness, transparency, and automation in intelligent medical imaging systems, enabling integration into autonomous healthcare and robotic diagnostic workflows.
- Abstract(参考訳): 自律的な医療とロボットシステムは、視覚データを解釈し、臨床的意思決定をサポートするために、知的な知覚と推論能力にますます依存している。
放射線診断レポート生成は、このような自動診断ワークフローの重要な要素であるが、既存のエンドツーエンドのマルチモーダルモデルは、しばしば視覚的基盤の弱さに悩まされ、信頼性の低い解釈と微妙な臨床所見の欠如をもたらす。
本稿では,自律医療システムのためのインテリジェントな認識・推論モジュールとして設計されたモジュール型AIフレームワークであるXMedFusionを提案する。
提案フレームワークは,視覚情報を専門家主導型分析をエミュレートする協調機能成分に分解し,画像的根拠を抽出する視覚認知エージェント,臨床的に関連する知見を構造化する知識グラフ構築エージェント,一貫した報告構造を保証する検索誘導起案プロセスを含む。
合成剤は、推論駆動検証により視覚的および構造化された証拠を反復的に統合し、信頼性及び解釈可能な診断出力を生成する。
公共の胸部X線写真データセットによる実験では、ベースラインの視覚言語モデルに対する大幅な改善が示され、BLEU-1では0.0493から0.3359、ROUGE-Lでは0.0863から0.2440、METEORでは0.0829から0.1708に、一貫性(2.38から7.80)や精度(2.34から6.93)などの意味評価指標が大幅に改善された。
この結果は、インテリジェントな医療画像システムにおいて、構造化されたマルチエージェント認識と推論の有効性を強調し、堅牢性、透明性、自動化を強化し、自律的なヘルスケアとロボット診断ワークフローとの統合を可能にする。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - SMILE: Self-Explainable Multimodal Information Bottleneck for Medical Diagnosis [71.98702207668346]
説明可能性(Explainability)は、AIベースの診断、特に安全クリティカルな臨床的意思決定において、ますます重要な要件とみなされている。
本稿では,情報ボトルネック(IB)フレームワーク内で定式化することで,自己説明可能なマルチモーダル診断の問題に対処する。
本稿では,予測性能とモダリティ固有の説明可能性とを協調的に最適化する統合学習パラダイムを提案する。
論文 参考訳(メタデータ) (2026-09-04T14:13:24Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering [1.4413073343064953]
MedXplain-VQAは、5つの説明可能なAIコンポーネントを統合し、解釈可能な医療画像分析を提供する包括的フレームワークである。
このフレームワークは、細調整されたBLIP-2バックボーン、医療クエリの修正、Grad-CAMの注意の強化、正確な領域抽出、マルチモーダル言語モデルによる構造的連鎖推論を活用する。
論文 参考訳(メタデータ) (2025-10-26T19:23:20Z) - Deep Learning-Based Pneumonia Detection from Chest X-ray Images: A CNN Approach with Performance Analysis and Clinical Implications [0.0]
胸部X線画像から自動的に肺炎を検出するために,Conal Neural Networksを用いた複雑なディープラーニングシステムを提案する。
提案したCNNアーキテクチャは,分離可能な畳み込みやバッチ正規化,ドロップアウト正規化といった高度な手法を統合している。
精度、精度、リコール、F1スコアなどの複雑な評価指標の配列は、精度91の精度を記録して、モデル例外性能を総合的に検証する。
論文 参考訳(メタデータ) (2025-09-26T11:58:50Z) - Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation [0.0]
本稿では,視覚言語モデル(VLM)を活用した医用画像解析のためのインテリジェントマルチモーダルフレームワークを提案する。
このフレームワークはGoogle Gemini 2.5 Flashを統合し、腫瘍を自動的に検出し、CT、MRI、X線、超音波などの複数の画像モダリティで臨床報告を生成する。
論文 参考訳(メタデータ) (2025-09-16T23:15:44Z) - Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications [59.721265428780946]
医学における大きな言語モデル(LLM)は印象的な能力を実現しているが、体系的で透明で検証可能な推論を行う能力に重大なギャップが残っている。
本稿は、この新興分野に関する最初の体系的なレビューを提供する。
本稿では,学習時間戦略とテスト時間メカニズムに分類した推論強化手法の分類法を提案する。
論文 参考訳(メタデータ) (2025-08-01T14:41:31Z) - RadFabric: Agentic AI System with Reasoning Capability for Radiology [61.25593938175618]
RadFabricは、総合的なCXR解釈のための視覚的およびテキスト分析を統合するマルチエージェント、マルチモーダル推論フレームワークである。
システムは、病理診断に特殊なCXRエージェント、正確な解剖学的構造に視覚所見をマッピングする解剖学的解釈エージェント、および視覚的、解剖学的、臨床データを透明かつ証拠に基づく診断に合成する大規模なマルチモーダル推論モデルを利用した推論エージェントを使用する。
論文 参考訳(メタデータ) (2025-06-17T03:10:33Z) - CBM-RAG: Demonstrating Enhanced Interpretability in Radiology Report Generation with Multi-Agent RAG and Concept Bottleneck Models [1.7042756021131187]
本稿では,CBM(Concept Bottleneck Models)とRAG(Multi-Agent Retrieval-Augmented Generation)システムを組み合わせた自動放射線学レポート生成フレームワークを提案する。
CBMは胸部X線の特徴を人間の理解できない臨床概念にマッピングし、透明な疾患分類を可能にする。
RAGシステムはマルチエージェントのコラボレーションと外部知識を統合し、文脈的にリッチなエビデンスベースのレポートを生成する。
論文 参考訳(メタデータ) (2025-04-29T16:14:55Z) - Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding [72.18719355481052]
MRG(Messical Report Grounding)と呼ばれる新しい課題について紹介する。
MRGは医療報告から診断フレーズとその対応する接地箱を直接エンドツーエンドで識別することを目的としている。
マルチモーダルな大規模言語モデルを用いて診断フレーズを予測する,堅牢で信頼性の高いフレームワークである uMedGround を提案する。
論文 参考訳(メタデータ) (2024-04-10T07:41:35Z) - A Transformer-based representation-learning model with unified
processing of multimodal input for clinical diagnostics [63.106382317917344]
本稿では,マルチモーダル入力を統一的に処理する臨床診断支援として,トランスフォーマーを用いた表現学習モデルについて報告する。
統一モデルは, 肺疾患の同定において, 画像のみのモデル, 非統一型マルチモーダル診断モデルより優れていた。
論文 参考訳(メタデータ) (2023-06-01T16:23:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。