論文の概要: MedVA: An End-to-End Neuro-Symbolic Agentic System for Medical Volume Visualization
- arxiv url: http://arxiv.org/abs/2609.14874v1
- Date: Mon, 14 Sep 2026 00:48:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.021968
- Title: MedVA: An End-to-End Neuro-Symbolic Agentic System for Medical Volume Visualization
- Title(参考訳): MedVA:医療用ボリューム可視化のためのエンド・ツー・エンド型ニューロシンボリックエージェントシステム
- Abstract要約: MedVA(メドバ)は、医療用容積可視化のためのエンドツーエンドのニューロシンボリック・エージェントシステムである。
3つの相補的エージェントによる制限に対処する。
- 参考スコア(独自算出の注目度): 8.890017714053098
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Medical volume visualization requires selecting regions of interest (ROIs) and carefully controlling their relative visual emphasis according to a given clinical intent. Implementing these decisions in conventional workflows demands substantial clinical and visualization expertise and often involves trial-and-error optimization. Recent agentic systems have introduced natural-language interaction and autonomous visualization operations but largely rely on MLLM-based inference throughout the workflow. Although MLLMs encode broad medical knowledge and provide strong reasoning capabilities, such inference may be suboptimal for medical volume visualization, potentially leading to clinically incomplete interpretations of user requests and unreliable ROI identification and visualization optimization. In this work, we present MedVA, an end-to-end neuro-symbolic agentic system for medical volume visualization that addresses these limitations through three complementary agents. The neuro-symbolic intent formulation agent refines MLLM-based interpretations of natural-language requests through symbolic reasoning over established clinical knowledge, which provides more complete, clinically grounded ROI specifications than MLLM-only reasoning. The multi-model ROI identification agent directly identifies semantically specified ROIs in the original volume by leveraging complementary large-scale pretrained medical segmentation models. The objective-driven visualization optimization agent explicitly evaluates ROI visibility and occlusion in the original volume using a volume-based visibility objective. Extensive agent-level and system-level evaluations across diverse medical datasets and interaction scenarios support the effectiveness of the individual agents. A formative user study further indicates high usability and practical value among users with different levels of expertise.
- Abstract(参考訳): 医学的ボリュームの可視化には、興味のある領域(ROI)を選択し、与えられた臨床意図に従って相対的な視覚的強調を慎重に制御する必要がある。
従来のワークフローでこれらの決定を実装するには、かなりの臨床と視覚化の専門知識が必要で、しばしば試行錯誤の最適化が伴う。
近年のエージェントシステムは自然言語インタラクションと自律的な可視化操作を導入しているが、ワークフロー全体を通してMLLMベースの推論に大きく依存している。
MLLMは幅広い医療知識をエンコードし、強力な推論能力を提供するが、そのような推論は医療ボリュームの可視化に最適であり、ユーザ要求の臨床的に不完全な解釈と信頼性の低いROI識別と可視化の最適化につながる可能性がある。
本研究は,3つの相補的エージェントを通してこれらの制限に対処する医療ボリューム可視化のための,エンドツーエンドのニューロシンボリックエージェントシステムであるMedVAについて述べる。
本発明のニューロシンボリック・インテント・フォーミュレーション・エージェントは、MLLMのみの推論よりも完全な臨床基礎のROI仕様を提供する、確立された臨床知識に対する象徴的推論を通じて、MLLMに基づく自然言語要求の解釈を洗練する。
多モデルROI識別エージェントは、相補的な大規模事前訓練医療セグメンテーションモデルを利用して、元のボリュームで意味的に特定されたROIを直接識別する。
目的駆動可視化最適化エージェントは、ボリュームベースの可視化目標を用いて、元のボリュームにおけるROIの可視性と閉塞性を明確に評価する。
多様な医療データセットと相互作用シナリオにわたる広範囲なエージェントレベルおよびシステムレベルの評価は、個々のエージェントの有効性を支持する。
フォーマティブなユーザスタディは、異なるレベルの専門知識を持つユーザの間で、高いユーザビリティと実践的価値を示す。
関連論文リスト
- Volumetric Radiology AI in the Era of Multimodal Large Language Models [62.95443321443533]
ボリュームラジオロジーは、基本的な表現ミスマッチを示します。
現在の大言語モデル(MLLM)は、選択された2次元(2次元)画像、圧縮された視覚表現、またはレポート由来のテキストに条件付けされている。
信頼性の高い放射線学 AIは、タスクに関連する3D情報と、これらの情報にアクセスし、検証し、統合できるシステムを保存する表現を必要とする。
論文 参考訳(メタデータ) (2026-08-20T20:23:41Z) - Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis [4.619078510367921]
クリニック・ミメティックは、差別的模範的コアセット選択(DECS)と自己修正経験要約(SRES)を相乗化するために設計された新しいインコンテキスト・ラーニング(ICL)フレームワークである。
DECSは、ノイズデータから識別的視覚コアセットを計算レベルで選択することで、臨床医の「アンカーケース」を参照する能力をシミュレートする。
SRESは、多様なロールアウトを動的テキスト体験銀行に蒸留することにより、臨床診断における認知と反射を模倣する。
論文 参考訳(メタデータ) (2026-03-29T15:29:59Z) - MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning [52.064286116035134]
我々はMed-VQA(Med-VQA)のための視覚的LVLM応答を保証するフレームワークであるMedAlignを開発した。
まず、優先学習を視覚的コンテキストに合わせるために、マルチモーダルな直接選好最適化(mDPO)の目的を提案する。
次に、画像とテキストの類似性を生かし、クエリを専門的でコンテキスト拡張されたLVLMにルーティングする検索型混合処理(RA-MoE)アーキテクチャを設計する。
論文 参考訳(メタデータ) (2025-10-24T02:11:05Z) - EndoAgent: A Memory-Guided Reflective Agent for Intelligent Endoscopic Vision-to-Decision Reasoning [6.96058549084651]
EndoAgentは、視覚から決定への内視鏡分析のためのメモリ誘導剤である。
反復推論と適応的なツールの選択とコラボレーションを統合する。
一般的なマルチモーダルモデルと医療用マルチモーダルモデルの両方を一貫して上回っている。
論文 参考訳(メタデータ) (2025-08-10T11:02:57Z) - AURA: A Multi-Modal Medical Agent for Understanding, Reasoning & Annotation [0.8397730500554048]
AURAは、医用画像の包括的分析、説明、評価のために特別に設計された最初の視覚的言語説明性エージェントである。
AURAは、より透明性があり、適応可能で、臨床的に整合したAIシステムに向けた大きな進歩を示している。
論文 参考訳(メタデータ) (2025-07-22T18:24:18Z) - EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis [62.00431604976949]
EndoBenchは、内視鏡的プラクティスの全スペクトルにわたるMLLMを評価するために特別に設計された最初の包括的なベンチマークである。
我々は、汎用、医療特化、プロプライエタリMLLMを含む23の最先端モデルをベンチマークする。
私たちの実験では、プロプライエタリなMLLMは、オープンソースや医療専門のモデルよりも優れていますが、それでも人間の専門家を追い越しています。
論文 参考訳(メタデータ) (2025-05-29T16:14:34Z) - MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models [0.0]
医療大言語モデル(MLLM)は医療応用の可能性を示している。
幻覚に対する寛容性は、患者医療に重大なリスクをもたらす。
本稿では,MLLMにおける幻覚の評価と緩和のためのベンチマークフレームワークであるMedHallBenchを紹介する。
論文 参考訳(メタデータ) (2024-12-25T16:51:29Z) - A Survey of Medical Vision-and-Language Applications and Their Techniques [48.268198631277315]
医療ビジョン・アンド・ランゲージモデル(MVLM)は、複雑な医療データを解釈するための自然言語インタフェースを提供する能力から、大きな関心を集めている。
本稿では,MVLMの概要と適用した各種医療課題について概観する。
また、これらのタスクに使用するデータセットについても検討し、標準化された評価指標に基づいて異なるモデルの性能を比較した。
論文 参考訳(メタデータ) (2024-11-19T03:27:05Z) - Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering [70.44269982045415]
Retrieval-augmented Generation (RAG) は,大規模言語モデル (LLM) の性能向上のための有望なアプローチとして登場した。
医療用QAデータセットに様々な補助的要素を提供するMedRGB(MedRGB)を導入する。
実験結果から,検索した文書のノイズや誤情報の処理能力に限界があることが判明した。
論文 参考訳(メタデータ) (2024-11-14T06:19:18Z) - Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding [92.32881381717594]
医療情報抽出タスクにおける幻覚の問題を解決するために,ALCD(ALternate Contrastive Decoding)を導入する。
ALCDは, 従来の復号法に比べて幻覚の解消に有意な改善が見られた。
論文 参考訳(メタデータ) (2024-10-21T07:19:19Z) - End-to-End Breast Cancer Radiotherapy Planning via LMMs with Consistency Embedding [47.360760580820966]
放射線腫瘍学の分野に適した包括的大規模マルチモーダルモデル(LMM)であるRO-LMMを提案する。
このモデルは臨床ワークフロー内の一連のタスクを効果的に管理し、臨床コンテキストの要約、放射線治療計画の提案、計画誘導されたターゲットボリュームセグメンテーションを含む。
クリーン入力処理の整合性を維持しつつ,LMMのノイズ入力に対する堅牢性を向上する,CEFTune(Consistency Embedding Fine-Tuning)技術を提案する。
論文 参考訳(メタデータ) (2023-11-27T14:49:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。