論文の概要: MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support
- arxiv url: http://arxiv.org/abs/2607.01814v1
- Date: Thu, 02 Jul 2026 07:30:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.721441
- Title: MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support
- Title(参考訳): MMIR-TCM : TCM臨床診断支援のためのメモリ集約型マルチモーダル推論と検索
- Authors: Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, Peiwu Qin,
- Abstract要約: MMIR-TCMは,マルチモーダル大言語モデル(MLLM)とメモリ拡張セグメンテーションと検索拡張生成(RAG)を統合することで,TCM専門家の診断プロセスをエミュレートする新しいフレームワークである。
MMIR-TCMは、頑健な舌抽出のためのトレーニングフリーメモリSAMモジュール、構造化舌診断生成のための微調整Qwen3-VLモデル、エビデンス的な臨床診断支援生成のためのQwen3ベースのRAGコンポーネントを統合する。
我々の総合実験により、MMIR-TCMはGPT-4oやGemini 2.5 Flashなど、主要なモデルよりも大幅に優れていることが示された。
- 参考スコア(独自算出の注目度): 8.51059118378796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Traditional Chinese Medicine (TCM) diagnosis, particularly through tongue inspection, faces persistent challenges in subjectivity and reproducibility. The application of multimodal artificial intelligence to TCM clinical tasks, such as syndrome differentiation and prescription generation, is significantly hampered by the semantic gap between visual tongue features and textual reasoning, as well as the lack of large-scale, standardized datasets. To address these challenges, we introduce MMIR-TCM, a novel framework that emulates the diagnostic process of TCM experts by integrating multimodal large language model(MLLM) with memory-augmented segmentation and retrieval-augmented generation (RAG). Employing a three-stage architecture, MMIR-TCM integrates a training-free Memory-SAM module for robust tongue extraction, a fine-tuned Qwen3-VL model for structured tongue diagnosis generation, and a Qwen3-based RAG component for evidence-grounded clinical decision support generation. The framework was developed and validated using MedTCM, a new large-scale multimodal dataset that we introduce specifically for advanced TCM research. To properly evaluate our framework's clinical accuracy, which existing metrics fail to capture, we also developed TDEU, a domain-specific evaluation metric incorporating semantic understanding and diagnostic importance. Our comprehensive experiments demonstrate that MMIR-TCM significantly outperforms leading models, including GPT-4o and Gemini 2.5 Flash.
- Abstract(参考訳): 伝統的な中国医学(TCM)の診断は、特に舌検査を通して、主観性と再現性において永続的な課題に直面している。
マルチモーダル人工知能のTCM臨床への応用は、視覚舌の特徴とテキスト推論のセマンティックなギャップや、大規模で標準化されたデータセットの欠如によって著しく妨げられている。
MMIR-TCMは,マルチモーダル大言語モデル(MLLM)とメモリ拡張セグメンテーションと検索拡張生成(RAG)を統合することで,TCM専門家の診断プロセスをエミュレートする新しいフレームワークである。
3段階アーキテクチャを用いて、MMIR-TCMは、頑健な舌抽出のためのトレーニングフリーのMemory-SAMモジュール、構造化舌診断のための微調整Qwen3-VLモデル、エビデンス的な臨床診断支援のためのQwen3ベースのRAGコンポーネントを統合する。
本フレームワークは,大規模マルチモーダルデータセットであるMedTCMを用いて開発,検証し,先進的なTCM研究に特化して導入した。
既存の指標が捉えられていないフレームワークの臨床精度を適切に評価するために,意味的理解と診断の重要性を取り入れたドメイン固有の評価指標であるTDEUを開発した。
GPT-4o や Gemini 2.5 Flash など,MMIR-TCM が先行するモデルよりも優れていることを示す総合的な実験を行った。
関連論文リスト
- MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement [63.82954136824963]
医療ビジョンランゲージモデルでは、現実世界のシナリオで必要とされる複雑な臨床推論を伴う知覚タスクが優れている。
本稿ではドメイン固有の適応とガイドライン強化を通じてこれらの課題に対処する新しい推論MedVLMを提案する。
論文 参考訳(メタデータ) (2026-01-16T02:32:07Z) - TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation [56.09179939570486]
本稿では,パラメータ効率,タスク固有適応に着目したCLIPベースのフレームワークであるTGC-Netを提案する。
TGC-Netは、挑戦的なベンチマークで顕著なDiceゲインを含む、トレーニング可能なパラメータをかなり少なくして、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-24T12:06:26Z) - A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models [2.5287456399381494]
漢方医学領域における大規模言語モデル(LLM)は,臨床応用能力の評価を急務に行う必要がある。
既存のベンチマークは知識に基づく質問応答や、シンドロームの判別の精度に限られている。
本稿では,TCMの専門家が先導した包括的,臨床ケースベースベンチマークと,処方のシンドロームの一致を定量化するための特別報酬モデルを提案する。
論文 参考訳(メタデータ) (2025-12-02T14:26:44Z) - TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine [11.944521938566231]
大規模言語モデル(LLM)は、一般的なドメインにおいて例外的な能力を示してきたが、伝統的な中国医学(TCM)のような高度に専門的で文化的に豊かな分野に適用するには厳密な評価が必要である。
TCM-5CEvalは、(1)コア知識(TCM-seek)、(2)古典リテラシー(TCM-LitQA)、(3)臨床意思決定(TCM-MRCD)、(4)中国マテリアメディカ(TCM-CMM)、(5)臨床非薬物療法(TCM-ClinNPT)の5つの重要な側面にわたるLCMを評価するように設計されている。
論文 参考訳(メタデータ) (2025-11-17T09:15:41Z) - TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine [51.01817637808011]
我々は,中国伝統医学(TCM)の最初のダイナミックで高品質なベンチマークであるTCM-Evalを紹介する。
大規模トレーニングコーパスを構築し,SI-CoTE(Self-Iterative Chain-of-Thought Enhancement)を提案する。
このリッチなトレーニングデータを用いて,TCM用に特別に設計された最先端LLMであるZhiMingTang(ZMT)を開発した。
論文 参考訳(メタデータ) (2025-11-10T14:35:25Z) - RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis [56.373297358647655]
Retrieval-Augmented Diagnosis (RAD)は、下流タスクで直接マルチモーダルモデルに外部知識を注入する新しいフレームワークである。
RADは、複数の医療ソースからの疾患中心の知識の検索と改善、ガイドライン強化コントラスト損失トランスフォーマー、デュアルデコーダの3つの主要なメカニズムで機能する。
論文 参考訳(メタデータ) (2025-09-24T10:36:14Z) - ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine [53.91744478760689]
我々は、中国伝統医学(TCM)に適した最初の多モーダル言語モデルであるシージエンGPTを提示する。
シッシェンGPTは、深いTCM知識とマルチモーダル推論を達成するために、事前訓練され、訓練されている。
実験によると、ShizhenGPTはLLMよりも優れており、より大きなプロプライエタリモデルと競合する。
論文 参考訳(メタデータ) (2025-08-20T13:30:20Z) - TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine [10.74071774496229]
大規模言語モデル (LLMs) は, 様々なNLPタスクや現代医学に優れるが, 伝統的な漢方医学(TCM)における評価は過小評価されている。
そこで本研究では,TCM における LLM の評価を行うベンチマークである TCM3CEval について紹介する。
全てのモデルはメリディアン・アンド・アクポイント理論や様々なTCMスクールのような特殊性に制限があり、現在の能力と臨床ニーズのギャップを明らかにする。
論文 参考訳(メタデータ) (2025-03-10T08:29:15Z) - BianCang: A Traditional Chinese Medicine Large Language Model [33.738284400742124]
そこで本研究では,まずドメイン固有知識を注入し,まず目標刺激によって調整し,診断と識別能力を向上させる,TCM固有の大規模言語モデルであるBianCangを提案する。
実際の病院記録に基づく事前学習コーパス,ChP-TCMデータセット,および中華人民共和国の薬局類由来のChP-TCMデータセットを構築した。
我々は,TCMと医用コーパスを総合的に収集し,TCMの理解を深めるための包括的データセットを構築した。
論文 参考訳(メタデータ) (2024-11-17T10:17:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。