論文の概要: Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
- arxiv url: http://arxiv.org/abs/2604.08815v1
- Date: Thu, 09 Apr 2026 23:09:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.609133
- Title: Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
- Title(参考訳): コンテキスト適応型ビジョンランゲージモデルによる責任あるマルチモーダル医療推論に向けて
- Authors: Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi,
- Abstract要約: 医用視覚言語モデル (VLM) は放射線学のタスクにおいて強い性能を示すが、しばしば流動的だが弱弱な結論をもたらす。
我々は、診断結果を生成する前に、異種の臨床的証拠間での合意を強制する文脈整合推論フレームワークを導入する。
- 参考スコア(独自算出の注目度): 11.019570079187552
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical vision-language models (VLMs) show strong performance on radiology tasks but often produce fluent yet weakly grounded conclusions due to over-reliance on a dominant modality. We introduce a context-aligned reasoning framework that enforces agreement across heterogeneous clinical evidence before generating diagnostic conclusions. The proposed approach augments a frozen VLM with structured contextual signals derived from radiomic statistics, explainability activations, and vocabulary-grounded semantic cues. Instead of producing free-form responses, the model generates structured outputs containing supporting evidence, uncertainty estimates, limitations, and safety notes. We observe that auxiliary signals alone provide limited benefit; performance gains emerge only when these signals are integrated through contextual verification. Experiments on chest X-ray datasets demonstrate that context alignment improves discriminative performance (AUC 0.918 to 0.925) while maintaining calibrated uncertainty. The framework also substantially reduces hallucinated keywords (1.14 to 0.25) and produces more concise reasoning explanations (19.4 to 15.3 words) without increasing model confidence (0.70 to 0.68). Cross-dataset evaluation on CheXpert further reveals that modality informativeness significantly influences reasoning behavior. These results suggest that enforcing multi-evidence agreement improves both reliability and trustworthiness in medical multimodal reasoning, while preserving the underlying model architecture.
- Abstract(参考訳): 医用視覚言語モデル(VLM)は、放射線学のタスクにおいて強い性能を示すが、支配的なモダリティへの過度な依存のため、しばしば流動的だが弱い基礎的な結論をもたらす。
我々は、診断結果を生成する前に、異種の臨床的証拠間での合意を強制する文脈整合推論フレームワークを導入する。
提案手法は, 放射能統計, 説明可能性アクティベーション, ボキャブラリ-グラウンドド・セマンティック・キューから導かれる構造化された文脈信号を用いて, 凍結VLMを増強する。
自由形式の応答を生成する代わりに、モデルは、支持された証拠、不確実性推定、制限、安全ノートを含む構造化された出力を生成する。
これらの信号がコンテキスト検証によって統合された場合にのみ、性能が向上する。
胸部X線データセットの実験では、コンテキストアライメントは、校正された不確実性を保ちながら、識別性能(AUC 0.918から0.925)を向上させることが示されている。
このフレームワークはまた、幻覚キーワード(1.14から0.25)を大幅に削減し、モデルの信頼性を増すことなくより簡潔な推論説明(19.4から15.3語)を生成する(0.70から0.68)。
CheXpertのクロスデータセット評価は、モダリティ情報性が推論行動に大きく影響することを明らかにする。
これらの結果は,マルチエビデンス合意の実施は,基礎となるモデルアーキテクチャを維持しつつ,医療マルチモーダル推論における信頼性と信頼性の両方を改善することを示唆している。
関連論文リスト
- A Reasoning-Enabled Vision-Language Foundation Model for Chest X-ray Interpretation [48.23500302185585]
CXR解釈のための推論可能な視覚言語モデルであるCheXOneを提案する。
CheXOneは、診断予測と明示的で臨床的に根拠付けられた推論トレースを共同で生成する。
55%のケースでは,CheXOneドラフトレポートは常駐レポートと同等かそれ以上であることがわかった。
論文 参考訳(メタデータ) (2026-04-01T05:19:09Z) - MedCausalX: Adaptive Causal Reasoning with Self-Reflection for Trustworthy Medical Vision-Language Models [10.466505116993451]
既存の医療連鎖モデルには因果推論を表現・強制するための明確なメカニズムが欠如している。
MedCausalXは医療用VLMの因果推論チェーンを明示的にモデル化したエンドツーエンドフレームワークである。
我々は,MedCausalXが常に最先端の手法より優れ,診断の整合性は+5.4ポイント向上し,幻覚は10ポイント以上減少し,最上位の空間接地IoUに達することを示す。
論文 参考訳(メタデータ) (2026-03-24T11:28:15Z) - INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs [69.11382230669491]
ビデオ証拠(忠実さ)または検証可能な世界知識(事実性)のどちらかに矛盾する結果である幻覚
textscINFACTは、4つのモードでモデルを評価する。
14の代表的なビデオ-LLMの実験では、高ベースモード精度が誘導モードの信頼性に確実に変換されないことが明らかになった。
論文 参考訳(メタデータ) (2026-03-12T03:03:16Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis [29.630872344186873]
インタラクティブな医療相談は、エージェントが不確実性の下で行方不明な臨床証拠を積極的に引き出す必要がある。
既存の評価の大部分は静的あるいは結果中心であり、エビデンス収集プロセスを無視している。
シミュレーションされた患者と、原子的証拠に基づく再現されたレポーターを用いて、コンサルテーションプロセスを明示的にモデル化するインタラクティブな評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:36:35Z) - Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning [16.243806723551454]
医用視覚言語モデル(VLM)は,診断報告や画像テキストアライメントにおいて高い性能を発揮する。
その根底にある推論機構は、基本的に相関関係にあり、表面的な統計的関連に頼っている。
因果推論の原理とマルチモーダル検索を統合するフレームワークであるMultimodal Causal Retrieval-Augmented Generationを提案する。
論文 参考訳(メタデータ) (2026-01-26T11:03:00Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation [97.36081721024728]
本稿では,現実的な医療相談におけるマルチターンインタラクションの信頼性を評価するための最初のベンチマークを提案する。
本ベンチマークでは,3種類の医療データを統合し,診断を行う。
本稿では,エビデンスを基盤とした言語自己評価フレームワークであるMedConfを紹介する。
論文 参考訳(メタデータ) (2026-01-22T04:51:39Z) - Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting [37.57009831483529]
MLLM(Multimodal Large Language Models)は放射線学レポート生成に強い可能性を示している。
本フレームワークは, より詳細な発見のための思考ブロックと, 構造化された疾患ラベルに対する回答ブロックという, 生成を2つの異なる構成要素に再構成する。
論文 参考訳(メタデータ) (2026-01-06T14:17:44Z) - Decoupling Clinical and Class-Agnostic Features for Reliable Few-Shot Adaptation under Shift [12.373281238541296]
医療ビジョン言語モデル(VLM)は、臨床診断支援を約束するが、分布シフトによる信頼性は、安全なデプロイメントにとって大きな関心事である。
そこで我々はDRiFtを提案する。DRiFtは機能分離フレームワークで、臨床的に関連する信号をタスク非依存のノイズから明確に分離する。
提案手法は,従来のプロンプトベースの手法に比べて,Top-1精度+11.4%,Macro-F1+3.3%向上する。
論文 参考訳(メタデータ) (2025-09-11T12:26:57Z) - GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning [60.03671205298294]
医学的視覚的質問応答は、医学的イメージに基づいた自然言語的質問にモデルで答えることによって、臨床的な意思決定を支援することを目的としている。
現在の方法はまだ、答えの信頼性の制限と解釈性の低下に悩まされている。
この研究はまず、回答を生成するプロセスが中間的推論ステップのシーケンスに先行する領域対応マルチモーダル・チェーン・オブ・ソートデータセットを提案する。
論文 参考訳(メタデータ) (2025-06-22T08:09:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。