論文の概要: Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation
- arxiv url: http://arxiv.org/abs/2608.08494v2
- Date: Tue, 11 Aug 2026 13:36:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.60338
- Title: Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation
- Title(参考訳): 臨床補助医療報告生成のための言語学的・視覚的選好最適化
- Abstract要約: DPO-Clinは,臨床所見とクロスモーダルアライメントを優先的に最適化する,新しいポストトレーニングフレームワークである。
ECDモジュールは言語的に整合したレポート優先ペアの生成をガイドする。
M2DPOの変種は、視覚的コンテキストスイッチによって引き起こされるテキストの好みの反転を強制する。
- 参考スコア(独自算出の注目度): 15.278073487171502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite significant advances in Medical Report Generation (MRG), the reliability remains constrained by the prevalence of factual errors. While Direct Preference Optimization (DPO) has emerged as a promising post-training paradigm to enhance the performance of Supervised Fine-Tuned (SFT) MRG models, existing DPO-based MRG methods typically adopt a naive preference construction that directly pairs model-generated reports with ground truth reports. This strategy inadvertently entangles critical clinical findings with clinically irrelevant linguistic characteristics, and fundamentally lacks explicit vision-language alignment. To address these challenges, we propose DPO-Clin, a novel post-training framework that focuses preference optimization on clinical findings and cross-modal alignment. First, we introduce the Entity-level Clinical Diagnostic (ECD) module to perform a precise entity-level factual diagnosis. ECD guides the generation of linguistically-aligned report preference pairs, isolating clinical discrepancies from linguistic variations. Second, to achieve fine-grained cross-modal alignment, we develop M2DPO, a retrieval-augmented multi-modal DPO variant that enforces textual preference inversion triggered by visual context switches. Third, we locate correct yet highly uncertain predicted entities and apply counterfactual modifications to construct targeted preference data for latent risk mitigation, thereby further enhancing the model reliability. Extensive experiments on two public chest X-ray datasets (MIMIC-CXR and IU X-Ray) and an in-house endoscopy dataset demonstrate that DPO-Clin significantly improves the SFT baselines on clinical-aware metrics. Furthermore, it achieves superior performance over existing DPO-based MRG methods, exhibiting robust generalizability across distinct baseline architectures and diverse medical imaging modalities.
- Abstract(参考訳): 医療報告生成(MRG)の大幅な進歩にもかかわらず、信頼性は事実的誤りの頻度によって制限されている。
直接選好最適化(DPO)は、SFT(Supervised Fine-Tuned)MRGモデルの性能を高めるための訓練後パラダイムとして期待されているが、既存のDPOベースのMRG手法では、モデル生成レポートと地上真実レポートを直接組み合わせた単純な選好構造を採用するのが一般的である。
この戦略は、臨床的に無関係な言語的特徴と臨床的に重要な臨床所見を必然的に絡み合わせるものであり、視覚言語的アライメントが根本的に欠如している。
これらの課題に対処するために,臨床所見と横断的アライメントを優先的に最適化する新しいポストトレーニングフレームワークであるDPO-Clinを提案する。
まず、エンティティレベル臨床診断(ECD)モジュールを導入し、正確なエンティティレベル事実診断を行う。
ECDは、言語学的に整合した報告優先ペアの生成をガイドし、言語学的変異から臨床上の相違を分離する。
第二に、細粒度のクロスモーダルアライメントを実現するために、視覚的コンテキストスイッチによって引き起こされるテキストの好みの反転を強制する検索強化マルチモーダルDPOであるM2DPOを開発する。
第3に, 正当かつ確実な予測対象を同定し, 潜在リスク軽減のための目標嗜好データを構築するために, 反実的な修正を適用し, モデル信頼性をさらに向上する。
2つの公開胸部X線データセット(MIMIC-CXRとIU X-Ray)と社内内視鏡データセットの広範囲にわたる実験により、DPO-Clinは臨床応用基準のSFTベースラインを著しく改善することが示された。
さらに、既存のDPOベースのMRG法よりも優れた性能を実現し、異なるベースラインアーキテクチャと多様な医用画像モダリティにまたがる堅牢な一般化性を示す。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs [53.697403481143404]
LVLM(Large Vision-Language Models)は、医用画像処理タスクにおいて強力なパフォーマンスを実現している。
しかし、実際の不整合、視力の低下、臨床的に有意義なフィードバックによる不一致が続く傾向にある。
論文 参考訳(メタデータ) (2026-06-10T18:35:36Z) - EviCare: Enhancing Diagnosis Prediction with Deep Model-Guided Evidence for In-Context Reasoning [62.61394722212386]
EviCareは、大規模言語モデルにディープモデルガイダンスを統合する、コンテキスト内推論フレームワークである。
LLMのみのベースラインと深層モデルのみのベースラインを2つの実世界のEHRベンチマークで連続的に上回っている。
論文 参考訳(メタデータ) (2026-04-12T04:35:14Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models [24.19721015692576]
そこで我々は,ClinCoTを提案することで,好みの最適化を応答レベルの補正から視覚駆動推論へ変換する。
ClinCoTは,従来の嗜好に基づくアライメント手法と比較して,事実上のグラウンド化を一貫して改善し,優れた性能を実現することを示す。
論文 参考訳(メタデータ) (2026-03-01T14:15:54Z) - MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement [63.82954136824963]
医療ビジョンランゲージモデルでは、現実世界のシナリオで必要とされる複雑な臨床推論を伴う知覚タスクが優れている。
本稿ではドメイン固有の適応とガイドライン強化を通じてこれらの課題に対処する新しい推論MedVLMを提案する。
論文 参考訳(メタデータ) (2026-01-16T02:32:07Z) - Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting [37.57009831483529]
MLLM(Multimodal Large Language Models)は放射線学レポート生成に強い可能性を示している。
本フレームワークは, より詳細な発見のための思考ブロックと, 構造化された疾患ラベルに対する回答ブロックという, 生成を2つの異なる構成要素に再構成する。
論文 参考訳(メタデータ) (2026-01-06T14:17:44Z) - MRG-R1: Reinforcement Learning for Clinically Aligned Medical Report Generation [23.22547135801011]
医療報告生成のための意味駆動型強化学習(SRL)手法を提案する。
SRLは、言語スタイルの模倣を超えた臨床的正確性に基づく学習を促進する。
IU X線とMIMIC-CXRの2つのデータセットを用いたSRLを用いた医療報告生成の評価を行った。
論文 参考訳(メタデータ) (2025-12-18T03:57:55Z) - MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning [52.064286116035134]
我々はMed-VQA(Med-VQA)のための視覚的LVLM応答を保証するフレームワークであるMedAlignを開発した。
まず、優先学習を視覚的コンテキストに合わせるために、マルチモーダルな直接選好最適化(mDPO)の目的を提案する。
次に、画像とテキストの類似性を生かし、クエリを専門的でコンテキスト拡張されたLVLMにルーティングする検索型混合処理(RA-MoE)アーキテクチャを設計する。
論文 参考訳(メタデータ) (2025-10-24T02:11:05Z) - Refine Medical Diagnosis Using Generation Augmented Retrieval and Clinical Practice Guidelines [16.56254046507092]
GARMLE-Gは、医療用言語モデルの出力を権威的ガイドラインに根拠づけた、世代別検索フレームワークである。
従来のRetrieval-Augmented Generationベースのアプローチとは異なり、GARMLE-Gは権威的なガイドラインコンテンツを直接検索することで幻覚のない出力を可能にする。
高血圧診断のためのプロトタイプシステムを開発し, 検索精度, 意味的関連性, 臨床ガイドラインの適合性を実証した。
論文 参考訳(メタデータ) (2025-06-22T11:31:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。