論文の概要: DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
- arxiv url: http://arxiv.org/abs/2607.18988v2
- Date: Sat, 25 Jul 2026 10:38:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 12:52:43.704082
- Title: DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
- Title(参考訳): DobicVLM:集団相対的政策最適化によるクリニカル・グラウンド・プログラム・リワードを用いた胸部X線診断
- Authors: Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chibundu, Christian Maurice, Mary Donald Essien, Oluwaseun Odunsi, Oluwasegun Oguntuase, Abiodun Adereni,
- Abstract要約: 我々は,MedGemma-4Bの教師付き微調整とグループ相対ポリシー最適化を組み合わせた視覚言語モデルであるDobicVLMを紹介する。
我々のアプローチでは、構造検証、解剖学的チェックリスト、意味的類似性、長さ制約といった、解釈可能なルールベースの報酬コンポーネントを使用します。
DobicVLMはGemini 2.5 Flashよりも優れており、Gemini 2.5 FlashとMedGemma 4Bベースラインと比較して、印象精度(27.2%)と医療用語(86.5%)が最も高い。
- 参考スコア(独自算出の注目度): 0.4418222884390162
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Medical imaging is a cornerstone of diagnostics, yet automated chest X-ray report generation struggles with structural adherence, anatomical completeness, and semantic faithfulness. We introduce DobicVLM, a vision-language model combining supervised fine-tuning on MedGemma-4B with Group Relative Policy Optimization (GRPO) and clinically-grounded programmatic rewards. Our approach uses interpretable, rule-based reward components; structural verification, anatomical checklist, semantic similarity, and length constraints to enforce clinical standards without neural reward models. Trained on 1,000 de-identified image-report pairs from a private clinical dataset (with ethics approval and compliance to local regulations), DobicVLM is evaluated via blinded expert review on 69 held-out cases. DobicVLM outperforms Gemini 2.5 Flash across the majority of criteria, achieving the highest impression accuracy (27.2%) and medical terminology (86.5%) compared to both Gemini 2.5 Flash and MedGemma 4B baselines, with minor trade-offs in completeness and referrals. This demonstrates GRPO's value for transparent alignment in resource-limited settings. Keywords: Vision-Language Models, Radiology Report Generation, Reinforcement Learning, Medical AI, GRPO
- Abstract(参考訳): 医用画像は診断の基盤であるが、胸部X線自動レポート生成は、構造的付着、解剖学的完全性、意味的忠実性に苦慮している。
我々は,MedGemma-4Bの教師付き微調整とグループ相対ポリシー最適化(GRPO)と臨床応用プログラムによる報酬を組み合わせた視覚言語モデルであるDobicVLMを紹介する。
我々のアプローチでは、構造検証、解剖学的チェックリスト、意味的類似性、長さ制約といった、解釈可能なルールベースの報酬要素を使用して、ニューラル報酬モデルなしで臨床標準を強制する。
DobicVLMは、プライベートな臨床データセット(倫理的承認と地方規制の遵守を含む)から1,000の未確認画像レポートペアで訓練され、69件の症例について、盲目の専門家によるレビューによって評価される。
DobicVLMはGemini 2.5 Flashより優れており、Gemini 2.5 FlashとMedGemma 4Bのベースラインと比べて印象精度(27.2%)と医療用語(86.5%)が最も高い。
これは、リソース制限された設定で透過的なアライメントを実現するGRPOの価値を示しています。
キーワード:ビジョンランゲージモデル、ラジオロジーレポート生成、強化学習、医療AI、GRPO
関連論文リスト
- Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs [53.697403481143404]
LVLM(Large Vision-Language Models)は、医用画像処理タスクにおいて強力なパフォーマンスを実現している。
しかし、実際の不整合、視力の低下、臨床的に有意義なフィードバックによる不一致が続く傾向にある。
論文 参考訳(メタデータ) (2026-06-10T18:35:36Z) - MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models [83.50100003741628]
ビジョンと言語モデル(VLM)は、バイオメディカルイメージングを変革する大きな可能性を秘めている。
本稿では,MMBU(Massive Multimodal Biomedical Understanding)ベンチマークを紹介する。
今までで最大のビジョンと言語ベンチマークで、35のサブモダリティと豊富な構造化メタデータをカバーしている。
論文 参考訳(メタデータ) (2026-06-04T20:24:47Z) - ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit Injection [1.1273389819207937]
本稿では,詳細な臨床基準に基づく統合アライメントフレームワークであるProMedicalを紹介する。
最初にProMedical-Preference-50kを構築した。
従来のスカラー報酬モデルとは異なり、我々のアプローチは安全制約を一般の熟練度から明確に切り離す。
論文 参考訳(メタデータ) (2026-04-09T14:57:33Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs [24.283989257873085]
VIVID-Medは,凍結した大言語モデル(LLM)を構造化意味論的教師として活用し,医療用ビジョントランスフォーマー(ViT)を事前訓練する新しいフレームワークである。
VIVID-Medは、臨床所見をUnified MedicalNIST (UMS) を介して検証可能なフィールド状態ペアに翻訳し、応答性を考慮したマスキングを用いて最適化に焦点を当てる。
マクロAUCは0.8588で、500倍少ないデータを使用しながら、BiomedCLIPを+6.65ポイント上回る。
論文 参考訳(メタデータ) (2026-03-10T02:42:51Z) - VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading [6.106307107513728]
VLOrdinalFormerは、膝関節X線写真から自動 KOA グレーティングを行うための視覚言語ガイド付き順序学習フレームワークである。
提案手法は,VT L16バックボーンとコーラルに基づく順序回帰と,CLIP(Contrastive Language Image Pretraining)によるセマンティックアライメントモジュールを組み合わせたものである。
OAI kneeKL224データセットで実施された実験は、VLOrdinalFormerがアートパフォーマンスの状態を達成していることを示している。
論文 参考訳(メタデータ) (2025-12-31T03:01:31Z) - Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation [25.148217482604746]
VALOR:放射線診断用医用ビジョンランゲージモデルの視覚的アライメントを提案する。
GRPO(Group-Relative Proximal Optimization)を利用した強化学習に基づくポストアライメントフレームワークを提案する。
複数のベンチマークの実験では、VALORは事実の精度と視覚的グラウンド化を大幅に改善し、最先端のレポート生成手法よりも大きなパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-12-18T05:48:21Z) - MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding [47.843626983298726]
textbfMedVidBenchは、ビデオ、セグメント、フレームレベルのタスクにまたがる8つの医療ソースにわたる531,850のビデオインストラクションペアの大規模なベンチマークである。
MedVidBenchの教師付き微調整は顕著な利益をもたらすが、標準強化学習はデータセット間の不均衡な報酬スケールのために失敗する。
textbfMedGRPOは、2つの重要な革新を伴うバランスの取れたマルチデータセットトレーニングのための新しいRLフレームワークである。
論文 参考訳(メタデータ) (2025-12-06T22:27:59Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models [52.2001050216955]
既存の方法は、モデル構造を調整したり、高品質なデータで微調整したり、好みの微調整によって、医療ビジョン言語モデル(MedVLM)の性能を向上させることを目的としている。
我々は,MedVLMと臨床専門知識の連携を図るために,Expert-Controlled-Free Guidance (Expert-CFG) という,ループ内のエキスパート・イン・ザ・ループフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-12T09:03:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。