論文の概要: Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO
- arxiv url: http://arxiv.org/abs/2606.05174v1
- Date: Fri, 17 Apr 2026 03:08:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.624949
- Title: Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO
- Title(参考訳): GRPOを用いた多変量対応ルーブリックリワードによるLCMの心電図医学的質問応答の改善
- Authors: Arash Ahmadi, Parisa Masnadi, Sarah Sharif, Charles Nicholson, David Ebert, Mike Banad,
- Abstract要約: 大規模言語モデル(LLM)は、医療アプリケーションにおいて大きな可能性を秘めている。しかしながら、データプライバシの制約、推論コスト、エッジやデバイス上の使用に限定した適合性のために、現実の環境で汎用モデルをデプロイすることは、依然として困難である。
そこで本研究では,RaR-Medicine由来のルビリック・ベース・インシュアランスに応答する心的医学的問題に対するLLMのポストトレーニングのためのグループ相対的ポリシー最適化(GRPO)について検討する。
以上の結果から, 心電図による質問応答の改善には, 心電図による報酬が有効であり, その他の作業にも適用できる可能性が示唆された。
- 参考スコア(独自算出の注目度): 0.23749905164931204
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have shown strong promise in healthcare applications. Yet deploying general-purpose models in real-world settings remains difficult due to data privacy constraints, inference costs, and limited suitability for edge or on-device use. These challenges motivate the development of smaller, more efficient models that require robust post-training strategies to ensure reliable medical reasoning. In this work, we investigate Group Relative Policy Optimization (GRPO) for post-training LLMs on heart-focused medical question answering with rubric-based supervision derived from RaR-Medicine. We propose a Variance-Aware Reward Framework that extends the Explicit Aggregation and Implicit Aggregation strategies of Rubrics as Rewards by replacing weighted binary criterion aggregation and single overall Likert-style scoring with continuous analytical reward functions derived from criterion-level rubric outcomes. This formulation provides richer optimization signals for feedback that is sparse, multi-criteria, and difficult to verify automatically, and enables more stable on-policy reinforcement learning. On a held-out heart-related subset of HealthBench, our best GRPO variant improves accuracy from 0.362 to 0.502 and F1 from 0.532 to 0.668 relative to the Qwen3-14B base model, while remaining competitive with GPT-OSS-120B (0.508 accuracy, 0.674 F1). Our findings show that carefully designed rubric-based rewards provide a practical strategy for improving heart-focused medical question answering in LLMs, with potential to extend to other rubric-based tasks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、医療アプリケーションにおいて大きな可能性を秘めている。
しかし、データプライバシの制約、推論コスト、エッジやデバイス上の使用に限定した適合性のために、現実の環境で汎用モデルをデプロイすることは依然として困難である。
これらの課題は、信頼性の高い医学的推論を保証するために堅牢な後トレーニング戦略を必要とする、より小さく、より効率的なモデルの開発を動機付けている。
そこで本研究では,RaR-Medicine由来のルビリック・ベース・インシュアランスに応答する心的医学的問題に対するLLMのポストトレーニングのためのグループ相対的ポリシー最適化(GRPO)について検討する。
本稿では、重み付けされた二項基準集約と一括一括評価を、基準レベルのルーリック結果から導出した連続的な解析的報酬関数で置き換えることにより、ルービックの明示的集約と暗黙的集約戦略をRewardsとして拡張する分散アウェア・リワードフレームワークを提案する。
この定式化は、スパースで多基準で自動検証が難しいフィードバックのためのよりリッチな最適化信号を提供し、より安定したオンライン強化学習を可能にする。
また,HealthBenchの心臓関連サブセットでは,GPT-OSS-120B(0.508精度,0.674F1)と競合しながら,GPT-OSS-120B(0.508精度,0.674F1)と比較して,0.362から0.502,F1の精度を0.532から0.668に向上した。
以上の結果から, 心電図における心電図質問応答の改善には, 心電図に基づく報酬が有効であり, その他のルーリックベースタスクにも拡張できる可能性が示唆された。
関連論文リスト
- Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding [11.789428416967626]
MedLoc-R1は,医療用視覚グラウンドのための報酬スケジューリングフレームワークである。
当社のフレームワークは,高吸収医療応用におけるRLベース接地のための汎用的で軽量で効果的なソリューションを提供する。
論文 参考訳(メタデータ) (2026-03-30T07:31:21Z) - Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering [0.0]
大規模言語モデル(LLM)の公衆衛生政策分野への統合は、疾病管理予防センター(CDC)などの機関が管理する規制ガイダンスの膨大なリポジトリをナビゲートするための変革的なアプローチを提供する。
LLMが幻覚を発生させることの正当性は、情報整合性が不可能なハイテイク環境において、これらの技術を採用する上で重要な障壁となる。
この経験的評価は、信頼できる文書コンテキストにおける生成出力を基盤として、これらのリスクを軽減するために、検索型拡張生成(RAG)アーキテクチャの有効性を探求するものである。
論文 参考訳(メタデータ) (2026-01-21T20:52:48Z) - Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization [28.610758740650407]
本稿では,拡張性,多目的性,検証可能な強化学習手法CRPOを紹介する。
CRPOは、人間のアノテーションに頼ることなく、正確さ、忠実さ、包括性を共同で最適化するルールベースおよび検証可能な報酬信号を統合する。
論文 参考訳(メタデータ) (2025-11-29T19:09:24Z) - MedAlign: A Synergistic Framework of Multimodal Preference Optimization and Federated Meta-Cognitive Reasoning [52.064286116035134]
我々はMed-VQA(Med-VQA)のための視覚的LVLM応答を保証するフレームワークであるMedAlignを開発した。
まず、優先学習を視覚的コンテキストに合わせるために、マルチモーダルな直接選好最適化(mDPO)の目的を提案する。
次に、画像とテキストの類似性を生かし、クエリを専門的でコンテキスト拡張されたLVLMにルーティングする検索型混合処理(RA-MoE)アーキテクチャを設計する。
論文 参考訳(メタデータ) (2025-10-24T02:11:05Z) - Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning [6.778254993886297]
Fleming-R1は、3つの相補的な革新を通じて、医学的推論を検証するために設計されたモデルである。
まず、我々のReasoning-Oriented Data Strategy(RODS)は、キュレートされた医療用QAデータセットと知識グラフ誘導合成を組み合わせる。
第2に,教師モデルから高品質な推論軌跡を蒸留するために,CoTコールドスタート(Chain-of-Thought)を用いる。
第三に、検証可能なリワードフレームワークから2段階の強化学習を実装します。
論文 参考訳(メタデータ) (2025-09-18T13:35:14Z) - GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning [53.894789613838654]
我々は、複雑な実世界のビデオにバランスの取れた知覚と推論を必要とするベンチマークであるSEED-Bench-R1を紹介する。
SEED-Bench-R1を用いて、標準GRPOは解の精度を向上する一方で、推論ステップと解の論理的コヒーレンスを57.9%の一貫性で減少させる。
応答の正しさと推論コヒーレンスの両方を明示的な監督なしに最適化する整合性を考慮したRLフレームワークGRPO-CAREを提案する。
論文 参考訳(メタデータ) (2025-06-19T08:49:13Z) - DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization [50.91849555841057]
グループ相対政策最適化は大規模推論モデル(LRM)の強化学習手法である
差別学習の原則を基礎として, LRMの強化のための新たな差別的制約付き最適化フレームワークを導入する。
DisCO は GRPO と DAPO などの改良型を著しく上回り、GRPO の7%、DAPO の6% を平均的に上回っている。
論文 参考訳(メタデータ) (2025-05-18T11:08:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。