論文の概要: MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
- arxiv url: http://arxiv.org/abs/2603.28120v1
- Date: Mon, 30 Mar 2026 07:31:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.279279
- Title: MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
- Title(参考訳): MedLoc-R1:GRPOに基づく医用ビジュアルグラウンドのための性能を考慮したカリキュラムリワードスケジューリング
- Authors: Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinlin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao,
- Abstract要約: MedLoc-R1は,医療用視覚グラウンドのための報酬スケジューリングフレームワークである。
当社のフレームワークは,高吸収医療応用におけるRLベース接地のための汎用的で軽量で効果的なソリューションを提供する。
- 参考スコア(独自算出の注目度): 11.789428416967626
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical visual grounding serves as a crucial foundation for fine-grained multimodal reasoning and interpretable clinical decision support. Despite recent advances in reinforcement learning (RL) for grounding tasks, existing approaches such as Group Relative Policy Optimization~(GRPO) suffer from severe reward sparsity when directly applied to medical images, primarily due to the inherent difficulty of localizing small or ambiguous regions of interest, which is further exacerbated by the rigid and suboptimal nature of fixed IoU-based reward schemes in RL. This leads to vanishing policy gradients and stagnated optimization, particularly during early training. To address this challenge, we propose MedLoc-R1, a performance-aware reward scheduling framework that progressively tightens the reward criterion in accordance with model readiness. MedLoc-R1 introduces a sliding-window performance tracker and a multi-condition update rule that automatically adjust the reward schedule from dense, easily obtainable signals to stricter, fine-grained localization requirements, while preserving the favorable properties of GRPO without introducing auxiliary networks or additional gradient paths. Experiments on three medical visual grounding benchmarks demonstrate that MedLoc-R1 consistently improves both localization accuracy and training stability over GRPO-based baselines. Our framework offers a general, lightweight, and effective solution for RL-based grounding in high-stakes medical applications. Code \& checkpoints are available at \hyperlink{}{https://github.com/MembrAI/MedLoc-R1}.
- Abstract(参考訳): 医用ビジュアルグラウンドディングは、きめ細かいマルチモーダル推論と解釈可能な臨床決定支援のための重要な基盤となっている。
近年の強化学習(RL)の現場化の進展にもかかわらず、グループ相対政策最適化(GRPO)のような既存のアプローチは、医学画像に直接適用する場合に深刻な報酬の空間性に悩まされており、これは主に、RLにおける固定IoUベースの報酬スキームの厳密かつ準最適性によってさらに悪化する、小さな領域や曖昧な領域のローカライズが本質的に困難であるためである。
これは、特に早期のトレーニングにおいて、ポリシーのグラデーションを廃止し、最適化を停滞させます。
この課題に対処するため,モデル準備性に応じて報酬基準を段階的に厳格化する性能認識型報酬スケジューリングフレームワークであるMedLoc-R1を提案する。
MedLoc-R1は、スライディングウインドウ性能トラッカーとマルチコンディション更新ルールを導入し、補助ネットワークやグラデーションパスを導入することなくGRPOの好ましい特性を保ちながら、より厳密で容易に取得可能な信号からよりきめ細かなローカライゼーション要求に報酬スケジュールを自動的に調整する。
MedLoc-R1は、GRPOベースのベースラインよりも、ローカライズ精度とトレーニング安定性の両方を一貫して改善している。
当社のフレームワークは,高吸収医療応用におけるRLベース接地のための汎用的で軽量で効果的なソリューションを提供する。
コードとチェックポイントは \hyperlink{}{https://github.com/MembrAI/MedLoc-R1} で入手できる。
関連論文リスト
- MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization [28.610758740650407]
本稿では,拡張性,多目的性,検証可能な強化学習手法CRPOを紹介する。
CRPOは、人間のアノテーションに頼ることなく、正確さ、忠実さ、包括性を共同で最適化するルールベースおよび検証可能な報酬信号を統合する。
論文 参考訳(メタデータ) (2025-11-29T19:09:24Z) - Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning [79.365697698062]
マルチドメイン推論のためのフレームワークである $textbfRGR-GRPO (Reward and Guidance through rubrics) を提案する。
RGR-GRPOは、代替の報酬スキームやオフラインガイダンスにのみ依存するRLメソッドよりも一貫して優れている。
論文 参考訳(メタデータ) (2025-11-15T20:14:51Z) - The Peril of Preference: Why GRPO fails on Ordinal Rewards [0.8937905773981699]
我々は、この欠陥を解決する新しい定式化であるCoRPO(Correctness Relative Policy Optimization)を導入する。
CoRPOは適応ベースラインを使用し、最小品質の閾値を強制する。
コード検証タスクにおいて、CoRPOを実証的に検証し、より安定した収束とドメイン外一般化を実証する。
論文 参考訳(メタデータ) (2025-11-06T15:12:50Z) - Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z) - MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization [19.70803794316208]
医用画像グラウンドディング(MIG)は、テキスト記述に基づいて、医療画像内の特定の領域をローカライズする。
MIGの既存のビジョンランゲージモデル(VLM)は、大量のチェーン・オブ・ソート(CoT)推論アノテーションを持つスーパービジョンファインチューニング(SFT)に依存していることが多い。
本研究では,CoT推論アノテーションを使わずにモデルをトレーニングするための空間意味的回帰グループ相対ポリシー最適化を提案する。
論文 参考訳(メタデータ) (2025-07-01T21:51:42Z) - GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning [53.894789613838654]
我々は、複雑な実世界のビデオにバランスの取れた知覚と推論を必要とするベンチマークであるSEED-Bench-R1を紹介する。
SEED-Bench-R1を用いて、標準GRPOは解の精度を向上する一方で、推論ステップと解の論理的コヒーレンスを57.9%の一貫性で減少させる。
応答の正しさと推論コヒーレンスの両方を明示的な監督なしに最適化する整合性を考慮したRLフレームワークGRPO-CAREを提案する。
論文 参考訳(メタデータ) (2025-06-19T08:49:13Z) - DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data [65.09939942413651]
本稿では,グループ間不均衡と2つの重要なイノベーションに対処するGRPOの原理的拡張を提案する。
ドメイン対応報酬スケーリングは、ドメインの頻度に基づいて最適化を再重み付けすることで周波数バイアスに対処する。
難解な報酬のスケーリングは、学習価値を提供する不確実なプロンプトを特定し、優先順位付けするために、プロンプトレベルの自己整合性を活用する。
論文 参考訳(メタデータ) (2025-05-21T03:43:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。