論文の概要: Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models
- arxiv url: http://arxiv.org/abs/2607.02983v1
- Date: Fri, 03 Jul 2026 05:43:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.482155
- Title: Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models
- Title(参考訳): 大規模言語モデルを用いたEvidence-Seeking診断推論のための強化学習
- Authors: Shengyi Hua, Kangzhe Hu, Conghui He, Xiaofan Zhang, Shaoting Zhang,
- Abstract要約: 医療診断をイテレーティブ・エビデンス・シークリング・タスクとして定式化する。
我々は,RLVR(Reinforcement Learning with Verifiable Rewards)を利用して,閉ループ環境における本質的な推論を行う。
本稿では,RAGES(Retrieval-Augmented Generation-based Examination Simulator)について紹介する。
- 参考スコア(独自算出の注目度): 35.9432019263596
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent reasoning-centric Large Language Models (LLMs) have made significant strides, yet they predominantly operate on a passive-inference pattern that assumes complete information. In contrast, real-world clinical intelligence is inherently an iterative investigative process requiring strategic evidence acquisition. To bridge this gap, we formalize medical diagnosis as an Iterative Evidence-Seeking Task. We leverage Reinforcement Learning with Verifiable Rewards (RLVR) to elicit intrinsic reasoning within a closed-loop environment, guided by a novel suite of rewards that enforce diagnostic precision and examination consistency. To facilitate this, we introduce the Retrieval-Augmented Generation-based Examination Simulator (RAGES), a high-fidelity clinical oracle that provides realistic, knowledge-grounded follow-up evidence. Empirical results across diverse datasets demonstrate that our framework enables LLMs to transition from passive responders to autonomous assistants. Notably, our model demonstrates comparable performance to larger and reasoning-enhanced baselines, while RAGES proves superior to vanilla LLMs in generating biologically plausible clinical feedback.
- Abstract(参考訳): 最近の推論中心のLarge Language Models (LLM) は大きな進歩を遂げているが、完全な情報を前提とした受動的推論パターンを主に運用している。
対照的に、現実の臨床的インテリジェンスは本質的に、戦略的証拠の取得を必要とする反復的な調査プロセスである。
このギャップを埋めるため,イテレーティブ・エビデンス・シーキング・タスクとして医療診断を定式化する。
我々は,RLVR(Reinforcement Learning with Verifiable Rewards)を利用して,診断精度と検査整合性を強制する新たな報酬群によって誘導された閉ループ環境における本質的な推論を導き出す。
これを容易にするために,我々は,現実的で知識を基盤としたフォローアップエビデンスを提供する高忠実な臨床オラクルであるRetrieval-Augmented Generation-based Examination Simulator (RAGES)を紹介した。
多様なデータセットにまたがる実験結果から、LLMが受動的応答器から自律的アシスタントへの移行を可能にすることが示される。
RAGES はバニラLSM に比較して生物学的に妥当な臨床フィードバックが得られているのに対し,本モデルはより大規模で推論に富むベースラインに匹敵する性能を示した。
関連論文リスト
- From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning [17.420995251535647]
大規模言語モデル(LLM)は「欠陥推論による正しい答え」を生成する
本稿では,診断プロセスにトゥールミンモデルを適用することにより,信頼性の高い臨床議論の枠組みを確立する。
CGCL(Curriculum Goal-Conditioned Learning)という新たな学習パイプラインを提案する。
実験の結果,資源集約型強化学習(RL)手法に匹敵する診断精度と推論品質が得られた。
論文 参考訳(メタデータ) (2026-04-13T07:49:39Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework [29.22693846221723]
マルチモーダル・メディカル・推論における,エビデンス・グラウンドド・エージェント・フレームワークによる臨床説明可能性の向上について紹介する。
CAREはタスクを調整されたサブモジュールに分解し、ショートカット学習と幻覚を減らす。
私たちのCARE-Flowは、同じサイズ(10B)のSOTA(State-of-the-art)よりも平均精度を10.9%向上させる
論文 参考訳(メタデータ) (2026-03-02T08:38:37Z) - Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis [29.630872344186873]
インタラクティブな医療相談は、エージェントが不確実性の下で行方不明な臨床証拠を積極的に引き出す必要がある。
既存の評価の大部分は静的あるいは結果中心であり、エビデンス収集プロセスを無視している。
シミュレーションされた患者と、原子的証拠に基づく再現されたレポーターを用いて、コンサルテーションプロセスを明示的にモデル化するインタラクティブな評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:36:35Z) - Timely Clinical Diagnosis through Active Test Selection [49.091903570068155]
本稿では,現実の診断推論をよりうまくエミュレートするためのACTMED (Adaptive Clinical Test selection via Model-based Experimental Design)を提案する。
LLMは柔軟なシミュレータとして機能し、構造化されたタスク固有のトレーニングデータを必要とせずに、患者状態のもっともらしい分布を生成し、信念の更新をサポートする。
我々は、実世界のデータセット上でACTMEDを評価し、診断精度、解釈可能性、リソース使用量を改善するためにテスト選択を最適化できることを示す。
論文 参考訳(メタデータ) (2025-10-21T18:10:45Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications [59.721265428780946]
医学における大きな言語モデル(LLM)は印象的な能力を実現しているが、体系的で透明で検証可能な推論を行う能力に重大なギャップが残っている。
本稿は、この新興分野に関する最初の体系的なレビューを提供する。
本稿では,学習時間戦略とテスト時間メカニズムに分類した推論強化手法の分類法を提案する。
論文 参考訳(メタデータ) (2025-08-01T14:41:31Z) - Beyond Self-Consistency: Ensemble Reasoning Boosts Consistency and Accuracy of LLMs in Cancer Staging [0.33554367023486936]
がんのステージング状態は臨床報告で確認できるが、抽出するには自然言語処理が必要である。
臨床指向の大規模言語モデルの進歩により、アルゴリズムの訓練に多大な努力を払わずに、そのような状態を抽出することが期待されている。
本研究では,モデル生成の一貫性向上を目的としたアンサンブル推論手法を提案する。
論文 参考訳(メタデータ) (2024-04-19T19:34:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。