論文の概要: MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models
- arxiv url: http://arxiv.org/abs/2608.01012v1
- Date: Sun, 02 Aug 2026 05:27:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.052555
- Title: MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models
- Title(参考訳): MedUPS:大規模言語モデルを用いた非一般的な医療症例の診断支援に向けて
- Abstract要約: MedUPSQAは、実症例報告5,535件から構築された21,874件の中間的臨床的決定点のデータセットである。
MedUPSは、患者の軌道に沿って展開する中間決定のモデルを監督する。
- 参考スコア(独自算出の注目度): 9.0377422390685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Uncommon and off-guideline cases are difficult for clinical decision support, because physicians must make a series of management decisions under diagnostic uncertainty and rarely see the full case at once. Most large language model (LLM) benchmarks for medicine score only the final diagnosis, yet much of clinical care turns on the next appropriate action: the next test to order, the imaging study to obtain, the specialist to involve, or the differential to pursue. We introduce MedUPSQA, a dataset of 21,874 mid-stream clinical decision points built from 5,535 real case reports, and MedUPS, an alignment framework that supervises models on these intermediate decisions as they unfold along a patient's trajectory. We segment free-text case presentations into chronologically ordered, accumulating clinical chunks and align models to predict the next step with reinforcement learning (GRPO), using an external LLM-as-a-Judge reward. This objective mirrors how clinicians actually meet patients, reasoning forward from accumulating evidence toward the next decision, rather than committing to a final label. Across three backbones, mid-stream alignment raises next-step accuracy from 55.2 to 66.7 for Qwen3.6-27B, from 47.2 to 57.8 for Qwen3.5-9B, and from 37.8 to 44.4 for HuatuoGPT-3-8B, with 95% CI. In several model scales we test the objective improves accuracy more than scale, with smaller models surpassing larger, frontier models we evaluate. We further train supervised fine-tuning (SFT) baselines on the mid-stream task, SFT improves all backbones above base, indicating the target framwork carries signal independently of the optimizer. We release the dataset, code, and aligned checkpoints.
- Abstract(参考訳): なぜなら、医師は診断の不確実性の下で一連の管理上の決定をしなければならないし、一度に全症例を見ることはめったにないからである。
医学のためのほとんどの大きな言語モデル(LLM)ベンチマークは最終診断のみをスコアするが、臨床ケアの多くは次の適切なアクションに切り替える。
症例報告5,535件から作成した21,874件の中間的臨床的決定点のデータセットであるMedUPSQAと,患者の軌道に沿って展開するこれらの中間的決定のモデルを監督するアライメントフレームワークであるMedUPSを紹介する。
症例の提示を時系列順に分類し,臨床チャンクを蓄積し,次のステップを強化学習(GRPO)で予測するために,外部LLM-as-a-Judge報酬を用いた。
この目的は、臨床医が患者に実際に会う様子を反映しており、最終ラベルにコミットするのではなく、次の決定に向けて証拠を蓄積するからである。
3つのバックボーン全体で、中流アライメントはQwen3.6-27Bの55.2から66.7に、Qwen3.5-9Bの47.2から57.8に、HuatuoGPT-3-8Bの37.8から44.4に、95%CIで次のステップ精度を上昇させる。
いくつかのモデルスケールで、この目的はスケールよりも精度を向上し、より小さなモデルは評価対象のより大きなフロンティアモデルを上回る。
我々はさらに、中流タスクにおける教師付き微調整(SFT)ベースラインを訓練し、SFTはベース上のすべてのバックボーンを改善し、ターゲットのフラムワークがオプティマイザとは独立に信号を運ぶことを示す。
データセット、コード、アライメントされたチェックポイントをリリースします。
関連論文リスト
- ChronoMedicalWorld: A Medical World Model for Learning Patient Trajectories from Longitudinal Care Data [1.995753801570114]
縦断的ケアデータから患者の軌跡を学習するための行動条件付き潜在世界モデルフレームワークを提案する。
慢性腎疾患(CKD)における年間推定糸球体濾過率(eGFR)トラジェクトリー予測のためのCMWMのインスタンス化
CKD固有のアーキテクチャ、損失設計、トレーニングプロトコルは、構造的および会話的介入によってインターリーブされた定期的な臨床状態としてキャストできるあらゆる慢性状態に適用できる。
論文 参考訳(メタデータ) (2026-05-21T03:50:17Z) - MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs [11.709211007913803]
既存の医療訓練データは、モデルに完全な情報から推論するように教えるが、進化した部分的な証拠の下では行動しない。
木構造蒸留パイプラインであるMedActionを導入し,多変量かつ高品質な多ターン診断軌道を合成する。
このパイプラインを用いて、2,896件のPMC症例から32,681件のトラジェクトリのデータセットであるMedAction-32Kを構築した。
論文 参考訳(メタデータ) (2026-05-08T06:15:24Z) - MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning [7.000170880015254]
医療領域における最初のプロセスレベルの報酬モデルベンチマークであるMedPRMBenchを提案する。
臨床共鳴ブループリント(CRB)に基づく3相パイプラインで構築される。
ベンチマークには6500の質問と13,000の推論チェーン、113,910のステップレベルラベル、トレーニング用の6,879の質問が含まれている。
論文 参考訳(メタデータ) (2026-04-19T06:44:07Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Clinician input steers frontier AI models toward both accurate and harmful decisions [10.599240857217811]
8つのフロンティアモデルにまたがる21の言語モデル (LLM) を, 差分診断生成と次のステップ勧告に基づいて評価した。
専門的な文脈は、21モデル全体にわたる正しい最終診断の包含を著しく改善した。
GPT-4o 実験では, 臨床症状の明確な不確実性信号により, 対側的文脈での診断性能が向上した。
論文 参考訳(メタデータ) (2026-03-14T23:47:53Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models [57.73472878679636]
Med-RewardBenchは、医療報酬モデルと審査員を評価するために特別に設計された最初のベンチマークである。
Med-RewardBenchは、13の臓器系と8の臨床部門にまたがるマルチモーダルデータセットを特徴としている。
厳格な3段階のプロセスは、6つの臨床的に重要な次元にわたる高品質な評価データを保証する。
論文 参考訳(メタデータ) (2025-08-29T08:58:39Z) - A Modular Approach for Clinical SLMs Driven by Synthetic Data with Pre-Instruction Tuning, Model Merging, and Clinical-Tasks Alignment [46.776978552161395]
小型言語モデル(SLM)は、GPT-4のような大規模言語モデルに代わる費用対効果を提供する。
SLMは費用対効果のある代替手段を提供するが、その限られた能力は生物医学的な領域適応を必要とする。
本研究では,SLMを高性能な臨床モデルに適用するための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-15T21:40:21Z) - Towards Evaluating and Building Versatile Large Language Models for Medicine [57.49547766838095]
MedS-Benchは大規模言語モデル(LLM)の性能を臨床的に評価するためのベンチマークである。
MedS-Benchは、臨床報告の要約、治療勧告、診断、名前付きエンティティ認識、医療概念説明を含む、11のハイレベルな臨床タスクにまたがる。
MedS-Insは58の医療指向言語コーパスで構成され、112のタスクで1350万のサンプルを収集している。
論文 参考訳(メタデータ) (2024-08-22T17:01:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。