論文の概要: Offline Reinforcement Learning for Hemodynamic Management of Sepsis in the ICU: a MIMIC-IV Study with Dual Off-Policy Evaluation
- arxiv url: http://arxiv.org/abs/2608.16482v2
- Date: Wed, 26 Aug 2026 09:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.66581
- Title: Offline Reinforcement Learning for Hemodynamic Management of Sepsis in the ICU: a MIMIC-IV Study with Dual Off-Policy Evaluation
- Title(参考訳): ICUにおけるセプシスの血行動態管理のためのオフライン強化学習:デュアルオフポリケーション評価を用いたMIMIC-IV研究
- Abstract要約: 本研究は, オフ政治評価, 信頼性診断, 臨床診断分析を組み合わせることで, 敗血症治療方針の信頼性評価を推し進めるものである。
我々はMIMIC-IV クリティカルケアデータベースから,36,872個の敗血症性 ICU のコホートを用いた流体および血管圧剤の投与をモデル化した。
学習方針は,重み付き重要度サンプリング (WIS) と適合Q評価 (FQE) の2つの評価指標を用いて評価され,信頼性チェックとしてESSと臨床医の合意が得られた。
- 参考スコア(独自算出の注目度): 0.3545294650344768
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The dosing of intravenous fluids and vasopressors in sepsis is a sequential decision made under uncertainty and guided largely by clinical judgment, which makes it a natural target for reinforcement learning from historical care. Because a learned policy cannot be trialed on patients, its value must be estimated off-policy, and such estimates can be fragile and optimistic. This work advances the reliable evaluation of sepsis treatment policies by combining off-policy estimation, reliability diagnostics, and clinician-agreement analyses in a transparent validation framework. We modeled fluid and vasopressor dosing on a cohort of 36,872 septic ICU stays drawn from the MIMIC-IV critical-care database, as a discretized Markov decision process with 1,000 states and 25 actions, defined by a five-by-five grid of fluid and vasopressor levels and solved by policy iteration. The clinicians' behavior policy was estimated with a random forest, which mitigated the collapse of the Effective Sample Size (ESS 50.1 against 4.0 with smoothed counts) that otherwise destabilizes the importance-sampling estimate. The learned policy was evaluated with two estimators, weighted importance sampling (WIS) and fitted Q evaluation (FQE), with the ESS and clinician agreement as reliability checks. An empirical variable selection found that the composition of the state matters more than its size. Both estimators place the learned policy above the clinicians' return (WIS 50.8 and FQE 46.8 against 38.2, ESS 50.1), yet it departs only modestly from observed practice (total variation 0.18), favoring less intravenous fluid. These retrospective single-center off-policy results support the learned policy as a clinically plausible refinement of observed practice and motivate its further evaluation as a discordance-based clinical decision-support approach.
- Abstract(参考訳): 敗血症における静脈内液と血管圧薬の服用は、不確実性の下で連続的に決定され、臨床判断によって主に導かれるため、歴史的治療による強化学習の自然な標的となる。
学習した政策を患者に対して試すことはできないので、その価値は政治外で見積もる必要があり、そのような見積もりは脆弱で楽観的である。
本研究は, 透明な検証フレームワークを用いて, オフ・ポリシー推定, 信頼性診断, 臨床診断分析を組み合わせることで, 敗血症治療方針の信頼性評価を推し進める。
我々は,MIMIC-IVクリティカルケアデータベースから抽出した36,872個の敗血症性ICUのコホートを,1000の状態と25のアクションからなる離散化マルコフ決定プロセスとしてモデル化し,5つの5つの流体と血管圧のグリッドで定義し,政策反復によって解決した。
臨床医の行動方針は無作為な森林で見積もられ、これは有効標本サイズ(ESS 50.1対4.0対滑らかな数)の崩壊を緩和し、そうでなければ重要サンプル数の推定を不安定化させた。
学習方針は,重み付き重要度サンプリング (WIS) と適合Q評価 (FQE) の2つの評価指標を用いて評価され,信頼性チェックとしてESSと臨床医の合意が得られた。
経験的変数選択により、状態の構成がそのサイズよりも重要であることが判明した。
どちらの推定者も、臨床医の復帰(WIS 50.8 と FQE 46.8 対 38.2, ESS 50.1 )の上に学習方針を定めているが、観察された慣行(経時変化 0.18 )とはわずかに離れており、静脈内液が少なくなっている。
これらの振り返りシングルセンターオフ政治の結果は、学習方針を観察された実践の臨床的に妥当な改善として支持し、不一致に基づく臨床意思決定支援アプローチとしてのさらなる評価を動機付けている。
関連論文リスト
- Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - From Static Risk to Dynamic Trajectories: Toward World-Model-Inspired Clinical Prediction [61.12883122613684]
本稿では, 患者固有の縦断疾患の進展を推定し, 代替治療下での軌跡変化を評価するための, 臨床AIにおける介入認識型疾患軌跡モデリングに焦点をあてる。
3つの意思決定タスク(実測,反実推定,政策評価)と3つのデータ生成機構(障害発生, 治療課題, 観察過程)によって, 識別可能性を決定する。
本稿では,個別/連続時間にまたがる予測,反ファクト的軌跡,政策評価の統一的な枠組みを提案する。
論文 参考訳(メタデータ) (2026-05-16T10:45:26Z) - Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores [5.004814662623874]
大規模言語モデル(LLM)は、臨床推論やリスクアセスメントにますます活用されている。
しかし、精神医学のような批判的・不決定的な領域における解釈的信頼性は未だ不明である。
本稿では, インシデント設計の影響に関する評価を構造化することで, 下流LLMタスクの信頼性監査を行う手法を提案する。
論文 参考訳(メタデータ) (2026-04-23T20:42:22Z) - Evaluating Patient Safety Risks in Generative AI: Development and Validation of a FMECA Framework for Generated Clinical Content [0.5049603364708264]
障害モード、効果、臨界分析(FMECA)は、体系的なリスク識別のための積極的なフレームワークを提供する。
本研究の目的は, LLM 作成臨床サマリーにおける患者安全リスクの予測評価のための新しい FMECA フレームワークの開発と評価である。
論文 参考訳(メタデータ) (2026-04-23T14:44:15Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations [45.414878840652115]
大規模言語モデル(LLM)は医療ベンチマークで有望な性能を示した。
しかし、医学的な計算を行う能力は未熟であり、評価も不十分である。
本研究は,臨床信頼性を重視した医療計算評価を再考する。
論文 参考訳(メタデータ) (2025-09-20T09:10:26Z) - Pruning the Way to Reliable Policies: A Multi-Objective Deep Q-Learning Approach to Critical Care [46.2482873419289]
我々は、より信頼性の高いクリティカルケアポリシーを得るための深いQ-ラーニングアプローチを導入する。
本手法を,集中治療室のシミュレーション環境と実際の健康記録を用いて,オフライン・オフ・セッティングで評価した。
論文 参考訳(メタデータ) (2023-06-13T18:02:57Z) - COVID-Net Clinical ICU: Enhanced Prediction of ICU Admission for
COVID-19 Patients via Explainability and Trust Quantification [71.80459780697956]
患者臨床データに基づくICU入院予測のためのニューラルネットワークであるCOVID-Net Clinical ICUを紹介する。
提案されたCOVID-Net Clinical ICUは、1,925人のCOVID-19患者からなるシロ・リバネ病院の臨床データセットを使用して構築された。
定量的説明可能性戦略を用いたシステムレベルの洞察発見を行い,異なる臨床特徴の意思決定効果について検討した。
論文 参考訳(メタデータ) (2021-09-14T14:16:32Z) - Clinical Outcome Prediction from Admission Notes using Self-Supervised
Knowledge Integration [55.88616573143478]
臨床テキストからのアウトカム予測は、医師が潜在的なリスクを見落としないようにする。
退院時の診断,手術手順,院内死亡率,長期予測は4つの一般的な結果予測対象である。
複数の公開資料から得られた患者結果に関する知識を統合するために,臨床結果の事前学習を提案する。
論文 参考訳(メタデータ) (2021-02-08T10:26:44Z) - Off-policy Policy Evaluation For Sequential Decisions Under Unobserved
Confounding [33.58862183373374]
観測不能条件下でのOPE手法のロバスト性を評価する。
また,OPE法に偏りが強い場合も少ないことが示唆された。
最悪ケース境界の計算に有効な損失最小化手法を提案する。
論文 参考訳(メタデータ) (2020-03-12T05:20:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。