論文の概要: Confounding Masquerading as Improvement: A Systematic Evaluation of Offline Reinforcement Learning for Stroke Antithrombotic Treatment in a 129,000-Patient Registry
- arxiv url: http://arxiv.org/abs/2608.30442v1
- Date: Mon, 31 Aug 2026 08:32:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.317585
- Title: Confounding Masquerading as Improvement: A Systematic Evaluation of Offline Reinforcement Learning for Stroke Antithrombotic Treatment in a 129,000-Patient Registry
- Title(参考訳): コンバウンディング・マスケラジングの改善:129,000-Patient Registryにおけるストローク抗血栓治療のためのオフライン強化学習の体系的評価
- Abstract要約: 最近のオフライン強化学習(RL)研究は、臨床結果に対する医師の判断を上回る政策を報告している。
急性虚血性脳梗塞患者44,894例において、5つのオフラインRLアルゴリズムファミリーと14の報酬設計を評価した。
代用端末の報酬がベースラインの重症度と予後をエンコードし,治療効果を付与する報奨組込みコンファウンディングを同定した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent offline reinforcement learning (RL) studies report policies that outperform physician decisions on clinical outcomes. We conduct a systematic, partially crossed evaluation of five offline RL algorithm families and 14 reward designs in 44,894 post-2018 acute ischemic stroke patients from a nationwide registry (N = 129,033). Standard Fitted Q-Evaluation (FQE) yields an apparent policy-improvement estimate of +0.0069; adding an Early Neurological Deterioration penalty increases it to +0.0101. We identify reward-embedded confounding, in which a proxy terminal reward encodes baseline severity and prognosis as well as treatment efficacy. A 2 x 2 factorial analysis finds that terminal reward confounding accounts for 218.6% of the observed signal change, so its removal overshoots the null. After DML-inspired GBM reward residualization, the FQE estimate attenuates to +0.0033 (p = 0.132), and full deconfounding yields +0.0025 (p = 0.291). FQE-based diagnostics, T-learner analyses, and direct recurrence analyses converge away from a clinically meaningful aggregate improvement. A 1-year mRS factorial analysis replicates the attenuation. We provide an empirically motivated six-step evaluation checklist. NIHSS-stratified heterogeneity is hypothesis-generating for prospective trial design; hospital-level disagreement does not persist after full reward deconfounding.
- Abstract(参考訳): 最近のオフライン強化学習(RL)研究は、臨床結果に対する医師の判断を上回る政策を報告している。
全国登録の急性虚血性脳梗塞患者44,894名(N = 129,033)を対象に、5つのオフラインRLアルゴリズムファミリーと14の報酬設計の体系的,部分的に交差した評価を行った。
FQE(Standard Fitted Q-Evaluation)は、政策改善効果が+0.0069と明らかに見積もられ、早期神経学的劣化のペナルティが+0.0101に増加する。
代用端末の報酬がベースラインの重症度と予後をエンコードし,治療効果を付与する報奨組込みコンファウンディングを同定した。
2x2因子分析により、観測された信号の変化の218.6%が終末報酬の共起によるものであることが判明し、除去はヌルを過小評価する。
DMLにインスパイアされたGBM報酬の残留化の後、FQEの推定値は +0.0033 (p = 0.132) に減少し、完全分解収率は +0.0025 (p = 0.291) となる。
FQEに基づく診断、Tラーナー分析、直接再発分析は、臨床的に有意義な集合的改善から遠ざかっている。
1年間のmRS因子分析は減衰を再現する。
実証的な6段階評価チェックリストを提供する。
NIHSS-stratified heterogeneity(NIHSS-stratified heterogeneity)は、先進的なトライアル設計のための仮説生成である。
関連論文リスト
- Emergency Department Revisit Quality Review Screening: Exploring Human Decision-Making and Artificial Intelligence Support [0.5272195843074776]
潜在的なペアを自動的にスクリーニングし、事前に評価するアルゴリズムを作成しました。
臨床診断者の間では、医療用重力の再検討は目標と大きく関連していた。
KGAは、少なくとも1つのクリニカル・レーダに対して83-100%の正の予測値を達成し、さらなる評価が保証された。
論文 参考訳(メタデータ) (2026-09-09T16:37:35Z) - Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation [0.32553561239735207]
臨床的判断に取って代わるのではなく、拡張するように設計されたエンジンであるxAARAを提示する。
xAARAは、タスク、ムーブメントフェーズ、ムーブメント品質のレベルを越えて、キャリブレーションされた不確実性と説明でARATアセスメントを返します。
105回のストロークサバイバー(788回の運動)では、xAARAは94.2%のタスク精度と81.3%の移動位相精度を達成した。
論文 参考訳(メタデータ) (2026-06-23T09:00:15Z) - A Breast Vision Pathology Foundation Model for Real-world Clinical Utility [65.57568187389113]
a bfBRAVE, a breast-adaptive pathology foundation model developed and evaluation using a total resources of 101,638 breast wholeslide images。
臨床ワークフローにおけるBRAVEの実践的役割は、通常のAI支援による第2レビューから低リスクのケースを安全に排除すること、そしてさらなる評価のためのケースの優先順位付けなどである。
論文 参考訳(メタデータ) (2026-05-06T07:44:39Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing [0.4349324020366305]
大規模言語モデル(LLM)は、医療問題に対する回答を約束するが、臨床的使用は、弱い検証、不十分な証拠の根拠、信頼できない信頼のシグナルによって制限される。
本稿では,補完的なLCMとエビデンス検索,不確実性推定,バイアスチェックを組み合わせて回答信頼性を向上させるマルチエージェント医療QAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-15T14:17:27Z) - Organ-Agents: Virtual Human Physiology Simulator via LLMs [66.40796430669158]
オルガン-エージェント(Organ-Agents)は、LDM駆動のエージェントを介して人間の生理学をシミュレートする多エージェントフレームワークである。
症例は7,134例,コントロール7,895例で,9系統および125変数にわたる高分解能トラジェクトリを作成した。
臓器抗原は4,509人の保留患者に対して高いシミュレーション精度を達成し, システムごとのMSE0.16とSOFA系重症度層間の堅牢性を示した。
論文 参考訳(メタデータ) (2025-08-20T01:58:45Z) - DSA-NRP: No-Reflow Prediction from Angiographic Perfusion Dynamics in Stroke EVT [2.5191548037496805]
持続的微小血管低灌流によって定義される非逆流は、組織回復を損なうとともに臨床結果の悪化を引き起こす。
標準的な臨床実践は、パルス後24時間以内に灌流磁気共鳴画像(MRI)に頼り、介入を遅らせる。
本稿では,血管内血栓摘出直後の血流の予測を行う機械学習フレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-06-20T22:40:51Z) - A Novel Multi-Task Teacher-Student Architecture with Self-Supervised Pretraining for 48-Hour Vasoactive-Inotropic Trend Analysis in Sepsis Mortality Prediction [0.0]
Masked Autoencoder (MAE) を用いた自己教師型セシスプレトレーニングによる教師学習型マルチタスクフレームワークを提案する。
教師モデルは死亡率分類と重度スコア回帰を行い、生徒は堅牢な時系列表現を蒸留する。
LSTM法と比較して,MIMIC-IV 3.0(9,476例)のAUROCは0。
我々の新しいマルチタスクと蒸留戦略は、リスクの高い患者の早期発見を可能にし、予測精度と疾患管理を改善し、ICU意思決定支援のための新しいツールを提供する。
論文 参考訳(メタデータ) (2025-02-24T04:38:59Z) - Learning to diagnose cirrhosis from radiological and histological labels
with joint self and weakly-supervised pretraining strategies [62.840338941861134]
そこで本稿では, 放射線学者が注釈付けした大規模データセットからの転写学習を活用して, 小さい付加データセットで利用できる組織学的スコアを予測することを提案する。
我々は,肝硬変の予測を改善するために,異なる事前訓練法,すなわち弱い指導法と自己指導法を比較した。
この方法は、METAVIRスコアのベースライン分類を上回り、AUCが0.84、バランスの取れた精度が0.75に達する。
論文 参考訳(メタデータ) (2023-02-16T17:06:23Z) - Controlling False Positive/Negative Rates for Deep-Learning-Based
Prostate Cancer Detection on Multiparametric MR images [58.85481248101611]
そこで本研究では,病変からスライスまでのマッピング機能に基づく,病変レベルのコスト感受性損失と付加的なスライスレベルの損失を組み込んだ新しいPCa検出ネットワークを提案する。
1) 病変レベルFNRを0.19から0.10に, 病変レベルFPRを1.03から0.66に減らした。
論文 参考訳(メタデータ) (2021-06-04T09:51:27Z) - CovidDeep: SARS-CoV-2/COVID-19 Test Based on Wearable Medical Sensors
and Efficient Neural Networks [51.589769497681175]
新型コロナウイルス(SARS-CoV-2)がパンデミックを引き起こしている。
SARS-CoV-2の逆転写-ポリメラーゼ連鎖反応に基づく現在の試験体制は、試験要求に追いついていない。
我々は,効率的なDNNと市販のWMSを組み合わせたCovidDeepというフレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-20T21:47:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。