論文の概要: Unmentioned Checklist Findings Change How Reinforcement Learning Appears to Improve Chest Radiograph Report Checking
- arxiv url: http://arxiv.org/abs/2610.05425v1
- Date: Sun, 04 Oct 2026 18:06:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:51:30.600543
- Title: Unmentioned Checklist Findings Change How Reinforcement Learning Appears to Improve Chest Radiograph Report Checking
- Title(参考訳): 胸部X線検査を改善するための強化学習の仕方を変える未確認チェックリスト
- Abstract要約: 胸部X線写真から12フィンディングチェックリストを記入するために視覚言語モデルを訓練する。
別個のチェックモデルがチェックリストから文章を判断した。
留置した患者では、トレーニングに使用せず、ルールベースのチェックと独立した医療チェッカーが、差別の利得を測定した。
- 参考スコア(独自算出の注目度): 29.03033543528881
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated checks of radiology reports may rely on AI-generated checklists that leave findings unmentioned. We used reinforcement learning to train a vision-language model to fill in a 12-finding checklist from a chest radiograph without seeing the sentence under test; a separate checking model judged the sentence from the checklist. On held-out patients, a rule-based check and an independent medical checker, neither used in training, measured discrimination gains (Youden index) of 12.6% and 11.8%; only the rule-based check met the prespecified false-alarm criterion. Switching to the training format, which fixes finding order and enters unmentioned findings as absent, raised the training checker's measured gain and lowered the independent checker's, a prespecified comparison that yielded 6.2% (95% interval 2.0% to 10.5%) and, post hoc on held-out patients, 7.7%. Across 8 checking models, acceptance of a label-consistent negative statement about an unmentioned finding ranged from 1.0% to 97.0%. Labels were report-derived, not radiologist-adjudicated.
- Abstract(参考訳): 放射線学レポートの自動チェックは、発見を未然に残すAI生成チェックリストに依存する可能性がある。
テスト対象の文を見ることなく,視覚言語モデルを用いて胸部X線写真から12フィンディングチェックリストを入力し,チェックリストから別のチェックモデルで判断した。
保持された患者では、ルールベースのチェックと独立した医療チェッカーはトレーニングには使用されず、差別の利得(ユーデン指数)は12.6%と11.8%であり、ルールベースのチェックのみが所定の偽アラーム基準を満たしている。
検査の順序を正し、未確認の発見を欠いたまま入力する訓練形式に切り替えると、トレーニングチェッカーの測定値が上昇し、独立したチェッカーの値が下がった。
8つのチェックモデル全体で、未解決の発見に関するラベル一貫性のある負のステートメントは1.0%から97.0%の範囲で受け入れられた。
ラベルは報告によるものであり、放射線学者によるものではない。
関連論文リスト
- Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training [45.727227890697556]
我々は,9,961のソースタスクから50,228のエラー診断ペアからなるエージェントエラーデータセット(AED)を紹介した。
5段階のAgenic Error-to-Trainingパイプラインは自然の故障を収集し、診断と修正案を生成し、記録された証拠と照合する。
アクタートレーニングのレシピの比較において、アクションオンリーの修復トレーニングは成功オンリーのトレーニングよりもWebShop-liteの方が6.67ポイント高い。
論文 参考訳(メタデータ) (2026-09-30T16:40:22Z) - Evaluation Choices Shape Biomedical ML Claims: A Pediatric Pneumonia Benchmark Case Study [0.0]
分割,トレーニングポリシ,しきい値,メトリック,キャリブレーション,不確実性が通信されない場合に,高いベンチマークスコアが異なる結論をサポートすることを示す。
これらの結果から,分割,トレーニングポリシ,しきい値,メトリック,キャリブレーション,不確実性が通信されない場合に,高いベンチマークスコアが異なる結論を支持できることが示唆された。
論文 参考訳(メタデータ) (2026-09-29T15:42:15Z) - The Model Proposes, the Code Disposes: A Pre-Registered Ablation of a Verifier-and-Acceptance Stage in an LLM-Orchestrated Offensive-Security Agent [0.0]
決定的コードによって検証が強制されるモデル検証装置である検証受理段階が、LCMが主導する攻撃セキュリティエージェントが報告するものを変更するかどうかを評価する。
本報告では,15回の探索パイロット,20回の予備登録検定アブレーション,および2回の故意に脆弱な検査対象を40回実施した2×2因子分析を行った。
検証者はシステムが提供するものを変更し、決定論的コードは強制と監査性を提供します。
論文 参考訳(メタデータ) (2026-09-14T17:13:05Z) - Target leakage, not model class, explains reported accuracy in survey-based cardiovascular screening: a leakage-tiered audit of glass-box and tabular foundation models [0.0]
スクリーニングモデルは、レシーバー操作特性曲線(AUROC)の領域を0.89付近で定期的に報告する。
心臓梗塞に対するリニア,ツリーアンサンブル,ニューラル,ガラスボックス,タブ状ファンデーションにまたがる10種類の分類器をベンチマークした。
診断後の2つの特徴を取り除いたため、全てのモデル 0.049-0.051 AUROC はフィールドを0.0045幅のバンドに崩壊させた。
ある閾値では、男性の89.0%に対して女性の脳梗塞の75.4%が検出され、モデルの形状機能の編集により、ギャップは0.010に縮小された。
論文 参考訳(メタデータ) (2026-09-10T17:29:15Z) - Wolff-Parkinson-White Detection at 471:1 Class Imbalance: A Leakage-Controlled Study of the Data Bottleneck [0.0]
Wolff-Parkinson-White症候群 (WPW) は先天性心前駆症であり、臨床的には重要であり、12誘導心電図では欠落することが多い。
PTB-XL と Chapman-Shaoxing-Ningbo の2つの公開 12-lead corpora: 66,951 レコード,142 レコードの WPW は 0.21% (約471:1) である。
事前に規定された1つのリーク制御プロトコルの下では、ホールドアウトフォールドが正確に1回接触し、信号の7つの表現を比較し、分割と評価を固定する。
論文 参考訳(メタデータ) (2026-07-27T20:57:46Z) - Bayesian uncertainty estimation improves clinical decision making in medical AI agents [3.251669068529209]
モンテカルロのドロップアウトは、トレーニングセットのスケールをまたいだ一般化を追跡できる不確実な信号であり、信頼できながらエラーを起こしやすい予測を示す。
コントロールされた2x2因子分析実験において、臨床判定支援剤は、生のスコアではなくバイナリエラーリスクフラグとして配信された場合にのみ、この不確実性を利用した。
論文 参考訳(メタデータ) (2026-07-22T11:54:23Z) - Explainable Admission-Level Predictive Modeling for Prolonged Hospital Stay in Elderly Populations: Challenges in Low- and Middle-Income Countries [65.4286079244589]
長期滞在期間 (pLoS) は, 院内感染のリスクに関連する重要な要因である。
入院レベルの患者と病院の診療データを用いて, pLosの予測モデルを開発し, 解説する。
論文 参考訳(メタデータ) (2026-01-07T23:35:24Z) - Learning to diagnose cirrhosis from radiological and histological labels
with joint self and weakly-supervised pretraining strategies [62.840338941861134]
そこで本稿では, 放射線学者が注釈付けした大規模データセットからの転写学習を活用して, 小さい付加データセットで利用できる組織学的スコアを予測することを提案する。
我々は,肝硬変の予測を改善するために,異なる事前訓練法,すなわち弱い指導法と自己指導法を比較した。
この方法は、METAVIRスコアのベースライン分類を上回り、AUCが0.84、バランスの取れた精度が0.75に達する。
論文 参考訳(メタデータ) (2023-02-16T17:06:23Z) - Claim Check-Worthiness Detection as Positive Unlabelled Learning [53.24606510691877]
クレームチェックの信頼性検出はファクトチェックシステムにおいて重要な要素である。
これらの課題の根底にあるクレームチェックの信頼性検出における中心的な課題を照明する。
我々の最良の手法は、正の非競合学習の変種を用いて、これを自動的に修正する統一的なアプローチである。
論文 参考訳(メタデータ) (2020-03-05T16:06:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。