論文の概要: ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral
- arxiv url: http://arxiv.org/abs/2608.10885v1
- Date: Tue, 11 Aug 2026 13:02:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.04551
- Title: ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral
- Title(参考訳): ConfTriage: LLM Triage Framework for lung nodule Malignancy with Selective Specialist Deferral
- Abstract要約: 我々は,標準結節属性の忠実な自然言語レンダリングのみを読み取る一般大規模言語モデル (LLM) が,校正三重項層として機能するかどうかを検討する。
本稿では, 言語をモダリティとして, キャリブレーションを安全機構として, および低信頼ケースのための選択的なDLバックストップとして, 3つの柱上に構築した信頼度校正手法であるConfTriageを提案する。
- 参考スコア(独自算出の注目度): 3.306924107222105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pulmonary nodule malignancy prediction typically depends on image-trained specialist deep learning (DL) models that require substantial annotated imaging data and task-specific training. We investigate whether a generalist large language model (LLM), reading only a faithful natural-language rendering of standard nodule attributes, can serve as a calibrated triage layer. We propose ConfTriage, a confidence-calibrated method built on three pillars: language as the modality, calibration as the safety mechanism, and a selective specialist DL backstop for low-confidence cases. We prove two guarantees: a finite-sample combined-error bound yielding an explicit per-threshold operational certificate, and an oracle inequality showing that excess risk over the Bayes-optimal deferral classifier is controlled by the L1 calibration error of the LLM probability. A controlled seven-way input ablation across five frontier LLMs on LIDC-IDRI shows that natural-language descriptions dominate the diagnostic signal, while low-level image statistics are essentially diagnostically vacuous. ConfTriage achieved an F1 score of 88.22% and an AUC of 0.92, resolving 76.5% of cases using zero-shot LLM inference alone and referring only uncertain cases to the specialist DL backstop. These results demonstrate that clinically meaningful diagnostic information can be captured through structured radiological descriptions and leveraged by calibrated LLMs for selective referral. The framework suggests a practical pathway for combining generalist LLM prediction with specialist AI models in medical decision-support systems. Source code is publicly available at https://github.com/rabiul-ai/ConfTriage.
- Abstract(参考訳): 肺結節悪性度予測は、画像訓練された専門的ディープラーニング(DL)モデルに依存する。
我々は,標準結節属性の忠実な自然言語レンダリングのみを読み取る一般大規模言語モデル (LLM) が,校正三重項層として機能するかどうかを検討する。
本稿では, 言語をモダリティとして, キャリブレーションを安全メカニズムとして, および低信頼ケースのための選択的なDLバックストップとして, 3つの柱上に構築した信頼度校正手法であるConfTriageを提案する。
LLM確率のL1キャリブレーション誤差によってベイズ最適デフェラル分類器の過大なリスクが制御されることを示す。
LIDC-IDRI上の5つのフロンティアLCMに対する制御された7方向入力アブレーションは、自然言語による記述が診断信号を支配していることを示している。
ConfTriageはF1スコア88.22%、AUC0.92を達成し、ゼロショットLSM推論だけで76.5%のケースを解決した。
以上の結果から, 臨床的に有意な診断情報は, 構造化された放射線学的記述を通し, 校正LDMを用いて選択的レファラルに活用できることが示唆された。
このフレームワークは、一般のLSM予測と専門的なAIモデルを組み合わせた医療意思決定支援システムの実践的な経路を示唆している。
ソースコードはhttps://github.com/rabiul-ai/ConfTriage.comで公開されている。
関連論文リスト
- An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography [1.3023698730561286]
大きな言語モデル(LLM)は、医学的画像解釈において有望であるが、幻覚、限られた精度、実行間不整合に悩まされている。
我々は、眼底写真から緑内障を検出するための特殊なディープラーニングツールとLLMを統合したエージェントAIフレームワークを開発し、検証した。
論文 参考訳(メタデータ) (2026-08-07T17:33:12Z) - Teaching LLMs to Recommend and Defer in Underrepresented Epilepsy Care [5.027305497521]
我々は,小患者レベルのトレーニングセットから局所的な処方指導を学習する,非自明なプロンプト学習フレームワークであるMANANAを紹介する。
Mananaは、観察された処方のエラーを監査可能なプロンプトメモリに変換し、単一のエージェントとマルチエージェントのバリエーションでインスタンス化し、古典的なMLモデルよりも改善する。
論文 参考訳(メタデータ) (2026-06-30T02:09:37Z) - LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data [2.1443570696048906]
大規模言語モデル(LLM)は、構造化された臨床データにますます適用される。
Qwen 2.5 7B と XGBoost を比較する。
論文 参考訳(メタデータ) (2026-06-17T18:49:44Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - TRIAGE: Dialectical Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series with LLMs [38.333764111610044]
競合する臨床結果に対する弁証的推論を生成するために, LLM を訓練するフレームワーク TRIAGE を提案する。
3つのISMTSベンチマークで評価され、TRIAGEは平均AUPRCの改善を3.3%達成し、キャリブレーションエラーを81%削減した。
論文 参考訳(メタデータ) (2026-06-08T04:53:44Z) - CauTion: Knowing When to Trust LLMs for Ensemble Causal Discovery [51.07538881798502]
大規模言語モデル(LLM)は、統計的推論を補完する将来的なドメイン知識の源を提供する。
我々は、LLMドメイン知識を統計的因果探索アルゴリズムのアンサンブルに確実に統合するフレームワークであるCauTionを提案する。
CauTionは、データ中心とLLM拡張ベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2026-06-02T13:07:43Z) - A Multi-Stage Validation Framework for Trustworthy Large-scale Clinical Information Extraction using Large Language Models [1.9110728489340625]
大規模言語モデル(LLM)は、非構造化の健康記録から臨床的に意味のある情報を抽出する約束を示す。
LLMに基づく臨床情報抽出のための多段階検証フレームワークを提案する。
919,783名の臨床ノートから11種類の物質分類で診断された物質使用障害の抽出に本枠組みを適用した。
論文 参考訳(メタデータ) (2026-04-07T16:23:52Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation [51.96735866702332]
PreBAはPCA重み付き検索とベイズ平均アグリゲーションを統合した検索拡張フレームワークである。
例えば、PreBAはパフォーマンスを大幅に改善し、MAEを最大40%削減し、ゼロショット推論でR2を-0.13から0.62に引き上げる。
論文 参考訳(メタデータ) (2026-02-27T07:19:23Z) - Conformal Lesion Segmentation for 3D Medical Images [82.92159832699583]
本稿では,データ駆動しきい値の校正をコンフォーマル化することで,テスト時間FNRが目標許容値以下であることを保証する,リスク制約付きフレームワークを提案する。
5つのバックボーンモデルにまたがる6つの3D-LSデータセット上でのCLSの統計的健全性と予測性能を検証し,臨床実践におけるリスク認識セグメンテーションの展開に関する実用的な知見を得た。
論文 参考訳(メタデータ) (2025-10-19T08:21:00Z) - Performance of Dual-Augmented Lagrangian Method and Common Spatial
Patterns applied in classification of Motor-Imagery BCI [68.8204255655161]
運動画像に基づく脳-コンピュータインタフェース(MI-BCI)は、神経リハビリテーションのための画期的な技術になる可能性がある。
使用する脳波信号のノイズの性質のため、信頼性の高いBCIシステムは特徴の最適化と抽出のために特別な手順を必要とする。
論文 参考訳(メタデータ) (2020-10-13T20:50:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。