論文の概要: From Retinal Evidence to Safe Decisions: RETINA-SAFE and ECRT for Hallucination Risk Triage in Medical LLMs
- arxiv url: http://arxiv.org/abs/2604.05348v1
- Date: Tue, 07 Apr 2026 02:40:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.582991
- Title: From Retinal Evidence to Safe Decisions: RETINA-SAFE and ECRT for Hallucination Risk Triage in Medical LLMs
- Title(参考訳): 網膜エビデンスから安全決定へ:RETINA-SAFEとECRTによるLLMの幻覚リスクトリアージ
- Authors: Zhe Yu, Wenpeng Xing, Meng Han,
- Abstract要約: 医学大言語モデル(LLM)の幻覚は、特に利用可能な証拠が不十分で矛盾する場合、安全に重要な問題である。
糖尿病性網膜症 (DR) 判定設定におけるこの問題について検討し, 網膜グレーディング記録と整合したエビデンスグラウンドベンチマークであるRETINA-SAFEを導入する。
ステージ1はセーフ/アンセーフのリスクトリアージを行い、ステージ2は安全でないケースを矛盾駆動型とエビデンスギャップのリスクに洗練する。
- 参考スコア(独自算出の注目度): 19.317475241300397
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hallucinations in medical large language models (LLMs) remain a safety-critical issue, particularly when available evidence is insufficient or conflicting. We study this problem in diabetic retinopathy (DR) decision settings and introduce RETINA-SAFE, an evidence-grounded benchmark aligned with retinal grading records, comprising 12,522 samples. RETINA-SAFE is organized into three evidence-relation tasks: E-Align (evidence-consistent), E-Conflict (evidence-conflicting), and E-Gap (evidence-insufficient). We further propose ECRT (Evidence-Conditioned Risk Triage), a two-stage white-box detection framework: Stage 1 performs Safe/Unsafe risk triage, and Stage 2 refines unsafe cases into contradiction-driven versus evidence-gap risks. ECRT leverages internal representation and logit shifts under CTX/NOCTX conditions, with class-balanced training for robust learning. Under evidence-grouped (not patient-disjoint) splits across multiple backbones, ECRT provides strong Stage-1 risk triage and explicit subtype attribution, improves Stage-1 balanced accuracy by +0.15 to +0.19 over external uncertainty and self-consistency baselines and by +0.02 to +0.07 over the strongest adapted supervised baseline, and consistently exceeds a single-stage white-box ablation on Stage-1 balanced accuracy. These findings support white-box internal signals grounded in retinal evidence as a practical route to interpretable medical LLM risk triage.
- Abstract(参考訳): 医学大言語モデル(LLM)の幻覚は、特に利用可能な証拠が不十分で矛盾する場合、安全に重要な問題である。
糖尿病性網膜症(DR)判定設定におけるこの問題について検討し,12,522サンプルからなる網膜グレーディング記録に一致した根拠付きベンチマークであるRETINA-SAFEを導入する。
RETINA-SAFEは、E-Align (evidence-consistent)、E-Conflict (evidence-conflicting)、E-Gap (evidence-insufficient)の3つのエビデンス関連タスクに分けられる。
さらに,2段階のホワイトボックス検出フレームワークであるECRT(Evidence-Conditioned Risk Triage)を提案する。
ECRTはCTX/NOCTX条件下での内部表現とロジットシフトを活用する。
強いステージ1リスクトリアージと明示的なサブタイプ属性を提供し、外的不確実性と自己整合性のベースラインに対して+0.15から+0.19の精度、最も適応された教師付きベースラインに対して+0.02から+0.07の精度を向上し、ステージ1のバランスの正確性に対して一段のホワイトボックスのアブレーションを一貫して超える。
これらの知見は、網膜の証拠に基づいたホワイトボックス内部シグナルを、医療用LDMリスクトリアージの解釈のための実用的な方法としてサポートしている。
関連論文リスト
- Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - The Scaffold Effect: How Prompt Framing Drives Apparent Multimodal Gains in Clinical VLM Evaluation [1.9655003184977389]
臨床画像コホートであるtextscFOR2107 と textscOASIS-3 の2値分類により,12個のオープンウェイト視覚言語モデル(VLM)を評価した。
これらの条件下では、より小さなVLMは、ニューロイメージングの文脈を導入すると最大58%のF1のゲインを示し、蒸留されたモデルは、桁違いに大きいものと競合するようになる。
論文 参考訳(メタデータ) (2026-03-30T12:58:10Z) - Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis [0.0]
Cross-Context Verification (CCV) は、N個の独立したセッションで同じベンチマーク問題を解決するブラックボックス方式である。
9つのSWE分岐検証問題(45の試験、クロードオプス4.6、温度0)では、CCVは汚染されたものと真の推論との間の完全な分離を達成する。
論文 参考訳(メタデータ) (2026-03-23T00:18:34Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing [0.4349324020366305]
大規模言語モデル(LLM)は、医療問題に対する回答を約束するが、臨床的使用は、弱い検証、不十分な証拠の根拠、信頼できない信頼のシグナルによって制限される。
本稿では,補完的なLCMとエビデンス検索,不確実性推定,バイアスチェックを組み合わせて回答信頼性を向上させるマルチエージェント医療QAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-15T14:17:27Z) - Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation [5.469454486414467]
大言語モデル (LLMs) は脊椎手術における臨床的決定支援の転換的可能性を提供する。
LLMは幻覚を通じて重大なリスクを引き起こすが、これは事実的に矛盾しているか、文脈的に不一致な出力である。
本研究は, 診断精度, 推奨品質, 推理堅牢性, 出力コヒーレンス, 知識アライメントを評価することによって, 幻覚リスクを定量化するための臨床中心の枠組みを提案する。
論文 参考訳(メタデータ) (2025-11-01T15:25:55Z) - SDF-Bayes: Cautious Optimism in Safe Dose-Finding Clinical Trials with
Drug Combinations and Heterogeneous Patient Groups [84.63561578944183]
本稿では,薬物の最大許容量(MTD)を臨床試験で検索するための新しいベイズ設計であるSDF-Bayesを提案する。
SDF-Bayesは、1つの薬物の現在の投与量をエスカレートまたは脱エスカレートする従来の原則ではなく、慎重な楽観主義によって進行する。
合成データセットと実世界データセットの両方に基づく広範な実験は、最先端のDC試験設計よりもSDFベイズの利点を示しています。
論文 参考訳(メタデータ) (2021-01-26T18:59:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。