論文の概要: Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning
- arxiv url: http://arxiv.org/abs/2608.03028v1
- Date: Tue, 04 Aug 2026 02:17:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.99631
- Title: Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning
- Title(参考訳): 医療安全推論における患者情報に対する副作用感受性の評価
- Abstract要約: MedPIC-Benchは、患者固有の薬剤安全推論のための、ソース検証可能な勧告と専門家検証された質問のベンチマークである。
ガイドラインを追従する質問と、患者情報の制御された変更が、ルールを適用するかどうかを変更するペアの対実的な質問を組み合わせる。
どのモデルも、平均精度は63.6%から45.1%に低下する。
- 参考スコア(独自算出の注目度): 26.32591007513051
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Applying a valid medication-safety rule when its patient-specific conditions are not met can produce an incorrect decision. Existing medical evaluations largely use isolated and fixed scenarios. A model may therefore answer correctly by recalling a drug-risk association without showing that it used patient information to decide whether the rule applies. To address this gap, we introduce MedPIC-Bench, a benchmark of source-verifiable recommendations and expert-validated questions for patient-specific medication-safety reasoning. It combines guideline-following questions with paired counterfactual questions in which a controlled change in patient information changes whether a rule applies. The benchmark contains 467 questions annotated along six clinical and reasoning dimensions. Across 28 medical-specific, general, and proprietary LLMs, every model performs worse on counterfactual questions, with mean accuracy falling from 63.6\% to 45.1\%. Models perform well when an explicit patient attribute directly signals a familiar contraindication, but struggle when patient information must narrow or withdraw a safety warning. Model rationales often acknowledge the changed patient information, yet the final answers retain the previous safety judgment. This vulnerability persists among medical-specific LLMs, whose average CF performance trails that of general LLMs. MedPIC-Bench therefore makes conditional rule application measurable and highlights the limitations of static medication-safety accuracy for assessing patient-specific reliability.
- Abstract(参考訳): 患者固有の条件が満たされていない場合に有効な薬剤安全規則を適用することは、誤った判断を下す可能性がある。
既存の医療評価は、主に孤立したシナリオと固定されたシナリオを使用する。
したがって、ルールが適用されるかどうかを判断するために患者情報を使用したことを示さずに、薬物リスク協会をリコールすることで、モデルが正しく答えることができる。
MedPIC-Benchは、患者固有の薬剤安全推論のための、情報源が検証可能な勧告と専門家が検証した質問のベンチマークである。
ガイドラインを追従する質問と、患者情報の制御された変更が、ルールを適用するかどうかを変更するペアの対実的な質問を組み合わせる。
このベンチマークには、6つの臨床的および推論次元に沿って注釈付けされた467の質問が含まれている。
28以上の医学種、一般種およびプロプライエタリなLSMでは、全てのモデルが対実的な問題に対して悪化し、平均精度は63.6\%から45.1\%に低下する。
明示的な患者属性が親しみやすい禁忌を直接通知した場合は、モデルがうまく機能するが、患者情報を狭めるか、あるいは安全警告を撤回する必要がある場合は、苦労する。
モデル論理学は患者情報の変更をしばしば認めるが、最終的な答えは以前の安全判断を保持する。
この脆弱性は、一般のLCMよりも平均的なCF性能が経過する医療用LCMの間で持続する。
したがって、MedPIC-Benchは条件付きルール適用を測定可能とし、患者固有の信頼性を評価するための静的な薬剤安全精度の限界を強調している。
関連論文リスト
- Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations [5.63130104359934]
ThReadMed-QAは、2,437人の患者と物理学者の会話スレッドのマルチターン医療対話データセットである。
このデータセットは、モデルがマルチターンコンテキスト下で誤解を検出し、修正できるかどうかを体系的に評価することを可能にする。
実験では、単一相互作用における誤解に対処できるフロンティアモデルでさえ、その後のターンよりも大幅に劣化する、一貫したパターンを明らかにした。
論文 参考訳(メタデータ) (2026-07-14T15:30:37Z) - Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs [2.526741713337939]
一般患者に類似した条件下で, 一般消費者向け健康 LLM の応答変動と薬効について検討した。
予防接種適性検査尺度や生殖姿勢尺度などの検証された尺度を多ターンプロンプトに適応した。
結果: マルチターン会話において, 症状を隠蔽する安定応答が得られた。
論文 参考訳(メタデータ) (2026-06-07T07:01:15Z) - Can I Take Another Dose? Evaluating LLM Decision-Making Under Temporal Uncertainty in OTC Dosing QA [1.3583317564926913]
提案するDOSEBENCHは,81個のOCCドッキングシナリオのベンチマークである。
我々は、意思決定の正確性、一貫性、説明の妥当性、障害タイプ、信頼性関連信号の指標を用いて、繰り返し実行中の4つのLCMを評価した。
論文 参考訳(メタデータ) (2026-06-02T22:30:15Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultations [2.337503919179969]
実際の医療相談で一般的に発生する患者行動について検討する。
各動作について、安全でない応答をキャプチャする具体的な障害基準を指定する。
患者発話に対する応答について,オープンおよびクローズドソースのLCMについて検討した。
論文 参考訳(メタデータ) (2026-03-31T07:42:07Z) - Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness [49.2667937337333]
不完全な患者の医療反応を検出するために,この仮定をストレステストする。
我々は,2つの臨床診断データセットにわたる3つの粒度(General-Likert,Analytical-Rubric,Dynamic-Checklist)と3つのバックボーンモデルを評価する。
論文 参考訳(メタデータ) (2026-03-26T19:01:55Z) - Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation [97.36081721024728]
本稿では,現実的な医療相談におけるマルチターンインタラクションの信頼性を評価するための最初のベンチマークを提案する。
本ベンチマークでは,3種類の医療データを統合し,診断を行う。
本稿では,エビデンスを基盤とした言語自己評価フレームワークであるMedConfを紹介する。
論文 参考訳(メタデータ) (2026-01-22T04:51:39Z) - A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care [5.167350493769989]
本研究は,NHSプライマリケアデータを用いたLSMベースの医薬品安全性評価システムの最初の評価である。
患者を戦略的に採取し,幅広い臨床複雑性と薬剤の安全性リスクを捉えた。
当システムでは,臨床症状の認識に強い性能を示した。
論文 参考訳(メタデータ) (2025-12-24T11:58:49Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - Structured Outputs Enable General-Purpose LLMs to be Medical Experts [50.02627258858336]
大規模言語モデル(LLM)は、しばしばオープンエンドの医学的問題に苦しむ。
本稿では,構造化医療推論を利用した新しいアプローチを提案する。
我々の手法は85.8のファクチュアリティスコアを達成し、微調整されたモデルを上回る。
論文 参考訳(メタデータ) (2025-03-05T05:24:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。