論文の概要: Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry
- arxiv url: http://arxiv.org/abs/2607.13036v1
- Date: Wed, 06 May 2026 08:52:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.000595
- Title: Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry
- Title(参考訳): 診断前の質問:精神医学におけるLCMのシークエンシャル評価ベンチマークであるセーフサイコ(Safe-Psych)
- Authors: Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler,
- Abstract要約: 大規模言語モデル(LLM)は、医療における意思決定支援にますます利用されている。
臨床証拠はしばしば不完全または進化している。
LLMが進化する診断の不確実性にどう対処するかを評価するためのベンチマークであるSafe-Psychを紹介する。
- 参考スコア(独自算出の注目度): 2.60905622443275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used for decision support in healthcare, but clinical evidence is often incomplete or evolving. When the available information is insufficient to support a reliable answer, models should request clarification or abstain rather than provide unsupported responses. Existing medical benchmarks, however, typically assume that complete information is available upfront. We introduce Safe-Psych, a sequential benchmark for evaluating how LLMs handle evolving diagnostic uncertainty in clinical psychiatry. Safe-Psych contains over 1,000 real-world psychiatric clinical notes segmented to simulate incremental evidence disclosure, with psychiatrist-derived action labels at each stage: DIAGNOSE, CLARIFY, or ABSTAIN. We evaluate multiple state-of-the-art LLMs in full-information and sequential settings. Our findings show that capability does not ensure calibration: even strong models struggle under incomplete clinical information, with under-abstention exceeding 60% for most models and safety-aware prompting reducing premature commitment only by shifting errors toward excessive abstention. In sequential evaluation, models frequently diagnose before sufficient evidence is available and rarely seek clarification unless explicitly prompted; these premature diagnoses are less accurate than on-time diagnoses. Overall, Safe-Psych reveals a limitation across the evaluated models: recognizing when clinical evidence is incomplete and additional information is needed. We release Safe-Psych to support research on improving LLM safety in healthcare.
- Abstract(参考訳): 大規模言語モデル(LLM)は、医療における意思決定支援にますます使われるが、臨床証拠は不完全または進化していることが多い。
信頼できる回答をサポートするのに利用可能な情報が不十分な場合、モデルはサポート対象の応答を提供するのではなく、明確化や中断を要求すべきである。
しかし、既存の医療ベンチマークでは、完全な情報が事前に利用できると仮定することが多い。
臨床精神医学における診断の不確かさの進展をLCMがどのように扱うかを評価するための逐次ベンチマークであるSafe-Psychを紹介した。
Safe-Psychには、インクリメンタルなエビデンス開示をシミュレートするために、1,000以上の現実世界の精神科臨床ノートが含まれており、それぞれのステージ(DIAGNOSE、CLARIFY、ABSTAIN)に精神科医由来のアクションラベルがある。
実測とシーケンシャルな設定で複数の最先端LCMを評価した。
以上の結果から, 強いモデルであっても, 不完全な臨床情報の下では困難であり, 大部分のモデルでは低拘束が60%を超え, 異常を過度な禁忌にシフトさせることで, 早期のコミットメントを減少させる可能性が示唆された。
シーケンシャルな評価では、十分な証拠が手に入る前にしばしばモデルが診断され、明示的に指示されない限り、明確化を求めることは稀であり、これらの早期診断はオンタイム診断よりも正確ではない。
全体として、Safe-Psychは、評価されたモデルにまたがる制限を明らかにしている: 臨床証拠が不完全であり、追加の情報が必要であることを認識する。
医療における LLM の安全性向上研究を支援するため, Safe-Psych をリリースする。
関連論文リスト
- When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations [1.0152838128195467]
大規模言語モデル (LLMs) は、臨床質問応答、診断支援、報告要約などのタスクのために医療でますます使われている。
彼らの約束にもかかわらず、これらのモデルは語彙的および構文的両方の微妙な急激な摂動に対して非常に敏感であり、安全クリティカルな臨床応用に重大なリスクをもたらす。
摂動を自然型, 逆型に分類し, モデル整合性, 精度, 信頼性に及ぼす効果について検討した。
論文 参考訳(メタデータ) (2026-06-05T13:07:11Z) - Medical Model Synthesis Architectures: A Case Study [72.46211022258122]
現在のAIシステムは、不確実性の下で調整された推論に苦労している。
我々は,不確実性の下で,現実的に有用だが公式に透過的な臨床予測を行うことができるAIシステムのためのフレームワークを提案する。
このフレームワークの最初の概念実証は、どのようにして差分診断に利用できるかを示す。
論文 参考訳(メタデータ) (2026-05-10T19:30:16Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making [38.53727520114093]
不完全な情報の下で決定可能性を評価するベンチマークであるClinDet-Benchを開発した。
近年の大規模言語モデル (LLM) は不完全情報に基づく決定可能性の同定に失敗している。
論文 参考訳(メタデータ) (2026-02-26T09:03:41Z) - MedClarify: An information-seeking AI agent for medical diagnosis with case-specific follow-up questions [26.936554184582096]
我々は,情報探索のためのAIエージェントであるMedClarifyを紹介し,反復推論のためのフォローアップ質問を生成する。
具体的には、MedClarifyは、鑑別診断に類似した候補診断のリストを計算し、積極的にフォローアップ質問を生成する。
論文 参考訳(メタデータ) (2026-02-19T12:19:12Z) - Timely Clinical Diagnosis through Active Test Selection [49.091903570068155]
本稿では,現実の診断推論をよりうまくエミュレートするためのACTMED (Adaptive Clinical Test selection via Model-based Experimental Design)を提案する。
LLMは柔軟なシミュレータとして機能し、構造化されたタスク固有のトレーニングデータを必要とせずに、患者状態のもっともらしい分布を生成し、信念の更新をサポートする。
我々は、実世界のデータセット上でACTMEDを評価し、診断精度、解釈可能性、リソース使用量を改善するためにテスト選択を最適化できることを示す。
論文 参考訳(メタデータ) (2025-10-21T18:10:45Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。