論文の概要: LLMs Anchor on Chief Complaint and Fail to Integrate Evidence in Sequential Clinical Triage
- arxiv url: http://arxiv.org/abs/2609.22904v2
- Date: Thu, 24 Sep 2026 10:35:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.287425
- Title: LLMs Anchor on Chief Complaint and Fail to Integrate Evidence in Sequential Clinical Triage
- Title(参考訳): 症例報告 LLMsnchor on Chief Complaint and Fail to Integrence Evidence in Sequential Clinical Triage
- Abstract要約: 救急部門(ED)のトライアージ(Triage)は、順番に順番に展開するシーケンシャルな決定プロセスである。
大規模言語モデル (LLMs) の既存の評価は, トリアージ使用が完了した振り返り記録と, 医師のそれに近い性能を報告している。
本稿では,看護婦と患者との会話の序文からトリアージラベルを予測するタスクである,シーケンシャルトリアージに基づくLCMの評価手法を実装した。
- 参考スコア(独自算出の注目度): 11.399667430617397
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Triage in the emergency department (ED) is a sequential decision process that unfolds turn by turn. Existing evaluations of large language models (LLMs) for triage use completed retrospective records and report performance close to that of physicians. We implement a methodology for evaluating LLMs on sequential triage, the task of predicting a triage acuity label from a growing prefix of a nurse-patient conversation. We evaluate six LLMs at five sequential checkpoints on two corpora: 425 LLM-generated (SIMULATED) and 50 physician-authored (CLINICIAN) conversations, both labelled under the Emergency Severity Index (ESI). Every model, measured by quadratic weighted kappa (QWK), degrades from moderate-to-substantial agreement on completed records to fair-to-moderate agreement at every sequential checkpoint. Controlled perturbations show that the label at every checkpoint is anchored on the chief complaint exchanges, and prompting interventions fail to lift this plateau. Models extract clinically relevant content from later turns, yet the surprisal of the true label rises across the checkpoints. So the model fails to integrate the evidence. Three expert clinicians on the same conversations reach a QWK of 0.887-0.929, while the best model reaches 0.295. Predictions concentrate at ESI-2 and ESI-3, and models agree with each other more than with the ground truth, so ensembling worsens the failure. Deploying LLMs for ED triage based on offline benchmarks alone misses this sequential failure.
- Abstract(参考訳): 救急部門(ED)のトライアージ(Triage)は、順番に順番に展開するシーケンシャルな決定プロセスである。
大規模言語モデル (LLMs) の既存の評価は, トリアージ使用が完了した振り返り記録と, 医師のそれに近い性能を報告している。
本稿では,看護婦と患者との会話の序文からトリアージ・アキューティ・ラベルを推定する作業である,シーケンシャル・トリアージに基づくLCMの評価手法を実装した。
425LLM(simulated)と50CLINICIAN( doctor-authored)の2つのコーパスで6つのLDMを連続チェックポイントで評価した。
二次重み付きカッパ(QWK)によって測定されたすべてのモデルは、完了したレコードに対する中等から実質的な合意から、シーケンシャルなチェックポイント毎に公正からモデレートの合意に分解される。
制御された摂動は、すべてのチェックポイントのラベルが主要な苦情交換に固定されていることを示し、介入を促すことは、この高原を持ち上げるのに失敗することを示している。
モデルは後回から臨床的に関連のあるコンテンツを抽出するが、真のラベルの前提はチェックポイントを越えて上昇する。
したがって、モデルはエビデンスを統合するのに失敗する。
同じ会話で3人の専門医が0.887-0.929のQWKに達し、最良のモデルは0.295に達する。
予測はESI-2とESI-3に集中しており、モデルは基礎的な真実よりも互いに一致しているため、混乱は悪化する。
オフラインベンチマークのみに基づくEDトリアージ用のLLMのデプロイは、このシーケンシャルな失敗を見逃している。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety [0.0]
ストレステストでは、HealthBench会話の最後の半分を削除し、4つのプロジェクタLDM-judgeパネルとブラインドされたクリニックアンコールで回答をグラデーションすることで、4つのモデルをテストした。
評価対象の2つの結果は堅牢である。第一に、判断選択は明らかに安全性を著しく変える。
第二に、LLMの審査員は盲目の50石のサブサンプルで臨床医よりも寛容である。
論文 参考訳(メタデータ) (2026-07-21T08:05:35Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications [17.69274632062373]
オープンエンドの会話エージェントは、早期診断ハンドオフとサイレントな臨床幻覚という、2つの重要な障害モードを伴いがちである。
LLM-as-a-judge'のルーティングを決定論的オーケストレーション制約に置き換えることで、両方の問題に対処するマルチエージェントフレームワークを提案する。
本稿では,150症例を対象に,ラマ3.1-70b-インストラクトモデルを用いたシミュレートされた患者エージェントを用いたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-06-16T15:39:19Z) - TRIAGE: Dialectical Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series with LLMs [38.333764111610044]
競合する臨床結果に対する弁証的推論を生成するために, LLM を訓練するフレームワーク TRIAGE を提案する。
3つのISMTSベンチマークで評価され、TRIAGEは平均AUPRCの改善を3.3%達成し、キャリブレーションエラーを81%削減した。
論文 参考訳(メタデータ) (2026-06-08T04:53:44Z) - Few-Shot Large Language Models for Actionable Triage Categorization of Online Patient Inquiries [0.0]
オンライン患者の問い合わせは、しばしば非公式で不完全であり、専門家の査定の前に書かれるが、適切なレベルの臨床フォローアップにルーティングされなければならない。
我々はこれを,セルフケア,スケジュールビジット,緊急クリニシアンレビュー,緊急リファラルという,4段階の行動可能なトリアージタスクとして研究する。
我々は,低リソースラベル付け条件下で,大規模言語モデル(LLM)がそのようなルーティングをサポートできるかどうかを問う。
論文 参考訳(メタデータ) (2026-05-15T07:02:17Z) - Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring [2.835587889687748]
マルチモーダル大言語モデル (LLM) は, 臨床環境において, 自動評価器として研究されている。
ロック描画テスト(CDT)画像の評価のための教師付きディープラーニングモデルに対して、3つのフロンティアLLMファミリーをベンチマークした。
NLP評価から臨床評価まで, LLM-as-a-judge バイアスの文献を拡張した。
論文 参考訳(メタデータ) (2026-05-11T15:37:24Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness [49.2667937337333]
不完全な患者の医療反応を検出するために,この仮定をストレステストする。
我々は,2つの臨床診断データセットにわたる3つの粒度(General-Likert,Analytical-Rubric,Dynamic-Checklist)と3つのバックボーンモデルを評価する。
論文 参考訳(メタデータ) (2026-03-26T19:01:55Z) - MedForget: Hierarchy-Aware Multimodal Unlearning Testbed for Medical AI [66.0701326117134]
MedForgetは、階層型を意識したマルチモーダルなアンラーニングテストベッドで、準拠する医療AIシステムを構築する。
既存の手法は,診断性能を低下させることなく,完全かつ階層性に配慮した忘れの解決に苦慮していることを示す。
階層レベルのコンテキストをプロンプトに徐々に追加する再構成攻撃を導入する。
論文 参考訳(メタデータ) (2025-12-10T17:55:06Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。