論文の概要: Clinician input steers frontier AI models toward both accurate and harmful decisions
- arxiv url: http://arxiv.org/abs/2603.14158v1
- Date: Sat, 14 Mar 2026 23:47:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-17 16:19:35.641763
- Title: Clinician input steers frontier AI models toward both accurate and harmful decisions
- Title(参考訳): 臨床入力ステアフロンティアAIモデルによる正確かつ有害な意思決定
- Abstract要約: 8つのフロンティアモデルにまたがる21の言語モデル (LLM) を, 差分診断生成と次のステップ勧告に基づいて評価した。
専門的な文脈は、21モデル全体にわたる正しい最終診断の包含を著しく改善した。
GPT-4o 実験では, 臨床症状の明確な不確実性信号により, 対側的文脈での診断性能が向上した。
- 参考スコア(独自算出の注目度): 10.599240857217811
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are entering clinician workflows, yet evaluations rarely measure how clinician reasoning shapes model behavior during clinical interactions. We combined 61 New England Journal of Medicine Case Records with 92 real-world clinician-AI interactions to evaluate 21 reasoning LLM variants across 8 frontier models on differential diagnosis generation and next step recommendations under three conditions: reasoning alone, after expert clinician context, and after adversarial clinician context. LLM-clinician concordance increased substantially after clinician exposure, with simulations sharing >=3 differential diagnosis items rising from 65.8% to 93.5% and >=3 next step recommendations from 20.3% to 53.8%. Expert context significantly improved correct final diagnosis inclusion across all 21 models (mean +20.4 percentage points), reflecting both reasoning improvement and passive content echoing, while adversarial context caused significant diagnostic degradation in 14 models (mean -5.4 percentage points). Multi-turn disagreement probes revealed distinct model phenotypes ranging from highly conformist to dogmatic, with adversarial arguments remaining a persistent vulnerability even for otherwise resilient models. Inference-time scaling reduced harmful echoing of clinician-introduced recommendations across WHO-defined harm severity tiers (relative reductions: 62.7% mild, 57.9% moderate, 76.3% severe, 83.5% death-tier). In GPT-4o experiments, explicit clinician uncertainty signals improved diagnostic performance after adversarial context (final diagnosis inclusion 27% to 42%) and reduced alignment with incorrect arguments by 21%. These findings establish a foundation for evaluating clinician-AI collaboration, introducing interactive metrics and mitigation strategies essential for safety and robustness.
- Abstract(参考訳): 大規模言語モデル(LLM)は臨床のワークフローに導入されているが、臨床間の相互作用において、臨床の推論がモデル行動をどのように形作るかを評価することは滅多にない。
61のニューイングランド・ジャーナル・オブ・メディカル・ケース・レコーズと92のリアル・ワールド・クリニック・AIインタラクションを併用し,8つのフロンティアモデルにまたがるLLM変異の推論と次のステップレコメンデーションを3つの条件下で評価した。
LLM-clinician concordance(LLM-clinician concordance, LLM-clinician concordance, LLM-clinician Concordance, LLM-clinician Concordance, LLM-clinician Concordance, LLM-clinician Concordance)は, 65.8%から93.5%, >==3の次ステップレコメンデーションが20.3%から53.8%に増加した。
専門家の文脈は、すべての21モデル(平均+20.4ポイント)の正確な最終診断を著しく改善し、推論の改善と受動的内容のエコーの両方を反映した。
マルチターン不一致プローブは、高い適合性からドクトマティクスまで、異なるモデル表現型を示し、逆説は弾力性のあるモデルであっても永続的な脆弱性を保ったままである。
推論時間のスケーリングは、WHOが定義した有害度レベル(62.7%軽度、57.9%中等度、76.3%重度、83.5%死亡率)で臨床医が導入した勧告の有害なエコーを減らした。
GPT-4o実験では, 反対文脈(最終診断包含率27%から42%)後の診断性能を向上し, 誤った議論との整合性を21%低減した。
これらの知見は,安全性とロバスト性に不可欠な対話的指標と緩和戦略を導入し,臨床とAIの連携を評価する基盤を確立した。
関連論文リスト
- CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning [37.91882261875461]
大規模言語モデル (LLMs) は多くの医学ベンチマークにおいて強い結果が得られたが, 臨床的理由を確実に評価することは困難である。
プログレッシブな情報マスキング下でのLCM臨床推論を評価するための人為的ループ・フレームワークであるCLExEvalを紹介した。
論文 参考訳(メタデータ) (2026-06-30T12:56:42Z) - A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation [36.95302007351382]
PulmoFoundation(プルモファウンデーション)は、肺病理の総合的評価のための、RCT(RCT)評価基礎モデルである。
本モデルでは, 生検, 凍結部, 外科的切除スライスを対象とし, コア診断タスクにおける臨床成績を評価する。
論文 参考訳(メタデータ) (2026-05-25T14:04:56Z) - A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism [11.474807247446526]
TPA(Think, Plan, Ask)は,自閉症診断監視スケジュールモジュール4(ADOS-2)の言語評価コンポーネントに適用した,能動的多エージェント対話フレームワークである。
医師エージェントは、臨床的根拠のある戦略を選択し、対象とする質問を生成する前に、どの特徴が保存されていないのかを明確に理由づける。
実際のADOS-2臨床データに基づく患者エージェントは、実際の患者参加なしに再現可能な評価が可能であり、実際の患者言語に対する適切な忠実性を確認する3つの独立した実験で検証される。
論文 参考訳(メタデータ) (2026-05-21T19:45:46Z) - A Breast Vision Pathology Foundation Model for Real-world Clinical Utility [65.57568187389113]
a bfBRAVE, a breast-adaptive pathology foundation model developed and evaluation using a total resources of 101,638 breast wholeslide images。
臨床ワークフローにおけるBRAVEの実践的役割は、通常のAI支援による第2レビューから低リスクのケースを安全に排除すること、そしてさらなる評価のためのケースの優先順位付けなどである。
論文 参考訳(メタデータ) (2026-05-06T07:44:39Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations [60.2076951536797]
大規模言語モデル(LLM)は、医療シナリオにますます多くデプロイされている。
LLMが会話中に臨床ガイドラインを特定・遵守できるのかは不明確である。
CPGBenchは、LSMの臨床ガイドラインの検出と付着能力をベンチマークする自動フレームワークである。
論文 参考訳(メタデータ) (2026-03-26T09:00:55Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation [5.469454486414467]
大言語モデル (LLMs) は脊椎手術における臨床的決定支援の転換的可能性を提供する。
LLMは幻覚を通じて重大なリスクを引き起こすが、これは事実的に矛盾しているか、文脈的に不一致な出力である。
本研究は, 診断精度, 推奨品質, 推理堅牢性, 出力コヒーレンス, 知識アライメントを評価することによって, 幻覚リスクを定量化するための臨床中心の枠組みを提案する。
論文 参考訳(メタデータ) (2025-11-01T15:25:55Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks [47.486705282473984]
大規模言語モデル(LLM)は、医学試験においてほぼ完璧なスコアを得る。
これらの評価は、実際の臨床実践の複雑さと多様性を不十分に反映している。
MedHELMは,医療業務におけるLCMの性能を評価するための評価フレームワークである。
論文 参考訳(メタデータ) (2025-05-26T22:55:49Z) - Can Reasoning LLMs Enhance Clinical Document Classification? [7.026393789313748]
大規模言語モデル(LLM)は、このタスクの正確性と効率性において有望な改善を提供する。
本研究では,8つのLDMの性能と一貫性を評価する。4つの推論(Qwen QWQ, Deepseek Reasoner, GPT o3 Mini, Gemini 2.0 Flash Thinking)と4つの非推論(Llama 3.3, GPT 4o Mini, Gemini 2.0 Flash, Deepseek Chat)。
その結果、推論モデルは精度71%(68%)とF1スコア(67%(60%))で非推論モデルを上回った。
論文 参考訳(メタデータ) (2025-04-10T18:00:27Z) - Enhancing Diagnostic Accuracy through Multi-Agent Conversations: Using Large Language Models to Mitigate Cognitive Bias [5.421033429862095]
臨床的意思決定における認知的バイアスは、診断の誤りや患者下結果に大きく寄与する。
本研究では,多エージェントフレームワークの利用を通じて,これらのバイアスを軽減するために,大規模言語モデルが果たす役割について検討する。
論文 参考訳(メタデータ) (2024-01-26T01:35:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。