論文の概要: Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking
- arxiv url: http://arxiv.org/abs/2607.01103v1
- Date: Wed, 01 Jul 2026 15:55:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.975029
- Title: Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking
- Title(参考訳): 臨床診断のない臨床レベル合意:医療AIベンチマークにおけるLCM評価基準
- Abstract要約: MedQADEは、ドイツにおける最初の標準的オープンレスポンス臨床ベンチマークである。
最高のパフォーマンス評価モデルであるGemini 3 Flashは、医師の天井と一致している。
この統計的アライメントにもかかわらず、自動評価装置は臨床メタ認知に近づいた。
- 参考スコア(独自算出の注目度): 27.829988205900055
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-response evaluation provides stronger clinical validity than multiple-choice benchmarks but creates a scoring bottleneck that motivates automated LLM-asa-Judge approaches. Whether such evaluators replicate clinical calibration and caution, however, remains untested. We introduce MedQADE, the first standardised open-response clinical benchmark for German, a major clinical language lacking native evaluation infrastructure, comprising 3,800 items annotated by ten practising physicians and nine Large Language Model (LLM) evaluators. The top-performing evaluator model, Gemini 3 Flash, reached alignment consistent with the physician ceiling (\k{appa} = 0.694 vs. \k{appa} = 0.709), though wide confidence intervals limit interpretation. Despite this statistical alignment, automated evaluators exhibited near-absent clinical metacognition: physicians scaled abstention with item difficulty, while frontier models assigned definitive scores in every case. We additionally quantified systematic lineage-dependent biases, where models preferentially scored architectural siblings, an effect independent of language. These results show that statistical alignment does not ensure clinical caution, and that evaluator independence requires explicit verification.
- Abstract(参考訳): オープンレスポンス評価は、複数選択ベンチマークよりも強い臨床的妥当性を提供するが、自動LLM-asa-Judgeアプローチを動機付けるスコアボトルネックを生み出す。
しかし、そのような評価者が臨床検査を再現し、注意を喚起するかどうかは未確認である。
MedQADEは,10名の医師が注釈を付した3,800項目と,9名の大規模言語モデル(LLM)評価者からなる,ネイティブ評価基盤を欠いた主要な臨床言語である。
最高の性能評価モデルであるGemini 3 Flashは、医師の天井(\k{appa} = 0.694 vs. \k{appa} = 0.709)と一致した。
この統計的アライメントにもかかわらず、自動評価装置は、ほぼ絶対的な臨床メタ認知を示し、医師はアイテムの難易度で禁忌を拡大し、フロンティアモデルは全てのケースで決定的なスコアを割り当てた。
さらに、系統的な系統依存バイアスを定量化し、モデルが優先的にアーキテクチャ上の兄弟姉妹(言語に依存しない効果)を採点した。
これらの結果から, 統計的アライメントは臨床的に注意を払わず, 評価者の自立には明確な検証が必要であることが示唆された。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring [2.835587889687748]
マルチモーダル大言語モデル (LLM) は, 臨床環境において, 自動評価器として研究されている。
ロック描画テスト(CDT)画像の評価のための教師付きディープラーニングモデルに対して、3つのフロンティアLLMファミリーをベンチマークした。
NLP評価から臨床評価まで, LLM-as-a-judge バイアスの文献を拡張した。
論文 参考訳(メタデータ) (2026-05-11T15:37:24Z) - Detecting Stealth Sycophancy in Mental-Health Dialogue with Dynamic Emotional Signature Graphs [4.002154823241671]
最終審査員として大規模言語モデルに頼ることなく,多言語対応対話の評価を行う。
直接LLM判定器と対称テキスト類似度測定器は治療品質に不適合であることが判明した。
この問題に対処するため,動的感情署名グラフ(DESG)を提案する。
DESGは、分離された臨床状態を持つ対話ウィンドウを表現し、非対称な臨床幾何学を用いてそれらをスコアする。
論文 参考訳(メタデータ) (2026-05-05T07:56:20Z) - Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters [3.018184429993625]
スコアリングインスタンス毎のエキスパートレビューを必要とするメソッドは、安全で反復的なデプロイメントには遅すぎるし、コストも高くつく。
20人の臨床医が、プライマリケア、精神医学、腫瘍学、行動保健の823の患者に1,646個のルーブリックを作成した。
ケース固有のルーリックは、専門家の判断を維持しながら3桁のコストで自動化を可能にする、臨床AI評価のためのパスを提供する。
論文 参考訳(メタデータ) (2026-04-27T17:17:56Z) - Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness [49.2667937337333]
不完全な患者の医療反応を検出するために,この仮定をストレステストする。
我々は,2つの臨床診断データセットにわたる3つの粒度(General-Likert,Analytical-Rubric,Dynamic-Checklist)と3つのバックボーンモデルを評価する。
論文 参考訳(メタデータ) (2026-03-26T19:01:55Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models [8.050059911826338]
LLM(Large Language Models)は、標準化された医療試験に優れるが、高いスコアは、現実世界の医療クエリに対する高品質な応答に変換できないことが多い。
実世界の医療LCM評価に適した生態学的に有効なベンチマークであるQuarkMedBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-14T01:51:43Z) - MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences [50.71326426975699]
MedArenaは医療用大規模言語モデル(LLM)のためのインタラクティブな評価プラットフォームである。
MedArenaは、2つのランダムに選択されたモデルからの応答を表示し、ユーザが好みのレスポンスを選択するように要求する。
2025年11月1日までに12台のLLMで収集された1571の選好のうち、ジェミニ2.0フラッシュシンキング、ジェミニ2.5プロ、GPT-4oがブラッドリー・テリーのレーティングで上位3モデルとなった。
論文 参考訳(メタデータ) (2026-03-13T22:30:26Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - WER is Unaware: Assessing How ASR Errors Distort Clinical Understanding in Patient Facing Dialogue [3.468314243424983]
ASR(Automatic Speech Recognition)は、臨床対話においてますます普及している。
標準評価は依然としてエラーエラー率(WER)に大きく依存している。
本稿では、WERや他の一般的な指標が転写誤りの臨床的影響と相関するかどうかを基準として検討する。
論文 参考訳(メタデータ) (2025-11-20T16:59:20Z) - Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases [48.87360916431396]
MedR-Benchは1,453例の構造化患者のベンチマークデータセットで、推論基準を付した注釈付きである。
本稿では,3つの批判的診察勧告,診断決定,治療計画を含む枠組みを提案し,患者のケアジャーニー全体をシミュレートする。
このベンチマークを用いて、DeepSeek-R1、OpenAI-o3-mini、Gemini-2.0-Flash Thinkingなど、最先端の5つのLCMを評価した。
論文 参考訳(メタデータ) (2025-03-06T18:35:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。