論文の概要: K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations
- arxiv url: http://arxiv.org/abs/2609.15855v2
- Date: Tue, 15 Sep 2026 07:30:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.102639
- Title: K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations
- Title(参考訳): K-Bench:リスクの高いメンタルヘルス会話における大規模言語モデルの評価のための臨床校正ベンチマーク
- Abstract要約: K-Benchは、14のプロバイダから33のベースモデルを表す125のモデル構成を評価する。
凍ったGPT-4o判事は6,751項目の比較で、臨床医のコンセンサスと94.2%の正確な一致を得た。
主観的モデルは強い支持的会話と複合リスクスコアを95以上と組み合わせた。
- 参考スコア(独自算出の注目度): 1.6247217262916298
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: People increasingly use large language models (LLMs) for mental health support, yet their safety in evolving, high-risk conversations remains poorly characterised. We developed K-Bench, a clinician-calibrated, protected benchmark evaluating 125 model configurations representing 33 base models from 14 providers across a fixed cohort of 200 multi-turn vignettes involving suicide, self-harm, domestic violence, substance misuse, and no-risk presentations. Synthetic patient conversations showed substantial distributional overlap with real human-AI conversations. A frozen GPT-4o judge achieved 94.2% exact agreement with clinician consensus across 6,751 eligible item comparisons from 151 clinician-rated transcripts. Leading models combined strong supportive conversation with combined-risk scores above 95, whereas risk exploration exposed substantial variation among lower-performing configurations. Therapeutic prompting produced configuration-specific gains concentrated among weaker models, while elevated reasoning produced no average improvement. K-Bench combines broader clinical coverage and configuration-scale comparison with a continuously updated public leaderboard whose operational test materials are protected from direct optimisation. The leaderboard is available at www.k-bench.ai.
- Abstract(参考訳): 人々はメンタルヘルスサポートのために大きな言語モデル(LLMs)をますます使うが、進化するハイリスクな会話における安全性はいまだに貧弱である。
K-Benchは,自殺,自傷行為,家庭内暴力,薬物乱用,リスクのないプレゼンテーションを含む200の多ターンヴィグネットの固定コホートにおいて,14のプロバイダから33のベースモデルを表す125のモデル構成を評価する。
人工的な患者会話は実際の人間とAIの会話と大きく重なる傾向を示した。
凍ったGPT-4oの裁判官は151の臨床分類書から6,751の項目を比較して、クリニックのコンセンサスと94.2%の正確な一致を得た。
主観的モデルは強い支持的会話と複合リスクスコアを95以上と組み合わせた。
治療的プロンプトは、より弱いモデルの間で構成固有の利得を集中させ、高い推論は平均的な改善をもたらすことはなかった。
K-Benchは、より広範な臨床カバレッジと構成スケールの比較を、運用試験材料が直接最適化から保護される、継続的に更新された公開リーダーボードと組み合わせている。
リーダーボードはwww.k-bench.aiで入手できる。
関連論文リスト
- Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting [59.709162055944915]
ThyroidXAgentは、特殊な診断ツールをコーディネートし、その出力を監査可能なケースレベルの証拠記録として保存するエージェントAIシステムである。
NHC-MISD-TUSコホート内35施設8,721件を含む,重複しない28,458件の検査を行った。
セグメンテーションでは平均Diceスコアが87.21パーセント、良悪性分類では平均AUROCが0.9466だった。
論文 参考訳(メタデータ) (2026-08-12T21:02:59Z) - PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents [5.247635961504091]
patientAgentBenchは、患者が直面するエージェント医療をベンチマークする。
シミュレーションされた患者と会話しながら、医療ツールのサンドボックスでエージェントにラップされた基礎モデルを評価する。
同じ1200のシナリオで、同じ4つのファミリーで10のモデルをベンチマークし、臨床的なギャップを見つけました。
論文 参考訳(メタデータ) (2026-07-28T09:24:04Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment [3.1849948640573245]
AcuityBenchは、言語モデルがユーザの医療プレゼンテーションから適切なケアの緊急性を特定するかどうかを評価するためのベンチマークである。
ユーザ会話、オンラインフォーラム投稿、臨床ヴィグネット、患者のポータルメッセージにまたがる5つの公開データセットで構成されている。
QA設定での明示的な4方向分類と、ルーリックベースの判定器で評価された自由形式の会話応答の2つの補完的なタスク形式をサポートする。
論文 参考訳(メタデータ) (2026-05-12T01:39:46Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - Clinician input steers frontier AI models toward both accurate and harmful decisions [10.599240857217811]
8つのフロンティアモデルにまたがる21の言語モデル (LLM) を, 差分診断生成と次のステップ勧告に基づいて評価した。
専門的な文脈は、21モデル全体にわたる正しい最終診断の包含を著しく改善した。
GPT-4o 実験では, 臨床症状の明確な不確実性信号により, 対側的文脈での診断性能が向上した。
論文 参考訳(メタデータ) (2026-03-14T23:47:53Z) - LiveClin: A Live Clinical Benchmark without Leakage [50.45415584327275]
LiveClinは、実際の臨床実践を近似するために設計されたライブベンチマークである。
本研究は,患者を臨床経過全体にわたる複雑なマルチモーダルな評価シナリオに転換する。
LiveClin上で26のモデルを評価すると、これらの実世界のシナリオの難しさが明らかとなり、最高性能のモデルではケース精度が35.7%に達した。
論文 参考訳(メタデータ) (2026-02-18T03:59:46Z) - Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems [19.880569341968023]
大規模言語モデル(LLM)は、幻覚や安全でない提案が患者の安全に直接的なリスクをもたらすという、臨床的な意思決定支援にますます利用されている。
本稿では,インスタンス固有の評価ルーリックの自動生成を目的とした検索拡張型マルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-21T16:40:41Z) - A DeepSeek-Powered AI System for Automated Chest Radiograph Interpretation in Clinical Practice [83.11942224668127]
Janus-Pro-CXR (1B) はDeepSeek Janus-Proモデルに基づく胸部X線解釈システムである。
本システムは, 自動レポート生成において, 最先端のX線レポート生成モデルより優れる。
論文 参考訳(メタデータ) (2025-12-23T13:26:13Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine [69.08855631283829]
我々は,操作的ヒント条件下での安全性能トレードオフの定量化を目的としたベンチマークであるMed Omni-45 Degreesを紹介する。
6つの専門分野にまたがる1,804の推論に焦点を当てた医療質問と3つのタスクタイプが含まれており、その中にはMedMCQAの500が含まれる。
結果は、モデルが対角線を超えることなく、一貫した安全性と性能のトレードオフを示す。
論文 参考訳(メタデータ) (2025-08-22T08:38:16Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。