論文の概要: CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection
- arxiv url: http://arxiv.org/abs/2510.23845v1
- Date: Mon, 27 Oct 2025 20:32:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-29 15:35:36.51094
- Title: CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection
- Title(参考訳): CRADLE Bench:多面的メンタルヘルス危機と安全リスク検出のための臨床診断ベンチマーク
- Abstract要約: 我々は,多面的危機検出のベンチマークであるCRADLE BENCHを紹介する。
本ベンチマークでは,600名の臨床医による評価例と420名の開発例を提供する。
コンセンサスおよび全会一致で定義されたサブセット上での6つの危機検出モデルをさらに微調整する。
- 参考スコア(独自算出の注目度): 8.296902072126182
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Detecting mental health crisis situations such as suicide ideation, rape, domestic violence, child abuse, and sexual harassment is a critical yet underexplored challenge for language models. When such situations arise during user--model interactions, models must reliably flag them, as failure to do so can have serious consequences. In this work, we introduce CRADLE BENCH, a benchmark for multi-faceted crisis detection. Unlike previous efforts that focus on a limited set of crisis types, our benchmark covers seven types defined in line with clinical standards and is the first to incorporate temporal labels. Our benchmark provides 600 clinician-annotated evaluation examples and 420 development examples, together with a training corpus of around 4K examples automatically labeled using a majority-vote ensemble of multiple language models, which significantly outperforms single-model annotation. We further fine-tune six crisis detection models on subsets defined by consensus and unanimous ensemble agreement, providing complementary models trained under different agreement criteria.
- Abstract(参考訳): 自殺、レイプ、家庭内暴力、児童虐待、セクシャルハラスメントなどのメンタルヘルスの状況を検出することは、言語モデルにとって重要で未解決の課題である。
このような状況がユーザ-モデルインタラクションの間に発生する場合、モデルがそれらを確実にフラグ付けする必要がある。
本研究では,多面的危機検出のベンチマークであるCRADLE BENCHを紹介する。
これまでの一連の危機タイプに焦点を絞った取り組みとは違って、我々のベンチマークでは、臨床基準に従って定義された7つのタイプをカバーし、初めて時間ラベルを組み込んだ。
本ベンチマークでは,600名の臨床医による注釈付き評価例と420名の開発例に加えて,複数言語モデルの多数投票アンサンブルを用いて,約4K例のトレーニングコーパスを自動ラベル付けし,単一モデルアノテーションを著しく上回る結果を得た。
コンセンサスおよび全一致合意によって定義されたサブセット上での6つの危機検出モデルをさらに微調整し、異なる合意基準の下で訓練された補完モデルを提供する。
関連論文リスト
- K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations [1.6247217262916298]
K-Benchは、14のプロバイダから33のベースモデルを表す125のモデル構成を評価する。
凍ったGPT-4o判事は6,751項目の比較で、臨床医のコンセンサスと94.2%の正確な一致を得た。
主観的モデルは強い支持的会話と複合リスクスコアを95以上と組み合わせた。
論文 参考訳(メタデータ) (2026-09-14T16:49:23Z) - Expert-Level Crisis Detection in Mental Health Conversations [7.830103991641948]
CRADLE-ダイアログ(CRADLE-Dialogue)は,会話環境下でのターンレベルの危機検出のための臨床診断用ベンチマークである。
データセットには600の対話と,臨床上のリスクに対するマルチラベルアノテーションが含まれている。
本稿では,早期警報信号(アラート)を,特定の危機が明確に識別可能なターンと区別するアラート確認評価プロトコルを提案する(確認)。
論文 参考訳(メタデータ) (2026-06-09T03:42:14Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment [3.1849948640573245]
AcuityBenchは、言語モデルがユーザの医療プレゼンテーションから適切なケアの緊急性を特定するかどうかを評価するためのベンチマークである。
ユーザ会話、オンラインフォーラム投稿、臨床ヴィグネット、患者のポータルメッセージにまたがる5つの公開データセットで構成されている。
QA設定での明示的な4方向分類と、ルーリックベースの判定器で評価された自由形式の会話応答の2つの補完的なタスク形式をサポートする。
論文 参考訳(メタデータ) (2026-05-12T01:39:46Z) - BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection [1.620466780389133]
我々は、ハイブリッド検索強化世代(RAG)を付加したマルチエージェント討論フレームワークBLUEmedを紹介する。
Bluemedは、各臨床ノートを焦点を絞ったサブクエリに分解し、密度、スパース、オンライン検索を通じてソース分割された証拠を検索し、独立した分析を作成するために、2つのドメイン専門家エージェントに異なる知識ベースを割り当てる。
BLUEmed on a clinical terminology substitution detection benchmark under both zero-shot and few-shot prompting with multiple backbone model acrossed proprietary and open-source family。
論文 参考訳(メタデータ) (2026-04-12T00:30:31Z) - Pressure Reveals Character: Behavioural Alignment Evaluation at Depth [3.634215320925722]
正直、安全、非マニピュレーション、ロバスト性、矯正性、スケジューリングの6つのカテゴリで904のシナリオにまたがるアライメントベンチマークを紹介します。
我々のシナリオでは、モデルを矛盾する命令、シミュレートされたツールアクセス、マルチターンエスカレーションの下に配置し、シングルターン評価が見逃す振る舞いの傾向を明らかにする。
トップパフォーマンスモデルでさえ特定のカテゴリにギャップがあるのに対して、ほとんどのモデルでは一貫性のある弱点が示されています。
論文 参考訳(メタデータ) (2026-02-24T11:52:17Z) - Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models [48.95516224614331]
MedGaze-Benchは、臨床医の視線を認知的カーソルとして活用し、手術、緊急シミュレーション、診断解釈における意図的理解を評価する最初のベンチマークである。
本ベンチマークでは,解剖学的構造の視覚的均一性,臨床における時間・因果依存性の厳格化,安全プロトコルへの暗黙の順守という3つの基本的な課題に対処する。
論文 参考訳(メタデータ) (2026-01-11T02:20:40Z) - JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models [47.20100799532625]
JMedEthicBenchは,大規模言語モデルの医療安全性を評価するための,最初のマルチターン対話型ベンチマークである。
デュアルLLMスコアリングプロトコルを用いて27のモデルを評価し,医療特化モデルでは脆弱性が増大するのに対して,商業モデルは堅牢な安全性を維持していることを確認した。
論文 参考訳(メタデータ) (2026-01-04T18:18:18Z) - RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models [43.76961935990733]
欠陥のあるシステムに基づいて、言語モデルが回答を拒否する能力は、依然として重大な障害点である。
RefusalBenchは、制御された言語コンテキストを通して診断テストケースを作成するジェネレーティブな方法論である。
選択的な拒絶は、改善への明確な道筋を提供する列車で、アライメントに敏感な能力であることがわかった。
論文 参考訳(メタデータ) (2025-10-12T00:53:42Z) - Evaluating Large Language Models in Crisis Detection: A Real-World Benchmark from Psychological Support Hotlines [5.249698789320767]
PsyCrisisBenchは、Hangzhou Psychological Assistance Hotlineの540の注釈付きテキストのベンチマークである。
気分認識、自殺の考えの検出、自殺計画の特定、リスクアセスメントの4つの課題を評価する。
QwQ-32Bのようなオープンソースモデルは、ほとんどのタスクにおいてクローズソースと互換性があるが、クローズドモデルはムード検出においてエッジを保持していた。
論文 参考訳(メタデータ) (2025-06-02T05:18:24Z) - Silence is Not Consensus: Disrupting Agreement Bias in Multi-Agent LLMs via Catfish Agent for Clinical Decision Making [80.94208848596215]
提案する概念は「Catfish Agent」である。これは、構造的不満を注入し、無声な合意に反するように設計された役割特化LDMである。
組織心理学において「ナマズ・エフェクト」にインスパイアされたカマズ・エージェントは、より深い推論を促進するために、新たなコンセンサスに挑戦するように設計されている。
論文 参考訳(メタデータ) (2025-05-27T17:59:50Z) - Benchmarking Unified Face Attack Detection via Hierarchical Prompt Tuning [58.16354555208417]
PADとFFDはそれぞれ物理メディアベースのプレゼンテーションアタックとデジタル編集ベースのDeepFakeから顔データを保護するために提案されている。
これら2つのカテゴリの攻撃を同時に処理する統一顔攻撃検出モデルがないことは、主に2つの要因に起因する。
本稿では,異なる意味空間から複数の分類基準を適応的に探索する,視覚言語モデルに基づく階層型プロンプトチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:35:45Z) - LlaMADRS: Prompting Large Language Models for Interview-Based Depression Assessment [75.44934940580112]
LlaMADRSは、オープンソースのLarge Language Models(LLM)を利用して、うつ病の重症度評価を自動化する新しいフレームワークである。
本研究は,クリニカルインタヴューの解釈・スコアリングにおけるモデル指導のために,慎重に設計された手がかりを用いたゼロショットプロンプト戦略を用いている。
実世界における236件のインタビューを対象とし,臨床評価と強い相関性を示した。
論文 参考訳(メタデータ) (2025-01-07T08:49:04Z) - Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis [9.738105623317601]
我々は、ソーシャルメディア投稿からの抑うつ不安のコorbidity分類のための、新しいファースト・オブ・イットのベンチマークであるAN GSTを紹介する。
我々は、メンタル-BERT から GPT-4 まで、様々な最先端言語モデルを用いてAN GSTをベンチマークする。
GPT-4は一般に他のモデルより優れているが、F1スコアが72%を超えるようなマルチクラスのコンコービッド分類は達成していない。
論文 参考訳(メタデータ) (2024-10-04T20:24:11Z) - PersonalizedUS: Interpretable Breast Cancer Risk Assessment with Local Coverage Uncertainty Quantification [2.6911061523689415]
現在の「ゴールドスタンダード」は、臨床医による手動のBI-RADSスコアに依存しており、しばしば不必要な生検や、患者とその家族に対する精神的な負担を伴っている。
我々は、直列予測の最近の進歩を活用して、正確でパーソナライズされたリスク推定を提供する、パーソナライズされた機械学習システムであるPersonalizedUSを紹介する。
具体的な臨床効果としては、BI-RADS 4aと4bの病変のうち、要求された生検を最大で65%減らし、がんの再発は最小限である。
論文 参考訳(メタデータ) (2024-08-28T00:47:55Z) - Detecting Suicide Risk in Online Counseling Services: A Study in a
Low-Resource Language [5.2636083103718505]
本稿では,PLM(Pre-trained Language Model)と手作業による自殺的手がかりの固定セットを組み合わせたモデルを提案する。
我々のモデルは0.91ROC-AUCと0.55のF2スコアを達成し、会話の早い段階でも強いベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2022-09-11T10:06:14Z) - SCRIB: Set-classifier with Class-specific Risk Bounds for Blackbox
Models [48.374678491735665]
クラス固有RIsk境界(SCRIB)を用いたSet-classifierを導入し,この問題に対処する。
SCRIBは、クラス固有の予測リスクを理論的保証で制御するセット分類器を構築する。
脳波(EEG)データによる睡眠ステージング,X線COVID画像分類,心電図(ECG)データに基づく心房細動検出など,いくつかの医学的応用についてSCRIBを検証した。
論文 参考訳(メタデータ) (2021-03-05T21:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。