論文の概要: CARE-MH: Towards Unified, Reproducible, and Comparable Evaluation of Mental Health LLMs
- arxiv url: http://arxiv.org/abs/2607.24754v1
- Date: Tue, 26 May 2026 05:55:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.036859
- Title: CARE-MH: Towards Unified, Reproducible, and Comparable Evaluation of Mental Health LLMs
- Title(参考訳): CARE-MH:メンタルヘルスLLMの統一、再現可能、比較可能な評価に向けて
- Abstract要約: 大規模言語モデル(LLM)は、メンタルヘルスのサポートを提供するために、ますます使われてきている。
既存のメンタルヘルスベンチマークは、一貫性のない評価設計とメートル法の定義のため、再現および比較が困難である。
本稿では,メンタルヘルスLLMの同等かつ再現可能な評価のための統合フレームワークであるCARE-MHを提案する。
- 参考スコア(独自算出の注目度): 4.631139870732229
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to provide mental health support, requiring reliable evaluation of safety, empathy, and therapeutic appropriateness. However, existing mental health benchmarks are difficult to reproduce and compare due to inconsistent evaluation designs and metric definitions. We present CARE-MH, a unified framework for comparable and reproducible evaluation of mental health LLMs. Using CARE-MH, we reproduce and analyze state-of-the-art benchmarks, revealing that reproducibility depends strongly on model stability and that cross-benchmark disagreement primarily arises from differences in metric definitions. Our findings highlight the need for standardized evaluation configurations and shared metric definitions for future mental health LLM benchmarks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、安全、共感、治療的適切性に関する信頼性の高い評価を必要とする精神的な健康支援を提供するために、ますます使われてきている。
しかしながら、既存のメンタルヘルスベンチマークは、一貫性のない評価設計とメートル法の定義のために、再現や比較が困難である。
本稿では,メンタルヘルスLLMの同等かつ再現可能な評価のための統合フレームワークであるCARE-MHを提案する。
CARE-MHを用いて最先端のベンチマークを再現・解析し、再現性はモデルの安定性に強く依存することを示した。
本研究は,将来のメンタルヘルス LLM ベンチマークにおいて,標準化された評価設定の必要性と,メトリクス定義の共有の必要性を強調した。
関連論文リスト
- MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models [13.221931392711406]
大規模言語モデル(LLM)は、メンタルヘルス領域でますます使われている。
関連バイオメディカルな知識がどの程度うまく捉えられるか、臨床的に健全な構造化された判断にどの程度確実に適用されているかは、いまだ不明である。
本稿では,精神保健機関の認識,関係判断,2ホップ推論におけるLCMの評価を行うための知識グラフ付きベンチマークを提案する。
論文 参考訳(メタデータ) (2026-05-15T03:55:27Z) - Benchmark^2: Systematic Evaluation of LLM Benchmarks [66.2731798872668]
3つの相補的なメトリクスからなる包括的なフレームワークであるBenchmark2を提案する。
数学、推論、知識ドメインにまたがる15のベンチマークで実験を行います。
本分析により,既存のベンチマーク間での有意な品質変化が明らかとなり,選択的なベンチマーク構築が同等な評価性能を達成できることが示されている。
論文 参考訳(メタデータ) (2026-01-07T14:59:03Z) - Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models [46.81512544528928]
MedCheckは、医療ベンチマーク用に設計された最初のライフサイクル指向アセスメントフレームワークである。
我々のフレームワークは、設計からガバナンスまで、ベンチマークの開発を5つの連続的な段階に分解し、46の医学的基準の包括的なチェックリストを提供する。
本分析では,臨床実践からの深い切り離し,無害な汚染リスクによるデータの整合性の危機,モデルロバスト性や不確実性認識といった安全クリティカルな評価の側面を体系的に無視することなど,全身的な問題を明らかにする。
論文 参考訳(メタデータ) (2025-08-06T11:11:40Z) - Med-CoDE: Medical Critique based Disagreement Evaluation Framework [72.42301910238861]
医学的文脈における大きな言語モデル(LLM)の信頼性と精度は依然として重要な懸念点である。
現在の評価手法はロバスト性に欠けることが多く、LLMの性能を総合的に評価することができない。
我々は,これらの課題に対処するために,医療用LCMの特別設計評価フレームワークであるMed-CoDEを提案する。
論文 参考訳(メタデータ) (2025-04-21T16:51:11Z) - MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks [0.0]
質問と回答(QA)ベンチマークのメタ評価のためのフレームワークであるMEQAを提案する。
我々は,人間とLLM評価器を用いたサイバーセキュリティベンチマークにおいて,この手法を実証する。
私たちは、強力な防御ツールとセキュリティ脅威として、AIモデルの二重性によるテストドメインの選択を動機付けています。
論文 参考訳(メタデータ) (2025-04-18T19:01:53Z) - Medical Large Language Model Benchmarks Should Prioritize Construct Validity [9.453444826672474]
医学大言語モデル(LLMs)の研究は、臨床知識の符号化から医師のような推論に至るまで、大胆な主張をすることが多い。
しかし、どうやって真の進歩をリーダーボードのフレックスから切り離すのか?
医療用LLMベンチマークは、その構成妥当性を実証的に評価すべきである(そして実際に可能である)。
論文 参考訳(メタデータ) (2025-03-12T05:08:02Z) - A Mixed-Methods Evaluation of LLM-Based Chatbots for Menopause [7.156867036177255]
医療環境におけるLLM(Large Language Models)の統合は注目されている。
更年期関連問合せのためのLLMベースのチャットボットの性能について検討する。
本研究は,健康トピックに対する従来の評価指標の約束と限界を明らかにするものである。
論文 参考訳(メタデータ) (2025-02-05T19:56:52Z) - Evaluating the Quality of Hallucination Benchmarks for Large Vision-Language Models [67.89204055004028]
LVLM(Large Vision-Language Models)は幻覚に悩まされている。
以前の研究では、さまざまなタイプのタスクと評価指標を特徴とする一連のベンチマークが提案されている。
本稿では,既存の幻覚ベンチマークの信頼性と妥当性を評価するために,幻覚ベンチマーク品質測定フレームワーク(HQM)を提案する。
論文 参考訳(メタデータ) (2024-06-24T20:08:07Z) - Don't Make Your LLM an Evaluation Benchmark Cheater [142.24553056600627]
大規模言語モデル(LLM)は人工知能のフロンティアを大幅に進歩させ、モデルキャパシティを著しく向上させた。
モデル性能を評価するために, LLMの能力レベルを測定するための評価ベンチマークを構築するのが典型的な方法である。
評価ベンチマークを用いて不適切なリスクと影響について検討し,評価結果を誤って解釈する。
論文 参考訳(メタデータ) (2023-11-03T14:59:54Z) - GO FIGURE: A Meta Evaluation of Factuality in Summarization [131.1087461486504]
本稿では,現実性評価指標を評価するメタ評価フレームワークGO FIGUREを紹介する。
10個の実測値のベンチマーク分析により、我々のフレームワークが堅牢で効率的な評価を提供することが明らかとなった。
また、QAメトリクスは、ドメイン間の事実性を測定する標準的なメトリクスよりも一般的に改善されているが、パフォーマンスは、質問を生成する方法に大きく依存していることも明らかにしている。
論文 参考訳(メタデータ) (2020-10-24T08:30:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。