論文の概要: Mental-R1: Aligning LLM Reasoning for Mental Health Assessment
- arxiv url: http://arxiv.org/abs/2606.13176v1
- Date: Thu, 11 Jun 2026 10:44:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.733527
- Title: Mental-R1: Aligning LLM Reasoning for Mental Health Assessment
- Title(参考訳): メンタルR1:メンタルヘルスアセスメントのためのLCM推論
- Authors: Xin Wang, Boyan Gao, Yibo Yang, David A. Clifton,
- Abstract要約: 本稿では,精神保健領域に適した強化学習フレームワークである認知相対政策最適化(CRPO)を提案する。
CRPOは、段階依存不確実性モデリングをポリシー最適化プロセスに統合することにより、グループ相対的なポリシー最適化を拡張する。
CRPOは、最高の強化学習ベースラインよりも10.4ポイントの重み付きF1スコアを平均的に向上させる。
- 参考スコア(独自算出の注目度): 41.04728145197249
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mental health problems such as anxiety, depression, and suicide remain urgent global challenges, where timely and accurate assessment is critical for effective intervention. Recently, large language models have been explored for mental health assessment. However, existing general-purpose post-training methods do not align with the cognitive processes of human assessment, which may lead to unreliable reasoning outcomes. To bridge this gap, we propose Cognitive Relative Policy Optimization (CRPO), a reinforcement learning framework tailored for the mental health domain. CRPO extends group relative policy optimization by integrating stage-dependent uncertainty modeling into the policy optimization process. Specifically, we introduce a stage-wise entropy regularization mechanism that encourages broad exploration in early reasoning phases and progressively enforces confident decision-making in later stages, mimicking the human cognitive shift from uncertainty to certainty. In addition, inspired by cognitive appraisal theory, we formalize cognitive reasoning stages, thereby guiding theory-grounded interpretable inference. Experiments on 8 mental health datasets show that CRPO achieves an average improvement of 10.4 percentage points in weighted F1-score over the best reinforcement learning baseline. Furthermore, the CRPO-trained model Mental-R1 demonstrates clear advantages compared with existing large language models on reasoning-intensive cases, suggesting that CRPO enhances reasoning capabilities for mental health assessment.
- Abstract(参考訳): 不安、抑うつ、自殺などのメンタルヘルス問題は、時間的かつ正確な評価が効果的な介入に不可欠である、緊急な世界的な課題のままである。
近年,メンタルヘルス評価のための大規模言語モデルが検討されている。
しかし、既存の汎用ポストトレーニング手法は、人間の評価の認知過程と一致しないため、信頼性の低い推論結果につながる可能性がある。
このギャップを埋めるために,精神保健領域に適した強化学習フレームワークである認知相対政策最適化(CRPO)を提案する。
CRPOは、段階依存不確実性モデリングをポリシー最適化プロセスに統合することにより、グループ相対的なポリシー最適化を拡張する。
具体的には、初期推論段階における広範な探索を促進する段階的エントロピー規則化機構を導入し、不確実性から確実性への人間の認知的シフトを模倣して、後段における自信ある意思決定を段階的に実施する。
さらに,認知的評価理論に触発されて,認知的推論段階を定式化し,理論に基づく解釈可能な推論を導出する。
8つのメンタルヘルスデータセットの実験は、CRPOが最高の強化学習ベースラインよりも10.4ポイントの重み付きF1スコアを平均的に改善していることを示している。
さらに、CRPO訓練モデルであるMental-R1は、推論集約的なケースにおける既存の大規模言語モデルと比較して明らかな優位性を示し、CRPOは精神健康評価のための推論能力を高めることを示唆している。
関連論文リスト
- Responsible Evaluation of AI for Mental Health [72.85175110624736]
メンタルヘルスケアにおけるAIツールの評価に対する現在のアプローチは、断片化されており、臨床実践、社会的コンテキスト、ファーストハンドのユーザエクスペリエンスと不整合である。
本稿では,臨床の健全性,社会的文脈,公平性を統合した学際的枠組みを導入することにより,責任ある評価を再考する。
論文 参考訳(メタデータ) (2026-01-20T12:55:10Z) - MentraSuite: Post-Training Large Language Models for Mental Health Reasoning and Assessment [35.949107062098]
MentraSuiteは、信頼できるメンタルヘルス推論を進めるための統一されたフレームワークである。
MentraBenchは5つのコア推論側面、6つのタスク、13のデータセットにまたがるベンチマークである。
Mindoraは、ハイブリッドSFT-RLフレームワークによって最適化されたポストトレーニングモデルである。
論文 参考訳(メタデータ) (2025-12-10T13:26:22Z) - Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning [21.062242651416675]
我々は,共感,心理学的専門知識,推論を共同で統合した中国初の心理学的大規模言語モデル(LLM)である Psyche-R1 を提案する。
具体的には,75k以上の心理的質問を詳細な論理と組み合わせて生成する包括的データ合成パイプラインを設計する。
実験の結果、いくつかの心理学的ベンチマークでサイクロン-R1の有効性が示された。
論文 参考訳(メタデータ) (2025-08-14T17:18:35Z) - Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training [86.70255651945602]
我々はReinforcecing Cognitive Experts(RICE)と呼ばれる新しい推論時ステアリング手法を導入する。
RICEは、追加のトレーニングや複雑化なしに推論のパフォーマンスを改善することを目的としている。
先行する MoE ベースの LRM を用いた経験的評価は、推論精度、認知効率、ドメイン間の一般化において顕著で一貫した改善を示す。
論文 参考訳(メタデータ) (2025-05-20T17:59:16Z) - ProMind-LLM: Proactive Mental Health Care via Causal Reasoning with Sensor Data [5.961343130822046]
メンタルヘルスのリスクは、世界の公衆衛生にとって重要な課題である。
大規模言語モデル(LLMs)の開発により、それらは説明可能な精神医療応用のための有望なツールであることが注目されている。
本稿では、主観的心的記録と相補的な情報として客観的行動データを統合する革新的なアプローチであるProMind-LLMを紹介する。
論文 参考訳(メタデータ) (2025-05-20T07:36:28Z) - Ψ-Arena: Interactive Assessment and Optimization of LLM-based Psychological Counselors with Tripartite Feedback [51.26493826461026]
大規模言語モデル(LLM)の総合的評価と最適化のための対話型フレームワークであるPsi-Arenaを提案する。
アリーナは、心理学的にプロファイルされたNPCクライアントとの多段階対話を通じて現実世界のカウンセリングをシミュレートする現実的なアリーナ相互作用を特徴としている。
8つの最先端のLLM実験は、異なる実世界のシナリオと評価の観点で大きなパフォーマンス変化を示す。
論文 参考訳(メタデータ) (2025-05-06T08:22:51Z) - Automated Fidelity Assessment for Strategy Training in Inpatient
Rehabilitation using Natural Language Processing [53.096237570992294]
戦略トレーニング (Strategy Training) とは、脳卒中後の認知障害患者に障害を減らすためのスキルを教える、リハビリテーションのアプローチである。
標準化された忠実度評価は治療原則の遵守度を測定するために用いられる。
本研究では,ルールベースNLPアルゴリズム,長短項メモリ(LSTM)モデル,および変換器(BERT)モデルからの双方向エンコーダ表現を開発した。
論文 参考訳(メタデータ) (2022-09-14T15:33:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。