論文の概要: Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture
- arxiv url: http://arxiv.org/abs/2607.22692v1
- Date: Fri, 17 Jul 2026 14:33:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.02992
- Title: Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture
- Title(参考訳): ジェネレーティブAIメンタルヘルスサポートのためのリスクガバナンス - マルチターンセーフティアーキテクチャ
- Authors: Anabela C. Areias, Catarina Botelho, António Farinhas, Areti Vassilopoulos, Dora Janela, Xin Tong, Nuno M. Guerreiro, Maya D'Eon, Fabíola Costa, Ricardo Rei,
- Abstract要約: 大規模言語モデル(LLM)は、進化する精神健康リスクを安全に制御するメカニズムが欠如しているにもかかわらず、感情的な支援にますます利用されている。
我々は,マルチターンメンタルヘルスインタラクションのためのコンテキストリスク検出,推論に基づく検証,プロトコル誘導応答生成を組み合わせたモデル非依存型安全ガバナンスアーキテクチャを開発した。
- 参考スコア(独自算出の注目度): 13.319144217202227
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used for emotional support despite lacking mechanisms to safely govern evolving mental health risk. Existing safety approaches primarily detect risk but rarely shape how models respond as conversational risk unfolds. We developed a model-agnostic safety governance architecture that combines contextual risk detection, reasoning-based verification, and protocol-guided response generation for multi-turn mental health interactions. Synthetic conversations grounded in real-world mental health narratives were used to evaluate the architecture's performance, tested with GPT-5-chat and Qwen3.5-27B, achieving high risk detection performance (specificity: 0.85 (95\%CI: 0.78;0.91), sensitivity: 0.92 (95\%CI: 0.88;0.95)) and increasing clinician-preferred escalation responses by 25.6--59.2pp while preserving rapport and connection. Performance remained stable across conversation length and generalized across both proprietary and open-source models. These findings demonstrate that clinically-grounded safety governance can extend beyond risk detection to improve how LLMs manage evolving mental health risk, providing a scalable framework for safer deployment across models.
- Abstract(参考訳): 大規模言語モデル(LLM)は、進化する精神健康リスクを安全に制御するメカニズムが欠如しているにもかかわらず、感情的な支援にますます利用されている。
既存の安全アプローチは主にリスクを検出するが、会話のリスクが広がるにつれてモデルがどのように反応するかを形作ることは滅多にない。
我々は,マルチターンメンタルヘルスインタラクションのためのコンテキストリスク検出,推論に基づく検証,プロトコル誘導応答生成を組み合わせたモデル非依存型安全ガバナンスアーキテクチャを開発した。
GPT-5-chatとQwen3.5-27Bでテストし、高いリスク検出性能(特異性: 0.85 (95\%CI: 0.78;0.91)、感度: 0.92 (95\%CI: 0.88;0.95)、臨床医が推奨するエスカレーション応答を25.6-59.2pp増加させた。
パフォーマンスは会話の長さで安定し、プロプライエタリモデルとオープンソースモデルの両方で一般化された。
これらの結果は,LLMがメンタルヘルスのリスクをいかに管理するかを改善するために,リスク検出を超えて臨床現場での安全管理が拡張できることを示し,モデル間の安全なデプロイのためのスケーラブルなフレームワークを提供する。
関連論文リスト
- Towards Understanding and Measuring COGNITIVE ATROPHY in LLM Behaviour [10.419215828520414]
既存のベンチマークは、知識、安全性、静的応答品質を測定する。
我々は、この欠落した次元を、AIによるメンタルヘルス支援におけるプロセスレベルの行動尺度であるCOGNITIVE ATROPHYとして定式化する。
論文 参考訳(メタデータ) (2026-06-16T16:26:12Z) - Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations [10.699629636647414]
本稿では,1億5500万以上の患者とAIのインタラクションをリアルタイムに処理する実運用検証フレームワークを提案する。
これらのワイヤ内キューは、データ修正が失敗する障害モードを明らかにし、安全性と信頼性のために実行可能なトレーニングと評価信号を提供する。
私たちは、自律的な患者対応ケアのための、最も安全な生成型AIソリューションを構築する際に、安全性、ドキュメント、タスク完了、およびエクイティの計測可能な向上を推進します。
論文 参考訳(メタデータ) (2026-02-09T05:43:32Z) - RubRIX: Rubric-Driven Risk Mitigation in Caregiver-AI Interactions [15.539654835961294]
本稿では,AIによるサポート応答のリスクを評価するための理論駆動型臨床検証フレームワークであるRubRIXを紹介する。
RubRIXは、インタテンション、バイアス&スティグマ、インフォメーション不正確、不臨界確認、エピステマアロガンスという、経験的に派生した5つのリスクディメンションを運用している。
この研究は、高バーデンコンテキストのためのドメイン依存型ユーザ中心評価フレームワークを開発するための方法論的アプローチに寄与する。
論文 参考訳(メタデータ) (2026-01-19T17:10:49Z) - Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation [5.469454486414467]
大言語モデル (LLMs) は脊椎手術における臨床的決定支援の転換的可能性を提供する。
LLMは幻覚を通じて重大なリスクを引き起こすが、これは事実的に矛盾しているか、文脈的に不一致な出力である。
本研究は, 診断精度, 推奨品質, 推理堅牢性, 出力コヒーレンス, 知識アライメントを評価することによって, 幻覚リスクを定量化するための臨床中心の枠組みを提案する。
論文 参考訳(メタデータ) (2025-11-01T15:25:55Z) - Mentalic Net: Development of RAG-based Conversational AI and Evaluation Framework for Mental Health Support [0.0]
メンタルネット会話AIはBERTスコアが0.898であり、他の評価指標は満足のいく範囲内にある。
我々は,このようなトランスフォーメーション技術を開発する上で,人間-イン-ザ-ループアプローチと長期的かつ責任ある戦略を提唱する。
論文 参考訳(メタデータ) (2025-08-27T03:44:56Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation [69.63626052852153]
本稿では,モデル生成によるアドバイスが社会システムを通じてどのように伝播するかを示す概念実証フレームワークを提案する。
また、100の間接的な害シナリオのデータセットを導入し、害のないユーザプロンプトから有害で非有害な結果を予測するモデルの能力をテストする。
論文 参考訳(メタデータ) (2025-06-26T02:28:58Z) - The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1 [70.94607997570729]
本稿では,OpenAI-o3およびDeepSeek-R1推論モデルの総合的安全性評価を行う。
本研究では, 現実の応用における強靭性を評価するために, ジェイルブレイクやインジェクションなどの敵攻撃に対する感受性について検討する。
論文 参考訳(メタデータ) (2025-02-18T09:06:07Z) - OpenAI o1 System Card [274.83891368890977]
o1モデルシリーズは、思考の連鎖を用いて推論するために大規模な強化学習で訓練されている。
本報告では,OpenAI o1およびOpenAI o1-miniモデルに対して実施される安全作業の概要について述べる。
論文 参考訳(メタデータ) (2024-12-21T18:04:31Z) - Agent-SafetyBench: Evaluating the Safety of LLM Agents [72.92604341646691]
我々は,大規模言語モデル(LLM)の安全性を評価するベンチマークであるAgent-SafetyBenchを紹介する。
Agent-SafetyBenchは349のインタラクション環境と2,000のテストケースを含み、安全リスクの8つのカテゴリを評価し、安全でないインタラクションで頻繁に発生する10の一般的な障害モードをカバーする。
16 名の LLM エージェントを評価した結果,いずれのエージェントも 60% 以上の安全性スコアを達成できないことがわかった。
論文 参考訳(メタデータ) (2024-12-19T02:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。