論文の概要: Mental Health AI Safety Claims Must Preserve Temporal Evidence
- arxiv url: http://arxiv.org/abs/2605.08827v1
- Date: Sat, 09 May 2026 09:27:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.91288
- Title: Mental Health AI Safety Claims Must Preserve Temporal Evidence
- Title(参考訳): メンタルヘルスAIの安全性は一時的な証拠を保存する必要がある
- Abstract要約: メンタルヘルスAIの安全性は、しばしば間違った時間スケールで判断される。
本稿では, 時系列, タイミング, 蓄積, 回復に依存する安全特性が, それらの特徴を破棄するプロトコルによって認証できない理由を, 公式な説明として紹介する。
SCOPE-MHを専門家によるモチベーションのあるインタビュー会話のAnnoMIデータセット上で概念実証を通じて運用する。
- 参考スコア(独自算出の注目度): 0.11470070927586014
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The safety of mental health AI is often judged at the wrong temporal scale. Current evaluations typically score isolated responses, endpoint outcomes, or aggregate dialogue quality, while clinically consequential failures may arise from the order and accumulation of interactions themselves, including delayed escalation, repeated reinforcement, dependency formation, failed repair, and gradual deterioration across turns. This paper argues that this mismatch is not merely a limitation of evaluation coverage but a source of invalid safety conclusions. We introduce Temporal Safety Non-Identifiability, a formal account of why safety properties that depend on sequence, timing, accumulation, or recovery cannot be certified by protocols that discard those features. From this formalization, we develop SCOPE (Safety Claims Over Preserved Evidence) as a general principle for aligning safety claims with the evidence an evaluation actually retains, and instantiate it as SCOPE-MH, a mental-health instantiation of this reporting standard. We operationalize SCOPE-MH through a proof-of-concept on the AnnoMI dataset of expert-annotated motivational interviewing conversations, which reveals mechanisms of failure that per-turn behavior scoring does not represent. We propose SCOPE-MH as a diagnostic complement to existing evaluation infrastructure and argue that evaluation preserving temporal evidence is necessary, not optional, for safety-critical mental health AI deployment.
- Abstract(参考訳): メンタルヘルスAIの安全性は、しばしば間違った時間スケールで判断される。
現在の評価では、孤立した応答、終端結果、あるいは集合的な対話品質をスコアするのが一般的であるが、臨床上の失敗は、遅延エスカレーション、繰り返しの強化、依存性の形成、修復の失敗、ターン間の段階的な劣化など、相互作用の順序と蓄積から生じる可能性がある。
本稿では、このミスマッチは単に評価範囲の制限ではなく、不正な安全性の結論の源であると主張している。
本稿では, 時系列, タイミング, 蓄積, 回復に依存する安全特性が, それらの特徴を破棄するプロトコルによって認証できない理由を, 公式な説明として紹介する。
この形式化から,安全クレームを実際に保持している証拠と整合させる一般的な原則としてSCOPE(Safety Claims Over Preserved Evidence)を開発し,この報告基準のメンタルヘルスインスタンス化であるSCOPE-MHとしてインスタンス化する。
SCOPE-MHは、専門家によるモチベーションによるインタビュー会話のAnnoMIデータセットの概念実証を通じて運用され、ターン当たりの行動スコアリングが表さない失敗のメカニズムを明らかにする。
我々は、既存の評価インフラの診断補完としてSCOPE-MHを提案し、安全クリティカルなメンタルヘルスAIの展開には、時間的証拠を保存する評価が必要であると論じる。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - Retrieval-Augmented Generation in LLMs for Mental Health: Quantifying the Incremental Contribution of Retrieval Within a Layered Safety Architecture [1.9213555198905314]
デジタルメンタルヘルス介入(DMHI)はスケーラブルなサポートを提供するが、不安定な状況下でユーザの意図を正確に検出することは困難である。
本稿では、RAG対応モードとRAG対応モードの比較により、DMHI内のWysaと呼ばれる6つの大言語モデルを評価する。
この研究は、分類精度、リコール、精度、F1スコアを地上の真理ラベルに対して計算し、統計的に有意な差を試験した。
論文 参考訳(メタデータ) (2026-07-17T06:32:12Z) - Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands [4.125187280299246]
我々は、慎重に設計しても、行動保証は検証できないという安全主張を遂行するよう求められていると論じている。
我々は,この構造ミスマッチを監査ギャップ,要求と達成可能な検証アクセスのばらつきとして形式化し,脆弱な保証の概念を導入する。
本稿では,法的文書における行動証拠の重み付けと,機械的証拠クラスによる自発的な事前配備アクセスの延長という技術的転換を提案する。
論文 参考訳(メタデータ) (2026-05-14T17:54:28Z) - MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models [32.31200693426663]
大規模言語モデル(LLM)は、メンタルヘルスカウンセリングのためのスケーラブルなツールとして、ますます研究されている。
臨床的害の相互作用と文脈に依存した性質のため、安全性を評価することは依然として困難である。
我々は、ロールアウェアなメンタルヘルス安全分類であるR-MHSafeと、クローズドループエージェントベースの評価フレームワークであるMHSafeEvalを紹介する。
論文 参考訳(メタデータ) (2026-04-20T02:37:45Z) - Towards Trustworthy Depression Estimation via Disentangled Evidential Learning [50.22167852149165]
EviDepはうつ病の重症度を共同で定量化する明らかな学習フレームワークである。
EviDepは、堅牢な証拠合成を保証するために厳密な情報整合性を強制する。
最先端の予測精度と優れた不確実性校正を実現し、信頼できる臨床スクリーニングのための堅牢なフェールセーフメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-17T13:27:11Z) - When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment [0.0]
高度なAIシステムの安全性評価は、評価の下で観察された振る舞いがデプロイメントの振る舞いを予測することを前提としている。
部分観測可能性下での情報流問題としてアライメント評価をリキャストする。
我々は、レギュラー・ブラインド・メカニズム、レギュラー・キューへのアクセスを制限する訓練時間介入について研究する。
論文 参考訳(メタデータ) (2026-02-09T10:00:24Z) - MHDash: An Online Platform for Benchmarking Mental Health-Aware AI Assistants [2.89303424493]
我々は、メンタルヘルスアプリケーションのためのAIシステムの開発、評価、監査を支援するために設計されたオープンソースのプラットフォームであるMHDashを紹介する。
以上の結果から, 単純ベースラインと高度なLCM APIは, 高リスク症例においてほぼ同等の精度を示しつつも, 極めて多岐にわたることが示唆された。
MHDashをオープンプラットフォームとしてリリースすることで、再現可能な研究、透過的な評価、メンタルヘルス支援のためのAIシステムの安全に整合した開発を促進することを目指している。
論文 参考訳(メタデータ) (2026-01-30T22:03:31Z) - Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models [48.95516224614331]
MedGaze-Benchは、臨床医の視線を認知的カーソルとして活用し、手術、緊急シミュレーション、診断解釈における意図的理解を評価する最初のベンチマークである。
本ベンチマークでは,解剖学的構造の視覚的均一性,臨床における時間・因果依存性の厳格化,安全プロトコルへの暗黙の順守という3つの基本的な課題に対処する。
論文 参考訳(メタデータ) (2026-01-11T02:20:40Z) - CARE-RAG - Clinical Assessment and Reasoning in RAG [43.1450755645803]
大規模言語モデル(LLM)における検索と推論のギャップについて検討する。
推論の正確性,一貫性,忠実度を計測する評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-20T02:44:55Z) - SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models [60.8821834954637]
LRMの安全性をエンドツーエンドに評価する最初のベンチマークであるSafeRBenchを紹介する。
私たちは、リスクカテゴリとレベルを入力設計に組み込んだ先駆者です。
我々は,長い推論トレースを意味的に一貫性のある単位にセグメント化するためのマイクロシンクのチャンキング機構を導入する。
論文 参考訳(メタデータ) (2025-11-19T06:46:33Z) - When Models Outthink Their Safety: Mitigating Self-Jailbreak in Large Reasoning Models with Chain-of-Guardrails [74.63933201261595]
大規模推論モデル(LRM)は複雑な推論タスクにおいて顕著な能力を示す。
LRMは、有害なコンテンツ生成やジェイルブレイク攻撃など、深刻な安全リスクに弱いままである。
安全でない推論ステップを再構成またはバックトラックするトレーニングフレームワークであるChain-of-Guardrail(CoG)を提案する。
論文 参考訳(メタデータ) (2025-10-24T09:32:25Z) - CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention [68.95008546581339]
Contrastive Decodingのような既存のデコーディングタイムの介入は、安全と応答品質の間に深刻なトレードオフを強いることが多い。
本稿では,3つの重要なコンポーネントを統合した,復号時安全アライメントのための新しいフレームワークであるCAREを提案する。
このフレームワークは、安全性、品質、効率のバランスが良く、有害な応答率が低く、ユーザエクスペリエンスを最小限に破壊できる。
論文 参考訳(メタデータ) (2025-09-01T04:50:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。