論文の概要: CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs
- arxiv url: http://arxiv.org/abs/2604.26959v1
- Date: Tue, 07 Apr 2026 10:54:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.245507
- Title: CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs
- Title(参考訳): CareGuardAI : 臨床安全・幻覚軽減のためのコンテキスト対応多エージェントガードレール
- Authors: Elham Nasarian, Abhilash Neog, Kwok-Leung Tsui, Niyousha HosseiniChimeh,
- Abstract要約: CareGuardAIは、患者向け医療質問応答のためのリスク対応安全フレームワークである。
推論時にCareGuardAIは、コントローラエージェント、安全制約生成、二重リスク評価からなる多段階パイプラインを使用する。
patientSafeBench, MedSafetyBench, MedHallu に対する CareGuardAI の評価を行った。
- 参考スコア(独自算出の注目度): 5.437368195729715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Integrating large language models (LLMs) into patient-facing healthcare systems offers significant potential to improve access to medical information. However, ensuring clinical safety and factual reliability remains a critical challenge. In practice, AI-generated responses may be conditionally correct yet medically inappropriate, as models often fail to interpret patient context and tend to produce agreeable responses rather than challenge unsafe assumptions. Unlike clinicians, who infer risk from incomplete information, LLMs frequently lack contextual awareness. Moreover, real-world patient interactions are open-ended and underspecified, unlike structured benchmark settings. We present CareGuardAI, a risk-aware safety framework for patient-facing medical question answering that addresses two key failure modes: clinical safety risk and hallucination risk. The framework introduces Clinical Safety Risk Assessment (SRA), inspired by ISO 14971, and Hallucination Risk Assessment (HRA) to evaluate medical risk and factual reliability. At inference time, CareGuardAI employs a multi-stage pipeline consisting of a controller agent, safety-constrained generation, and dual risk evaluation, followed by iterative refinement when necessary. Responses are released only when both SRA and HRA are less than or equal to 2, ensuring clinically acceptable outputs with bounded latency. We evaluate CareGuardAI on PatientSafeBench, MedSafetyBench, and MedHallu, covering both safety and hallucination detection. Across these benchmarks, the framework consistently outperforms strong baseline models, including GPT-4o-mini, demonstrating the importance of context-aware, risk-based, inference-time safety mechanisms for reliable deployment in healthcare.
- Abstract(参考訳): 大きな言語モデル(LLM)を患者が直面する医療システムに統合することは、医療情報へのアクセスを改善する大きな可能性を秘めている。
しかし、臨床安全性と事実信頼性の確保は依然として重要な課題である。
モデルはしばしば患者コンテキストの解釈に失敗し、安全でない仮定に挑戦するよりも同意できる応答を生成する傾向があるため、実際にはAI生成の応答は条件付きで正しいが、医学的に不適切である。
不完全な情報からリスクを推測する臨床医とは異なり、LLMは文脈認識を欠いていることが多い。
さらに、実際の患者との対話は、構造化されたベンチマーク設定とは異なり、オープンエンドで未特定である。
臨床安全リスクと幻覚リスクの2つの主要な障害モードに対処する、患者が直面する医療質問に対するリスク対応安全フレームワークであるCareGuardAIを提案する。
このフレームワークは、ISO 14971にインスパイアされた臨床安全リスクアセスメント(SRA)と、医療リスクと実際の信頼性を評価するための幻覚リスクアセスメント(HRA)を導入している。
推論時に、CareGuardAIは、コントローラエージェント、安全制約生成、二重リスク評価からなる多段階パイプラインを使用し、必要に応じて反復的な改善を行う。
応答は、SRAとHRAの両方が2以下である場合にのみ解放される。
patientSafeBench, MedSafetyBench, MedHallu に対する CareGuardAI の評価を行った。
これらのベンチマーク全体で、このフレームワークはGPT-4o-miniを含む強力なベースラインモデルよりも一貫して優れており、医療における信頼性の高いデプロイメントのためのコンテキスト認識、リスクベース、推論時の安全メカニズムの重要性を示している。
関連論文リスト
- Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation [97.36081721024728]
本稿では,現実的な医療相談におけるマルチターンインタラクションの信頼性を評価するための最初のベンチマークを提案する。
本ベンチマークでは,3種類の医療データを統合し,診断を行う。
本稿では,エビデンスを基盤とした言語自己評価フレームワークであるMedConfを紹介する。
論文 参考訳(メタデータ) (2026-01-22T04:51:39Z) - Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models [48.95516224614331]
MedGaze-Benchは、臨床医の視線を認知的カーソルとして活用し、手術、緊急シミュレーション、診断解釈における意図的理解を評価する最初のベンチマークである。
本ベンチマークでは,解剖学的構造の視覚的均一性,臨床における時間・因果依存性の厳格化,安全プロトコルへの暗黙の順守という3つの基本的な課題に対処する。
論文 参考訳(メタデータ) (2026-01-11T02:20:40Z) - SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models [60.8821834954637]
LRMの安全性をエンドツーエンドに評価する最初のベンチマークであるSafeRBenchを紹介する。
私たちは、リスクカテゴリとレベルを入力設計に組み込んだ先駆者です。
我々は,長い推論トレースを意味的に一貫性のある単位にセグメント化するためのマイクロシンクのチャンキング機構を導入する。
論文 参考訳(メタデータ) (2025-11-19T06:46:33Z) - RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation [19.41567007880886]
大規模言語モデル(LLM)は多様な医療タスクにおいて顕著な進歩を遂げた。
しかし、それらの医薬品の安全性に関する研究は、現実世界のデータセットが不足しているため、依然として限られている。
臨床相談をシミュレートし,評価し,LSMの薬剤安全性を体系的に評価する枠組みを提案する。
論文 参考訳(メタデータ) (2025-11-06T12:56:34Z) - Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs [6.0460961868478975]
臨床的にインフォームドされた6つのメンタルヘルス危機カテゴリーの統一分類を導入する。
我々は、危機タイプを分類し、安全で適切な応答を生成する能力のために、3つの最先端のLCMをベンチマークする。
間接的または曖昧なリスク信号の処理におけるシステム的弱点、定式的および不完全なデフォルト応答への依存、およびユーザコンテキストとの頻繁な不一致を識別する。
論文 参考訳(メタデータ) (2025-09-29T14:42:23Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - Trustworthy Medical Question Answering: An Evaluation-Centric Survey [40.76054471378203]
医療質問応答システムにおける信頼性の6つの重要な側面を体系的に検討した。
モデル改善を促進する評価誘導手法を解析する。
我々は, LLM を用いた医療用QAの安全性, 信頼性, 透明性の確保に向けた今後の研究方針を提案する。
論文 参考訳(メタデータ) (2025-06-04T07:48:10Z) - Agent-SafetyBench: Evaluating the Safety of LLM Agents [72.92604341646691]
我々は,大規模言語モデル(LLM)の安全性を評価するベンチマークであるAgent-SafetyBenchを紹介する。
Agent-SafetyBenchは349のインタラクション環境と2,000のテストケースを含み、安全リスクの8つのカテゴリを評価し、安全でないインタラクションで頻繁に発生する10の一般的な障害モードをカバーする。
16 名の LLM エージェントを評価した結果,いずれのエージェントも 60% 以上の安全性スコアを達成できないことがわかった。
論文 参考訳(メタデータ) (2024-12-19T02:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。