論文の概要: Toward Trustworthy Large Language Model Agents in Healthcare
- arxiv url: http://arxiv.org/abs/2607.05055v1
- Date: Mon, 06 Jul 2026 13:29:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.161332
- Title: Toward Trustworthy Large Language Model Agents in Healthcare
- Title(参考訳): 医療における信頼できる大規模言語モデルエージェントを目指して
- Abstract要約: CareConnectは、医療物流自動化のための安全第一の対話エージェントである。
このシステムは、予約予約、修正、キャンセル、施設情報検索をサポートする8つのドメイン固有のツールを編成する。
- 参考スコア(独自算出の注目度): 0.6633201258809686
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Healthcare appointment scheduling remains a persistent operational bottleneck, driven by manual coordination, fragmented legacy systems, and high administrative overhead. These inefficiencies constrain provider availability and degrade patient access to care. This paper presents CareConnect, a safety-first conversational agent for healthcare logistics automation that leverages large language model (LLM) function calling, retrieval-augmented generation (RAG), and layered deterministic safety guardrails. The system orchestrates eight domain-specific tools to support appointment booking, modification, cancellation, and facility information retrieval, while enforcing strict scope constraints that prohibit medical advice or diagnosis. Safety-critical situations are handled through deterministic short-circuit mechanisms for emergency detection and medical intent refusal. We evaluate CareConnect on a comprehensive benchmark of 680 task-oriented scenarios spanning end-to-end workflows, multi-turn interactions, and edge cases. Experimental results demonstrate a 91.8% task completion rate with a median per-request latency of 2.2 seconds, 96.0% safety compliance on the dedicated safety-critical evaluation subset, and an average operational cost of $0.0324 per appointment, yielding a significant cost reduction compared to manual human scheduling. These findings show that carefully scoped and rigorously safeguarded LLM-based agents can reliably automate complex healthcare operational workflows while maintaining safety guarantees and achieving substantial cost efficiency. The source code and system implementation are publicly available at https://github.com/Hadi-Hsn/CareConnect.
- Abstract(参考訳): 医療の予約スケジュールは、手作業の調整、断片化されたレガシーシステム、高い管理上のオーバーヘッドによって引き起こされる、継続的な運用上のボトルネックのままである。
これらの非効率性は、提供者の可用性を制限し、ケアへの患者アクセスを低下させる。
本稿では,大規模言語モデル(LLM)機能呼び出し,検索拡張生成(RAG),階層型決定論的安全ガードレールを活用した医療ロジスティクス自動化のための安全第一の対話エージェントであるCareConnectを提案する。
このシステムは、8つのドメイン固有のツールを編成し、予約、修正、キャンセル、施設情報検索をサポートし、医療アドバイスや診断を禁止する厳格な範囲の制約を課している。
安全クリティカルな状況は、緊急検知と医学的意図の拒絶のための決定論的短絡機構によって処理される。
エンドツーエンドのワークフロー、マルチターンインタラクション、エッジケースにまたがる680のタスク指向シナリオの包括的なベンチマークでCareConnectを評価する。
実験の結果、91.8%のタスク完了率で、要求毎のレイテンシの平均値は2.2秒、専用安全クリティカル評価サブセットの96.0%、アポイントメント当たりの平均運用コストは0.0324ドルであり、人手によるスケジューリングに比べて大幅なコスト削減をもたらすことが示された。
これらの結果から, LLMをベースとしたエージェントは, 安全保証を維持しつつ, 高いコスト効率を保ちつつ, 複雑な医療作業ワークフローを確実に自動化することができることが示唆された。
ソースコードとシステムの実装はhttps://github.com/Hadi-Hsn/CareConnectで公開されている。
関連論文リスト
- SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents [87.26967184869198]
SeClawは、仕様駆動のセキュリティタスク合成と、自律エージェントの実行ベースのセキュリティ評価を組み合わせたフレームワークである。
ベンチマークは、リソース、ユーザタスク、環境、本質的なエージェントの振る舞いから生じるリスクをカバーしている。
論文 参考訳(メタデータ) (2026-06-01T14:23:42Z) - CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows? [150.84850629123287]
現実的な医療業務のエンドツーエンドの自動化は、現在のベンチマークで不足している3つの機能を強調します。
$-Benchは3つのドメインにわたる長期医療のベンチマークである。
30以上のエージェントハーネス/モデル構成で、最高のエージェントはタスクの28.0%しか解決せず、厳格なパス3では20%をクリアし、単一のセッションですべてのタスクを実行するとパフォーマンスは3.8%に低下する。
論文 参考訳(メタデータ) (2026-05-15T22:34:31Z) - CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs [5.437368195729715]
CareGuardAIは、患者向け医療質問応答のためのリスク対応安全フレームワークである。
推論時にCareGuardAIは、コントローラエージェント、安全制約生成、二重リスク評価からなる多段階パイプラインを使用する。
patientSafeBench, MedSafetyBench, MedHallu に対する CareGuardAI の評価を行った。
論文 参考訳(メタデータ) (2026-04-07T10:54:57Z) - LiaisonAgent: An Multi-Agent Framework for Autonomous Risk Investigation and Governance [11.009578207207419]
LiaisonAgentは、技術的リスク検出とビジネスレベルのリスク管理のギャップを埋めるために設計された、自律的なマルチエージェントシステムである。
このシステムは、エンドツーエンドのツールコール成功率97.8%、リスク判定精度95%を達成する。
論文 参考訳(メタデータ) (2026-02-27T08:42:52Z) - Towards Verifiably Safe Tool Use for LLM Agents [53.55621104327779]
大規模言語モデル(LLM)ベースのAIエージェントは、データソース、API、検索エンジン、コードサンドボックス、さらにはその他のエージェントなどのツールへのアクセスを可能にすることで、機能を拡張する。
LLMは意図しないツールインタラクションを起動し、機密データを漏洩したり、クリティカルレコードを上書きしたりするリスクを発生させる。
モデルベースセーフガードのようなリスクを軽減するための現在のアプローチは、エージェントの信頼性を高めるが、システムの安全性を保証することはできない。
論文 参考訳(メタデータ) (2026-01-12T21:31:38Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - Differential Privacy for Secure Machine Learning in Healthcare IoT-Cloud Systems [11.452686322120428]
救急医療の対応速度を高めるために,多層IoT,エッジ,クラウドアーキテクチャを提案する。
患者のデータのプライバシは、複数の機械学習モデルにまたがって差分プライバシーフレームワークを提案することで保証される。
論文 参考訳(メタデータ) (2025-12-11T08:37:37Z) - From Coordination to Personalization: A Trust-Aware Simulation Framework for Emergency Department Decision Support [0.0]
本研究では,医師や看護婦をコンピュータ信頼機構によって誘導されるインテリジェントエージェントとしてモデル化するためのシミュレーションベースのフレームワークを提案する。
提案手法は,緊急医療におけるエビデンスに基づく意思決定支援のための計算信頼の可能性を示すものである。
論文 参考訳(メタデータ) (2025-09-09T18:00:44Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - U-PASS: an Uncertainty-guided deep learning Pipeline for Automated Sleep
Staging [61.6346401960268]
プロセスの各段階で不確実性推定を組み込んだ臨床応用に適した,U-PASSと呼ばれる機械学習パイプラインを提案する。
不確実性誘導型ディープラーニングパイプラインを睡眠ステージングの困難な問題に適用し、各ステージにおけるパフォーマンスを体系的に改善することを示す。
論文 参考訳(メタデータ) (2023-06-07T08:27:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。