論文の概要: Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations
- arxiv url: http://arxiv.org/abs/2603.29893v1
- Date: Mon, 09 Feb 2026 05:43:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 02:36:13.171016
- Title: Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations
- Title(参考訳): 医療現場におけるヒトとAIの相互作用 : 生産シグナルをより安全な、より人間的な会話に変換する
- Abstract要約: 本稿では,1億5500万以上の患者とAIのインタラクションをリアルタイムに処理する実運用検証フレームワークを提案する。
これらのワイヤ内キューは、データ修正が失敗する障害モードを明らかにし、安全性と信頼性のために実行可能なトレーニングと評価信号を提供する。
私たちは、自律的な患者対応ケアのための、最も安全な生成型AIソリューションを構築する際に、安全性、ドキュメント、タスク完了、およびエクイティの計測可能な向上を推進します。
- 参考スコア(独自算出の注目度): 10.699629636647414
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Healthcare conversational AI agents shouldn't be optimized only for clean benchmark accuracy in production-first regime; they must be optimized for the lived reality of patient conversations, where audio is imperfect, intent is indirect, language shifts mid-call, and compliance hinges on how guidance is delivered. We present a production-validated framework grounded in real-time signals from 115M+ live patient-AI interactions and clinician-led testing (7K+ licensed clinicians; 500K+ test calls). These in-the-wild cues -- paralinguistics, turn-taking dynamics, clarification triggers, escalation markers, multilingual continuity, and workflow confirmations -- reveal failure modes that curated data misses and provide actionable training and evaluation signals for safety and reliability. We further show why healthcare-grade safety cannot rely on a single LLM: long-horizon dialogue and limited attention demand redundancy via governed orchestration, independent checks, and verification. Many apparent "reasoning" errors originate upstream, motivating vertical integration across contextual ASR, clarification/repair, ambient speech handling, and latency-aware model/hardware choices. Treating interaction intelligence (tone, pacing, empathy, clarification, turn-taking) as first-class safety variables, we drive measurable gains in safety, documentation, task completion, and equity in building the safest generative AI solution for autonomous patient-facing care. Deployed across more than 10 million real patient calls, Polaris attains a clinical safety score of 99.9%, while significantly improving patient experience with average patient rating of 8.95 and reducing ASR errors by 50% over enterprise ASR. These results establish real-world interaction intelligence as a critical -- and previously underexplored -- determinant of safety and reliability in patient-facing clinical AI systems.
- Abstract(参考訳): 医療 会話AIエージェントは、プロダクションファーストのシステムにおいて、クリーンなベンチマーク精度のためにのみ最適化されるべきではない。オーディオが不完全、インテントが間接的、言語シフトがミッドコール、ガイダンスの配信方法に関するコンプライアンスのヒンジといった、患者の会話の生きた現実に最適化されなければならない。
本稿では,1億5500万件以上の患者とAIの対話と臨床医主導テスト (7K+ライセンス臨床医,500K+テストコール) のリアルタイム信号に基づく生産検証フレームワークを提案する。
これらは、パラ言語学、ターンテイクのダイナミクス、明確化トリガ、エスカレーションマーカー、マルチリンガル連続性、ワークフローの確認といった、未解決のキューで、データ修正が失敗する障害モードを明らかにし、安全性と信頼性のための実行可能なトレーニングと評価信号を提供する。
さらに、ヘルスケアグレードの安全性が、長期の対話や、統制されたオーケストレーション、独立したチェック、検証による注意要求の冗長性の制限といった、単一のLLMに頼らない理由を示す。
多くの明らかな"推論"エラーは上流から発生し、コンテキストASR間の垂直統合、明確化/修復、周囲の音声処理、レイテンシ対応モデル/ハードウェアの選択を動機付けている。
インタラクションインテリジェンス(トーン、ペーシング、共感、明確化、ターンテイク)を第一級安全変数として扱うことで、自律的な患者対応ケアのための最も安全な生成型AIソリューションを構築する上で、安全性、ドキュメント、タスク完了、およびエクイティの計測可能な向上を推進します。
1000万人以上の実際の患者コールに展開され、臨床安全性スコアは99.9%に達し、平均的な患者評価8.95で患者の経験を大幅に改善し、ASRエラーを50%減らした。
これらの結果は、患者が直面する臨床AIシステムの安全性と信頼性の決定要因として、現実のインタラクションインテリジェンスを確立します。
関連論文リスト
- PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents [5.247635961504091]
patientAgentBenchは、患者が直面するエージェント医療をベンチマークする。
シミュレーションされた患者と会話しながら、医療ツールのサンドボックスでエージェントにラップされた基礎モデルを評価する。
同じ1200のシナリオで、同じ4つのファミリーで10のモデルをベンチマークし、臨床的なギャップを見つけました。
論文 参考訳(メタデータ) (2026-07-28T09:24:04Z) - MedCTA: A Benchmark for Clinical Tool Agents [47.47354499871572]
MedCTA(MedCTA)は,臨床医が有する段階的作業における医療ツールエージェントの評価のためのベンチマークである。
MedCTAは、実世界の107の臨床的タスクと、臨床者が検証した5つのデプロイツール以上の実行可能な軌道から構成される。
我々は18のオープンソースおよびクローズドソースマルチモーダルモデルをベンチマークし、フロンティアシステムでさえもマルチステップ臨床ツールの使用において脆弱であることを発見した。
論文 参考訳(メタデータ) (2026-06-10T06:26:52Z) - RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation [46.82418087865201]
RealICUは、実際のICU条件下での大規模言語モデル評価のための、後述のベンチマークである。
94MIC-IV患者の930ウィンドウアノテーションを持つRealICU-Goldと、Oracleによって拡張された11,862ウィンドウを持つRealICU-Scaleの2つのデータセットをリリースする。
論文 参考訳(メタデータ) (2026-05-13T13:52:42Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic [21.374164324051012]
アーティキュレート・メディカル・インテリジェンス・エクスプローラー(AMIE)
100人の成人患者が任命の5日前にAMIEテキストチャットのやりとりを完了した。
ヒューマン・セーフティ・スーパーバイザーは、患者とAMIEのインタラクションをリアルタイムで監視した。
論文 参考訳(メタデータ) (2026-03-09T14:43:40Z) - DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services [49.70819009392778]
大規模言語モデル (LLM) とマルチエージェントシステム (MAS) は、ディスパッチを増強する機会を提供する。
本研究の目的は,現実的なシナリオをシミュレートする分類基盤型マルチエージェントシステムの開発と評価である。
論文 参考訳(メタデータ) (2025-10-24T08:01:21Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - Continuous Patient Monitoring with AI: Real-Time Analysis of Video in Hospital Care Settings [0.0]
本研究は, 病院環境における継続的および受動的患者モニタリングのためのAI駆動型プラットフォームを提案する。
このプラットフォームは、ビデオ分析を通じて患者の行動と相互作用に関するリアルタイムな洞察を提供する。
このデータセットは11人の病院パートナーと共同で作成され、300人以上の高リスクの転倒患者を対象とする。
論文 参考訳(メタデータ) (2024-12-17T18:23:33Z) - RAISE -- Radiology AI Safety, an End-to-end lifecycle approach [5.829180249228172]
放射線学へのAIの統合は、臨床ケアの供給と効率を改善する機会をもたらす。
モデルが安全性、有効性、有効性の最高基準を満たすことに注力すべきである。
ここで提示されるロードマップは、放射線学におけるデプロイ可能で信頼性があり、安全なAIの達成を早めることを目的としている。
論文 参考訳(メタデータ) (2023-11-24T15:59:14Z) - U-PASS: an Uncertainty-guided deep learning Pipeline for Automated Sleep
Staging [61.6346401960268]
プロセスの各段階で不確実性推定を組み込んだ臨床応用に適した,U-PASSと呼ばれる機械学習パイプラインを提案する。
不確実性誘導型ディープラーニングパイプラインを睡眠ステージングの困難な問題に適用し、各ステージにおけるパフォーマンスを体系的に改善することを示す。
論文 参考訳(メタデータ) (2023-06-07T08:27:36Z) - Large Language Models for Healthcare Data Augmentation: An Example on
Patient-Trial Matching [49.78442796596806]
患者-心電図マッチング(LLM-PTM)のための革新的なプライバシ対応データ拡張手法を提案する。
本実験では, LLM-PTM法を用いて平均性能を7.32%向上させ, 新しいデータへの一般化性を12.12%向上させた。
論文 参考訳(メタデータ) (2023-03-24T03:14:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。