論文の概要: Towards Conversational Medical AI with Eyes, Ears and a Voice
- arxiv url: http://arxiv.org/abs/2605.09272v1
- Date: Sun, 10 May 2026 02:43:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.157047
- Title: Towards Conversational Medical AI with Eyes, Ears and a Voice
- Title(参考訳): 目・耳・声による会話型医療AIを目指して
- Abstract要約: 我々は,対話型AIシステムであるAIコクリニシアンを紹介する。
その二重エージェントアーキテクチャは、自然な対話に必要な低レイテンシと深い臨床推論のバランスをとる。
我々の研究は、テキストのみのアプローチが、医療相談の真の課題を捉えるのに失敗していることを示している。
- 参考スコア(独自算出の注目度): 19.359997612335018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The practice of medicine relies not only upon skillful dialogue but also on the nuanced exchange and interpretation of rich auditory and visual cues between doctors and patients. Building on the low-latency voice and video processing capabilities of Gemini, we introduce AI co-clinician, a first-of-its-kind conversational AI system utilizing continuous streams of audio-visual data from live patient conversations to inform real-time clinical decisions. Its dual-agent architecture balances deep clinical reasoning with the low latency required for natural dialogue. To assess this system, we implemented a video-based interface emulating telemedicine consultations. We crafted 20 standardized outpatient scenarios requiring proactive real-time auditory and visual reasoning and designed "TelePACES" evaluation criteria alongside case-specific rubrics. In a randomized, interface-blinded, crossover simulation study (n = 120 encounters) with 10 internal medicine residents as patient actors, we compared AI co-clinician with primary care physicians (PCPs), GPT-Realtime, and a baseline agent. AI co-clinician approached PCPs in key TelePACES dimensions, including management plans and differential diagnosis, while significantly outperforming GPT-Realtime across all general criteria. While our agent demonstrated parity with PCPs in case-specific triage measures, physicians maintained superior overall performance in case-specific assessments. Although AI co-clinician marks a significant advance in real-time telemedical AI, gaps remain in physical examination and disease-specific reasoning. Our work shows that text-only approaches fail to capture the true challenges of medical consultation and suggests that high-stakes real-time diagnostic AI is most safely advanced in collaborative, triadic models where AI can be a supportive co-clinician for doctors and patients.
- Abstract(参考訳): 医学の実践は、熟練した対話だけでなく、医師と患者の豊かな聴覚と視覚的手がかりの微妙な交換と解釈にも依存している。
Geminiの低レイテンシ音声およびビデオ処理機能に基づいて、我々はAIコクリニシアン(co-clinician)を紹介します。
その二重エージェントアーキテクチャは、自然な対話に必要な低レイテンシと深い臨床推論のバランスをとる。
このシステムを評価するために,遠隔医療相談をエミュレートするビデオベースインタフェースを実装した。
本研究は, リアルタイム聴覚と視覚的推論を必要とする外来患者20名を対象に, 症例別ルーリックとともに「テレPACES」評価基準を策定した。
患者10名の内科医と無作為・インターフェース・ブラインド・クロスオーバー・シミュレーション(n = 120)において,AIコクリニシアンとプライマリ・ケア・ドクター(PCP),GPT-Realtime,ベースライン・エージェントを比較した。
AIのコクリニシアン(co-clinician)は、管理計画やディファレンシャル診断を含む主要なTelePACES領域のPCPにアプローチし、すべての一般的な基準でGPT-Realtimeを著しく上回った。
症例特異的トリアージ尺度ではPCPと同等であったが,医師は症例特異的評価では総合成績が良好であった。
AIコクリニシアン(英語版)はリアルタイム遠隔医療AIにおいて大きな進歩を見せているが、物理的な検査と疾患固有の推論にはギャップが残っている。
我々の研究は、テキストのみのアプローチが医療相談の真の課題を捉えることができず、医師や患者にとってAIが支援的なコクリニシアンとなるような、協力的で三進的なモデルにおいて、ハイリスクなリアルタイム診断AIが最も安全に進歩していることを示唆している。
関連論文リスト
- Towards Expert-level Medical AI for Real-time Video Consultations [15.52174279061238]
本稿では,AMIE(Articulate Medical Intelligence Explorer)を用いたリアルタイム臨床ビデオコンサルテーションにおけるエキスパートレベルのAIの最初の実演を行う。
AMIE(ビデオ)は、低遅延対話、臨床推論、リアルタイムオーディオ視覚知覚を統合したジェミニベースのマルチエージェントシステムである。
患者は, コミュニケーションの有効性, 利便性, 理解を深めるために, AMIE(ビデオ)のインタフェースをテキストチャットよりも好んだ。
論文 参考訳(メタデータ) (2026-08-10T17:19:31Z) - Clinical Reasoning in the Age of AI: Longitudinal Cognition and Human-AI Collaboration [0.7588418803784354]
現実の環境での臨床的な問題を通じて医師が推論する方法を理解することは、効果的なAI推論システムの設計に不可欠である。
本研究は、臨床推論を文脈に敏感で時間的に拡張されたプロセスとして理解するための統一的な枠組みを提供する。
論文 参考訳(メタデータ) (2026-06-07T03:51:15Z) - A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic [21.374164324051012]
アーティキュレート・メディカル・インテリジェンス・エクスプローラー(AMIE)
100人の成人患者が任命の5日前にAMIEテキストチャットのやりとりを完了した。
ヒューマン・セーフティ・スーパーバイザーは、患者とAMIEのインタラクションをリアルタイムで監視した。
論文 参考訳(メタデータ) (2026-03-09T14:43:40Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Towards physician-centered oversight of conversational diagnostic AI [40.583050959984995]
患者安全の現実的な保証は、個々の診断と治療計画を提供することが、認可された専門家による規制活動であることを意味する。
そこで我々は,Articulate Medical Intelligence Explorer (AMIE) AIシステムの効果的な非同期監視のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-21T15:54:36Z) - Advancing Conversational Diagnostic AI with Multimodal Reasoning [44.1996223689966]
アーティキュレート・メディカル・インテリジェンス・エクスプローラー(AMIE)
システムは、対話フローを中間モデル出力によって動的に制御する状態認識対話フレームワークを実装している。
患者アクターとのチャットベースの相談の無作為で盲目なOSCEスタイルの研究において, AMIEをプライマリケア医師(PCP)と比較した。
論文 参考訳(メタデータ) (2025-05-06T20:52:01Z) - Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations [74.83732294523402]
実世界の診断シナリオをシミュレートし,USMLE標準に適合するノイズと難易度を統合する新しいベンチマークを導入する。
また、対話に基づく微調整についても検討し、静的データセットを会話形式に変換し、反復的推論プロセスをよりよく捉える。
実験の結果、対話調整されたモデルは従来の手法よりも優れており、マルチラウンド推論のシナリオでは9.64%、ノイズの多い環境では6.18%の精度で改善されている。
論文 参考訳(メタデータ) (2025-01-29T18:58:48Z) - Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding [53.629132242389716]
VLM(Vision-Language Models)は、医用画像を分析し、自然言語の相互作用に関与することによって、臨床医を支援する。
VLMはしばしば「幻覚的」な振る舞いを示し、文脈的マルチモーダル情報に基づかないテキスト出力を生成する。
本稿では,臨床推論の象徴的表現を用いて医療知識にVLMを基盤とする新たなアライメントアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-05-29T23:19:28Z) - AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator [69.51568871044454]
我々は,emphDoctorをプレイヤとして,NPC間の動的医療相互作用をシミュレーションするフレームワークであるtextbfAI Hospitalを紹介した。
この設定は臨床シナリオにおけるLCMの現実的な評価を可能にする。
高品質な中国の医療記録とNPCを利用したマルチビュー医療評価ベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-15T06:46:48Z) - Towards Conversational Diagnostic AI [32.84876349808714]
本稿では,診断対話に最適化されたLarge Language Model (LLM)ベースのAIシステムであるAMIE(Articulate Medical Intelligence Explorer)を紹介する。
AMIEは、さまざまな疾患条件にまたがって学習をスケールするための自動フィードバック機構を備えた、セルフプレイベースのシミュレート環境を使用する。
AMIEの診断精度は, 専門医によると32例中28例, 患者アクターでは26例中24例で高い成績を示した。
論文 参考訳(メタデータ) (2024-01-11T04:25:06Z) - HEAR4Health: A blueprint for making computer audition a staple of modern
healthcare [89.8799665638295]
近年、従来の医療システムを変革する試みとして、デジタル医療の研究が急速に増加している。
コンピュータによるオーディションは、少なくとも商業的関心の面では遅れている。
実生活における聴覚信号の分析に必要な基礎技術に対応する聴覚、計算とデータ効率の進歩、個々の差異を考慮し、医療データの長手性を扱う聴覚。
論文 参考訳(メタデータ) (2023-01-25T09:25:08Z) - Towards the Use of Saliency Maps for Explaining Low-Quality Electrocardiograms to End Users [51.644376281196394]
診断に医用画像を使用する場合,画像が高品質であることが重要である。
遠隔医療において一般的な問題は、患者が診療所を退院した後にのみ、品質問題が警告されることである。
本稿では,低品質な医用画像をリアルタイムにフラグ付け,説明するためのAIシステムの開発について報告する。
論文 参考訳(メタデータ) (2022-07-06T14:53:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。