論文の概要: A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks
- arxiv url: http://arxiv.org/abs/2605.26747v1
- Date: Tue, 26 May 2026 09:21:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.786566
- Title: A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks
- Title(参考訳): 音声言語処理タスクのためのロボット・パティエント・ドクター・パティエント・メディカル・ダイアログのデータセット
- Authors: Heriberto Cuayahuitl, Grace Jang,
- Abstract要約: MeDial-Speechは、Med-AIのトレーニングと評価のための新しい音声データセットである。
ロボット患者と医師患者との対話から現実的な環境下で収集した。
健康状態は、レヴィ・ボディー・認知症、心不全、肩痛、狭心症である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have brought huge improvements to Artificial Intelligence (AI), which can be applied to general-purpose tasks. However, their application to textual or spoken medical consultations is still an open research problem. This paper proposes MeDial-Speech, a novel speech dataset for training and evaluating Med-AIs that can carry out consultations with patients. It was collected in realistic environments from robot-patient and doctor-patient dialogues, contains 111+ hours of speech data (without data augmentation), and covers four health conditions: Lewy body dementia, heart failure, shoulder pain, and angina. In addition, we propose a dialogue benchmark via sentence selection (with 20 options) to evaluate three state-of-the-art LLMs: GPT-5 mini, DeepSeek-V3, and Claude Sonnet 4. Experimental results reveal that Claude Sonnet 4 is the best in sentence selection, with 71.1% accuracy using manual transcriptions and 74.7% using automatic transcriptions, and that all LLMs are highly overconfident in their probabilistic predictions, regardless of selecting correct or incorrect sentences in medical dialogues. This dataset is free of charge for non-commercial purposes at: https://huggingface.co/datasets/hcuayahu/MeDial-Speech
- Abstract(参考訳): 大規模言語モデル(LLM)は、汎用タスクに適用可能な人工知能(AI)に大きな改善をもたらした。
しかし、テキストや音声による医療相談への応用は、まだオープンな研究課題である。
本稿では,Med-AIを訓練し,評価するための新しい音声データセットであるMeDial-Speechを提案する。
ロボット患者と医師と患者の対話から現実的な環境で収集され、111時間以上の音声データ(データ拡張なしで)が含まれており、Lewy body dementia、心不全、肩痛、狭心症という4つの健康状態をカバーする。
さらに,GPT-5 mini, DeepSeek-V3, Claude Sonnet 4の3つの最先端LCMを文選択(20オプション)で評価するダイアログベンチマークを提案する。
実験結果から、クロード・ソネット4は、手書きによる71.1%の精度、自動書き起こしによる74.7%の精度で、医療対話における正しい文や誤文の選択に関係なく、全てのLLMが確率論的予測を非常に過大評価していることが明らかとなった。
https://huggingface.co/datasets/hcuayahu/MeDial-Speech
関連論文リスト
- SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation [30.493851883411878]
本稿では,患者と音声によるマルチターンインタラクションを実現するSpeechMedAssistを提案する。
本研究では,SpeechLMのアーキテクチャ特性を利用して,従来のワンステージトレーニングを2段階のパラダイムに分離する。
我々のモデルは、ほとんどの評価設定において、有効性とロバスト性の両方において全てのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-01-08T06:14:58Z) - Towards Explainable Conversational AI for Early Diagnosis with Large Language Models [1.7236025557731807]
医療システムは、非効率な診断、コストの上昇、専門家への限られたアクセスといった問題に悩まされている。
現在のAIとディープラーニングの診断システムは、あまりインタラクティブで透過的ではなく、現実の患者中心の環境では効果が低い。
本稿では,GPT-4o,Retrieval-Augmented Generation,説明可能なAI技術を用いて,LLM(Large Language Model)を利用した診断チャットボットを提案する。
Chain-of-Thoughtの推進により、このシステムは診断の背後にあるより透明な推論も提供する。
論文 参考訳(メタデータ) (2025-12-19T13:28:50Z) - Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding [112.46150793476603]
透明で汎用的な医用ビジョンランゲージモデル(VLM)であるHulu-Medを紹介する。
Hulu-Medは1670万サンプルのキュレートされたコーパスで訓練されており、12の解剖学的システムと14の医用画像モダリティにまたがっている。
Hulu-Medは、30ベンチマーク中27ベンチマークで既存のオープンソースモデルを上回っ、16ベンチマークでGPT-4oなどのプロプライエタリシステムを上回っている。
論文 参考訳(メタデータ) (2025-10-09T17:06:42Z) - 3MDBench: Medical Multimodal Multi-agent Dialogue Benchmark [2.3011663397108078]
3MDBenchは、LVLM駆動の遠隔医療相談をシミュレートし評価するためのオープンソースのフレームワークである。
内部推論によるマルチモーダル対話は、非対話設定よりもF1スコアが6.5%向上する。
診断畳み込みニューラルネットワークからLVLMのコンテキストに予測を注入すると、F1は最大20%向上する。
論文 参考訳(メタデータ) (2025-03-26T07:32:05Z) - Afrispeech-Dialog: A Benchmark Dataset for Spontaneous English Conversations in Healthcare and Beyond [0.0]
Afrispeech-Dialogは、医学的および非医学的アフリカ中心の英語会話を模擬した50のベンチマークデータセットである。
長音のアクセント付き音声に対して,最先端話者ダイアリゼーション(SOTA)とASRシステムを評価し,その性能をネイティブアクセントと比較し,10%以上の性能劣化を見出した。
論文 参考訳(メタデータ) (2025-02-06T10:33:07Z) - Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations [74.83732294523402]
実世界の診断シナリオをシミュレートし,USMLE標準に適合するノイズと難易度を統合する新しいベンチマークを導入する。
また、対話に基づく微調整についても検討し、静的データセットを会話形式に変換し、反復的推論プロセスをよりよく捉える。
実験の結果、対話調整されたモデルは従来の手法よりも優れており、マルチラウンド推論のシナリオでは9.64%、ノイズの多い環境では6.18%の精度で改善されている。
論文 参考訳(メタデータ) (2025-01-29T18:58:48Z) - MedAlign: A Clinician-Generated Dataset for Instruction Following with
Electronic Medical Records [60.35217378132709]
大型言語モデル(LLM)は、人間レベルの流布で自然言語の指示に従うことができる。
医療のための現実的なテキスト生成タスクにおけるLCMの評価は依然として困難である。
我々は、EHRデータのための983の自然言語命令のベンチマークデータセットであるMedAlignを紹介する。
論文 参考訳(メタデータ) (2023-08-27T12:24:39Z) - CDialog: A Multi-turn Covid-19 Conversation Dataset for Entity-Aware
Dialog Generation [18.047064216849204]
われわれは,CDialog と命名された Covid-19 病に関連する高品質な医療用ダイアログデータセットを公表した。
本稿では,CDialogデータセットに基づく新しい医用ダイアログシステムを提案する。
論文 参考訳(メタデータ) (2022-11-16T11:07:34Z) - On the Generation of Medical Dialogues for COVID-19 [60.63485429268256]
新型コロナウイルス関連の症状を患ったり、危険因子に晒されたりする人は、医師に相談する必要がある。
医療専門家が不足しているため、多くの人がオンライン相談を受けることができない。
本研究の目的は、新型コロナウイルス関連の相談を提供する医療対話システムの構築である。
論文 参考訳(メタデータ) (2020-05-11T21:23:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。