論文の概要: SIMAX: A Scalable and Interpretable Framework for Multi-Fidelity and Annotated Clinician-Patient Dialogue Simulation
- arxiv url: http://arxiv.org/abs/2606.30491v1
- Date: Mon, 29 Jun 2026 15:56:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.32251
- Title: SIMAX: A Scalable and Interpretable Framework for Multi-Fidelity and Annotated Clinician-Patient Dialogue Simulation
- Title(参考訳): SIMAX: マルチフィデリティと注釈付きクリニック-パティエント対話シミュレーションのためのスケーラブルで解釈可能なフレームワーク
- Authors: Zhuhan Bao, Rui Yang, Bohao Yang, Zhiyi Liu, Sicheng Shu, Ruio Heerschap, Le Li, Doris Yang, Elisabeth Bond, Haoyuan Wang, Nicoleta Economou-Zavlanos, Joshua M. Biro, Matthew McDermott, Nan Liu, Anand Chowdhury, Kai Sun, Kathryn Pollak, Ed Hammond, Chuan Hong,
- Abstract要約: デジタルクリエーターは、臨床医と患者の対話を大規模に捉えています。
臨床コミュニケーションデータの人間のコーディングは、費用がかかり、一貫性がなく、スケールが難しいままである。
本稿では,参照行動アノテーションを用いた臨床対話データ生成のためのフレームワークを開発する。
- 参考スコア(独自算出の注目度): 14.777421267061689
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Background. The widespread deployment of ambient digital scribes is driving large-scale capture of clinician-patient dialogues. Human coding of clinical communication data remains costly, inconsistent, and difficult to scale, motivating AI-driven communication coding systems. However, evaluating these systems requires real-world dialogues and human-coded labels, both hard to obtain at scale. Methods. We developed SIMAX (Scalable and Interpretable Framework for Multi-Fidelity and Annotated Clinician-Patient Dialogue Simulation), a framework for generating controlled clinical dialogue data with reference behavioral annotations. SIMAX generates clinician-patient dialogues from predefined clinical scenarios, personas and voice conditions, and target communication behaviors. Behaviors are controlled using two codebooks: the Global Codebook for overall communication quality and the WISER Codebook for specific countable behaviors. We evaluated SIMAX using automated and human quality assessments and an example communication coding system. Results. SIMAX generated 3,388 simulated dialogues across three specialties, multiple visit stages, persona characteristics, and accent conditions. Automated assessment showed mean UTMOS and WV-MOS scores of 3.03 and 2.61, WER and CER of 0.07 and 0.05, and CLAP cosine similarity of 0.41, suggesting reasonable speech naturalness, high transcription fidelity, and positive text-audio correspondence. Human evaluation showed a median MOS of 4.67 and a median clinical realism score of 3.00. Downstream evaluation suggests that SIMAX can assess how a communication coding system responds to behavioral targets and reveal insufficient sensitivity in some dimensions. Conclusions. SIMAX generates controlled and reproducible simulated clinician-patient dialogues, providing a data foundation for developing, validating, and refining communication coding systems.
- Abstract(参考訳): 背景。
周辺デジタルスクリプティングの展開は、臨床医と患者との対話を大規模に捉えている。
臨床コミュニケーションデータの人間のコーディングは、費用がかかり、一貫性がなく、スケールが難しいままであり、AI駆動のコミュニケーションコーディングシステムを動機付けている。
しかし、これらのシステムを評価するには現実世界の対話と人間によるラベルが必要であり、どちらも大規模に入手することは困難である。
メソッド。
SIMAX(Scalable and Interpretable Framework for Multi-Fidelity and Annotated Clinicalian-Patient Dialogue Simulation)を開発した。
SIMAXは、事前に定義された臨床シナリオ、ペルソナと音声条件、およびターゲット通信行動から臨床患者と患者との対話を生成する。
行動は2つのコードブックを使って制御される: 全体的なコミュニケーション品質のためのGlobal Codebookと、特定の可算行動のためのWISER Codebookである。
自動品質評価と通信符号化システムの例を用いてSIMAXを評価した。
結果。
SIMAXは3つの専門分野、複数の訪問ステージ、ペルソナ特性、アクセント条件に関する3,388のシミュレーション対話を生成した。
自動評価の結果, UTMOSとWV-MOSのスコアは3.03と2.61, WERとCERは0.07と0.05,CLAPのコサイン類似度は0.41であった。
人的評価では、MOSは4.67で、臨床リアリズムは3.00。
ダウンストリーム評価は、SIMAXが通信符号化システムがどのように行動目標に反応するかを評価し、いくつかの次元において不十分な感度を明らかにすることを示唆している。
結論。
SIMAXは、制御および再現可能なシミュレートされた臨床医と患者の対話を生成し、通信符号化システムの開発、検証、精製のためのデータ基盤を提供する。
関連論文リスト
- Synthesis and Evaluation of Long-term History-aware Medical Dialogue [6.317682711402412]
高品質な長期医療対話をLLMと合成するための枠組みを提案する。
我々は,医療エージェントの記憶能力を評価するために,対話内推論,対話間推論,合成推論の3つのベンチマークタスクを構築した。
ベンチマーク実験によると、最先端のLLMでさえMediLongChatと競合している。
論文 参考訳(メタデータ) (2026-05-19T12:38:41Z) - From Medical Records to Diagnostic Dialogues: A Clinical-Grounded Approach and Dataset for Psychiatric Comorbidity [24.19771858153057]
複数の共起性障害の複雑さのため、精神疾患は臨床的に有意であるが困難である。
人工患者電子カルテ構築とマルチエージェント診断ダイアログ生成を組み合わせた新しいアプローチを開発した。
PsyCoTalkは、精神科医が検証した3000の多ターン診断対話を含む、コオービディティをサポートする最初の大規模対話データセットである。
論文 参考訳(メタデータ) (2025-10-29T07:18:43Z) - 3MDBench: Medical Multimodal Multi-agent Dialogue Benchmark [2.3011663397108078]
3MDBenchは、LVLM駆動の遠隔医療相談をシミュレートし評価するためのオープンソースのフレームワークである。
内部推論によるマルチモーダル対話は、非対話設定よりもF1スコアが6.5%向上する。
診断畳み込みニューラルネットワークからLVLMのコンテキストに予測を注入すると、F1は最大20%向上する。
論文 参考訳(メタデータ) (2025-03-26T07:32:05Z) - Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations [74.83732294523402]
実世界の診断シナリオをシミュレートし,USMLE標準に適合するノイズと難易度を統合する新しいベンチマークを導入する。
また、対話に基づく微調整についても検討し、静的データセットを会話形式に変換し、反復的推論プロセスをよりよく捉える。
実験の結果、対話調整されたモデルは従来の手法よりも優れており、マルチラウンド推論のシナリオでは9.64%、ノイズの多い環境では6.18%の精度で改善されている。
論文 参考訳(メタデータ) (2025-01-29T18:58:48Z) - Synthetic Patient-Physician Dialogue Generation from Clinical Notes Using LLM [27.33193944412666]
医療対話システム(MDS)は、患者と医師のコミュニケーションを強化し、医療のアクセシビリティを改善し、コストを削減する。
しかし、これらのシステムの訓練に適したデータを取得することは大きな課題である。
我々のアプローチであるSynDialは、ゼロショットプロンプトとフィードバックループを備えた単一のLLMを反復的に使用し、高品質な合成対話を生成する。
論文 参考訳(メタデータ) (2024-08-12T16:49:22Z) - Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding [53.629132242389716]
VLM(Vision-Language Models)は、医用画像を分析し、自然言語の相互作用に関与することによって、臨床医を支援する。
VLMはしばしば「幻覚的」な振る舞いを示し、文脈的マルチモーダル情報に基づかないテキスト出力を生成する。
本稿では,臨床推論の象徴的表現を用いて医療知識にVLMを基盤とする新たなアライメントアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-05-29T23:19:28Z) - AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator [69.51568871044454]
我々は,emphDoctorをプレイヤとして,NPC間の動的医療相互作用をシミュレーションするフレームワークであるtextbfAI Hospitalを紹介した。
この設定は臨床シナリオにおけるLCMの現実的な評価を可能にする。
高品質な中国の医療記録とNPCを利用したマルチビュー医療評価ベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-15T06:46:48Z) - MedDG: An Entity-Centric Medical Consultation Dataset for Entity-Aware
Medical Dialogue Generation [86.38736781043109]
MedDGという12種類の消化器疾患に関連する大規模医用対話データセットを構築し,公開する。
MedDGデータセットに基づく2種類の医療対話タスクを提案する。1つは次のエンティティ予測であり、もう1つは医師の反応生成である。
実験結果から,プレトレイン言語モデルと他のベースラインは,両方のタスクに苦戦し,データセットの性能が劣ることがわかった。
論文 参考訳(メタデータ) (2020-10-15T03:34:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。