FuguReport

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

著者 Enes Yavuz Ugan, Fabian Retkowski, Yuka Ko, Thai-Binh Nguyen, Maike Züfle, Jan Niehues, Alexander Waibel
所属 Carnegie Mellon University / Karlsruhe Institute of Technology
カテゴリ Method / Speech Synthesis / Synthetic data generation for medical dialogues, Task / Medical Summarization / SOAP note generation from dialogues, Application / Healthcare AI / Medical dialogue processing and summarization
ライセンス CC BY 4.0

Abstractの概要

本論文では、医療対話音声からSOAP形式の臨床記録を直接生成する、KITのBeTraC 2026軽量トラック向けシステムを提示します。中核となるアプローチは、Qwen2.5-Omni-3B音声言語モデルをLoRAで適応させ、Audio→SOAPやTranscript→SOAPなどの形式に変換された多様な医療対話データセットの統合コレクション上で学習させるものです。中心的な構成要素として、テキストのみのデータセットに対する音声合成や、参照記録が存在しない場合のSOAP形式の教師データ自動生成を行うスケーラブルな拡張パイプラインを備えています。本研究では、タスクの評価プロトコルの下で、プロンプト設計、音声のみと音声・テキスト共同学習の比較、多段階適応、音声クリーニング、思考の連鎖(CoT)監督、チェックポイント平均化などを評価しています。

新規性

本論文の主な新規性は、合成音声生成と自動生成されたSOAP教師データを組み合わせることで多様な医療対話リソースを統合し、エンドツーエンドのSpeech-to-SOAP学習を実現するスケーラブルなデータ拡張パイプラインにあります。また、音声からの直接的な臨床記録生成に向けて、プロンプトの配置、中間適応戦略、およびチェックポイント平均化を体系的に分析している点も特徴です。

成果

開発セットにおいて、音声・テキスト共同学習は音声のみの学習に比べてConcept-F1を向上させ、中間適応戦略はベースラインの直接ASR初期化と比べて大幅な利得をもたらしました。最良の開発構成はチェックポイント平均化によって得られたマージモデルであり、Concept-F1で0.4986、ROUGE-2で0.3537、ROUGE-3で0.2417を達成しました。公式評価では、この主要マージモデルがDoPaCo、Mock Dialogue、Realisticの各テストセット全体で対照提出モデルを一貫して上回り、ドメインシフトに対する堅牢性の向上を示しました。

論文の注目点

  1. 合成音声の生成とSOAP記録の自動監督を通じて複数の医療対話データセットを統合し、エンドツーエンドのSpeech-to-SOAPモデルを学習させた。
  2. 実験的なアブレーションにより、詳細なタスク指示はシステムプロンプトよりも指示プロンプトとして配置する方が効果的であり、文字起こしの監督は語彙の一致度よりも主に臨床概念の抽出精度を向上させることが示された。
  3. 多様な設定で学習されたモデルのチェックポイント平均化により最も強力なシステムが構築され、すべての公式テストセットにおいて対照モデルを上回る性能を達成した。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。