論文の概要: Generating High Quality Synthetic Data for Dutch Medical Conversations
- arxiv url: http://arxiv.org/abs/2604.09645v1
- Date: Wed, 25 Mar 2026 10:27:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.594332
- Title: Generating High Quality Synthetic Data for Dutch Medical Conversations
- Title(参考訳): オランダ語医療会話のための高品質合成データの作成
- Authors: Cecilia Kuan, Aditya Kamlesh Parikh, Henk van den Heuvel,
- Abstract要約: 本稿では,オランダ語微調整大言語モデルを用いて,合成オランダ語医療対話を生成するパイプラインを提案する。
対話を定量的に評価し,母国語話者や医療従事者による質的評価を行った。
- 参考スコア(独自算出の注目度): 0.7464649333825819
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Medical conversations offer insights into clinical communication often absent from Electronic Health Records. However, developing reliable clinical Natural Language Processing (NLP) models is hampered by the scarcity of domain-specific datasets, as clinical data are typically inaccessible due to privacy and ethical constraints. To address these challenges, we present a pipeline for generating synthetic Dutch medical dialogues using a Dutch fine-tuned Large Language Model, with real medical conversations serving as linguistic and structural reference. The generated dialogues were evaluated through quantitative metrics and qualitative review by native speakers and medical practitioners. Quantitative analysis revealed strong lexical variety and overly regular turn-taking, suggesting scripted rather than natural conversation flow. Qualitative review produced slightly below-average scores, with raters noting issues in domain specificity and natural expression. The limited correlation between quantitative and qualitative results highlights that numerical metrics alone cannot fully capture linguistic quality. Our findings demonstrate that generating synthetic Dutch medical dialogues is feasible but requires domain knowledge and carefully structured prompting to balance naturalness and structure in conversation. This work provides a foundation for expanding Dutch clinical NLP resources through ethically generated synthetic data.
- Abstract(参考訳): 医療談話は、しばしば電子健康記録から欠落する臨床コミュニケーションについての洞察を提供する。
しかしながら、信頼できる臨床自然言語処理(NLP)モデルの開発は、プライバシや倫理的制約のため、一般的に臨床データがアクセスできないため、ドメイン固有のデータセットの不足によって妨げられている。
これらの課題に対処するために、オランダの微調整大言語モデルを用いて合成オランダ語医療対話を生成するパイプラインを提案し、実際の医療会話を言語的および構造的参照として提供する。
生成した対話は,母国語話者と医療従事者による定量的評価と質的評価によって評価された。
定量的解析により,強い語彙的多様性と過剰に規則的なターンテイクが示され,自然な会話の流れよりもスクリプト化が示唆された。
質的なレビューは平均よりわずかに低いスコアを生み出し、ラッカーはドメインの特異性や自然表現の問題に言及した。
定量的な結果と質的な結果の間の限定的な相関は、数値的な指標だけでは言語的な品質を完全に把握できないことを強調している。
本研究は, 合成オランダ語医療対話の作成が実現可能であることを示すものであるが, ドメイン知識が必要であり, 会話における自然性と構造のバランスを取るために, 慎重に構造化される必要があることを示唆する。
この研究は、倫理的に生成された合成データを通じてオランダの臨床NLPリソースを拡張する基盤を提供する。
関連論文リスト
- MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers [35.41469674626373]
ブラジル初の大規模実世界コーパスであるMedPTを紹介した。
患者と医師の相互作用から384,095個の質問応答対を合成する。
本分析では,患者と医師のコミュニケーションにおける自然な非対称性など,主題の幅(3,200トピックス)と独特の言語特性を明らかにした。
論文 参考訳(メタデータ) (2025-11-14T21:13:28Z) - How Real Are Synthetic Therapy Conversations? Evaluating Fidelity in Prolonged Exposure Dialogues [14.457387337806765]
医療における合成データの採用は、プライバシの懸念、データアクセスの制限、高いアノテーションコストによって引き起こされる。
本稿では,PTSDに対するPE(Prolonged Exposure)治療の総合的会話を,臨床モデルの訓練にスケーラブルな代替手段として検討する。
ターンテイキングや治療の忠実度といった,言語,構造,プロトコル固有の指標を用いて,実と合成の対話を体系的に比較する。
論文 参考訳(メタデータ) (2025-04-30T16:56:56Z) - Advancing Complex Medical Communication in Arabic with Sporo AraSum: Surpassing Existing Large Language Models [0.0]
本症例では、アラビアのNLPモデルであるJAISに対して、アラビア語臨床文書に適した言語モデルであるスポロ・アラサムを評価した。
その結果,Sporo AraSumはAI中心の定量値とPDQI-9の修正版で測定された定性的属性において,JAISを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2024-11-20T18:10:19Z) - Scalable Frame-based Construction of Sociocultural NormBases for Socially-Aware Dialogues [66.69453609603875]
社会文化的規範は、社会的相互作用における個人的行為の指針となる。
大規模言語モデル(LLM)を用いた社会文化的ノルム(SCN)ベース構築のためのスケーラブルなアプローチを提案する。
我々は、包括的で広くアクセス可能な中国社会文化ノルムベースを構築した。
論文 参考訳(メタデータ) (2024-10-04T00:08:46Z) - Synthetic Patient-Physician Dialogue Generation from Clinical Notes Using LLM [27.33193944412666]
医療対話システム(MDS)は、患者と医師のコミュニケーションを強化し、医療のアクセシビリティを改善し、コストを削減する。
しかし、これらのシステムの訓練に適したデータを取得することは大きな課題である。
我々のアプローチであるSynDialは、ゼロショットプロンプトとフィードバックループを備えた単一のLLMを反復的に使用し、高品質な合成対話を生成する。
論文 参考訳(メタデータ) (2024-08-12T16:49:22Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - Knowledge-Infused Prompting: Assessing and Advancing Clinical Text Data Generation with Large Language Models [46.32860360019374]
大規模言語モデル(LLM)はこの領域で有望だが、それらの直接的なデプロイはプライバシーの問題につながる可能性がある。
我々は,そのプロセスに知識を注入する,革新的で資源効率のよいアプローチであるClinGenを提案する。
7つのNLPタスクと16のデータセットを比較検討した結果,ClinGenはさまざまなタスクのパフォーマンスを継続的に向上させることがわかった。
論文 参考訳(メタデータ) (2023-11-01T04:37:28Z) - Towards more patient friendly clinical notes through language models and
ontologies [57.51898902864543]
本稿では,単語の単純化と言語モデリングに基づく医療用テキストの自動作成手法を提案する。
我々は,公開医療文のデータセットペアと,臨床医による簡易化版を用いている。
本手法は,医学フォーラムデータに基づく言語モデルを用いて,文法と本来の意味の両方を保存しながら,より単純な文を生成する。
論文 参考訳(メタデータ) (2021-12-23T16:11:19Z) - CBLUE: A Chinese Biomedical Language Understanding Evaluation Benchmark [51.38557174322772]
中国初のバイオメディカル言語理解評価ベンチマークを提示する。
名前付きエンティティ認識、情報抽出、臨床診断正規化、単文/文対分類を含む自然言語理解タスクのコレクションである。
本研究は,現在の11種類の中国モデルによる実験結果について報告し,その実験結果から,現在最先端のニューラルモデルがヒトの天井よりもはるかに悪い性能を示すことが示された。
論文 参考訳(メタデータ) (2021-06-15T12:25:30Z) - Benchmarking Automated Clinical Language Simplification: Dataset,
Algorithm, and Evaluation [48.87254340298189]
我々はMedLaneという名の新しいデータセットを構築し、自動化された臨床言語簡易化手法の開発と評価を支援する。
我々は,人間のアノテーションの手順に従い,最先端のパフォーマンスを実現するDECLAREと呼ばれる新しいモデルを提案する。
論文 参考訳(メタデータ) (2020-12-04T06:09:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。