論文の概要: Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models
- arxiv url: http://arxiv.org/abs/2609.22161v1
- Date: Wed, 26 Aug 2026 13:33:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.750734
- Title: Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models
- Title(参考訳): 医療知識と臨床事例 : データ型が医療用大言語モデルをどのように形成するか
- Abstract要約: 我々は,データ構成が知識集約的,クリニック指向のタスクにおいて,パフォーマンス,能力プロファイル,エラーパターンにどのように影響するかを分析する。
臨床データは,知識集約型と競合しながら,クリニック指向のタスクを改善する。
- 参考スコア(独自算出の注目度): 36.69609030883843
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical large language models are commonly trained on mixtures of didactic data (e.g., textbooks) and clinical data (e.g., patient records), yet how these data types differentially shape model capabilities remains unclear. We address this issue with token-matched experiments that vary the didactic-to-clinical ratio and analyze how data composition affects performance, capability profiles, and error patterns across knowledge-intensive and clinic-oriented tasks. We uncover an asymmetric transfer across task types: clinical data improves clinic-oriented tasks while remaining competitive on knowledge-intensive ones, whereas didactic data mainly improves knowledge-intensive tasks. Error analysis suggests a knowing-doing gap, where improvements in knowledge recall do not reliably generalize to clinical reasoning. We further observe that modest amounts of clinical data yield most of the gains on EHR-grounded tasks, while the optimal mixture ratio varies with the knowledge and clinical reasoning demands of downstream tasks. These findings suggest that medical LLM data curation should be application-driven, with higher proportions of clinical data preferred for reasoning-intensive use cases.
- Abstract(参考訳): 医療用大言語モデルは、一般的に、医療用データ(例:教科書)と臨床用データ(例:患者記録)の混合に基づいて訓練されているが、これらのデータ型がどう異なる形状のモデル機能を持つかは、いまだ不明である。
この問題を解決するために,知識集約型およびクリニック指向のタスク間で,データ構成がパフォーマンス,能力プロファイル,エラーパターンにどのように影響するかを分析したトークンマッチング実験を行った。
臨床データは、知識集約型タスクに競争力を維持しながら、クリニック指向型タスクを改善するが、ドクティックデータは主として知識集約型タスクを改善する。
誤り分析は、知識のリコールの改善が臨床的推論に確実に一般化しないような、知識と知識のギャップを示唆している。
さらに, 臨床データ量が少ないと, EHR-grounded タスクの利得がほとんどになるのに対し, 最適混合比は, 下流タスクの知識と臨床理由の要求によって異なる。
以上より, LLMデータキュレーションは, 理学療法に好まれる臨床データの割合が高く, 医療用LLMデータキュレーションの応用性が示唆された。
関連論文リスト
- Beyond Traditional Diagnostics: Transforming Patient-Side Information into Predictive Insights with Knowledge Graphs and Prototypes [55.310195121276074]
本稿では,病気を予測するための知識グラフ,プロトタイプ認識,解釈可能なフレームワークを提案する。
構造化された信頼された医療知識を統合された疾患知識グラフに統合し、臨床的に意味のある疾患のプロトタイプを構築し、予測精度を高めるために対照的な学習を利用する。
臨床的に有効な説明を提供し、患者の物語と密接に一致し、患者中心のヘルスケアデリバリーの実践的価値を強調している。
論文 参考訳(メタデータ) (2025-12-09T05:37:54Z) - CURENet: Combining Unified Representations for Efficient Chronic Disease Prediction [24.569877750738286]
CURENetは、構造化されていない臨床ノート、検査結果、患者の時系列データを統合するマルチモーダルモデルである。
CURENetは、さまざまな臨床データ間の複雑な相互作用を捉え、慢性疾患のより信頼性の高い予測モデルを作成することができる。
論文 参考訳(メタデータ) (2025-11-14T15:52:22Z) - MIEO: encoding clinical data to enhance cardiovascular event prediction [31.458406135473805]
臨床データから知識を抽出し、臨床事象を予測する機械学習手法が用いられている。
有望なアプローチでは、ラベル付きデータの低可用性と、欠落した値につながるデータという、少なくとも2つの大きな問題に悩まされる。
本研究は,これらの課題に効率的に対処するための自己教師付きオートエンコーダを提案する。
論文 参考訳(メタデータ) (2025-10-13T10:47:49Z) - TREEMENT: Interpretable Patient-Trial Matching via Personalized Dynamic
Tree-Based Memory Network [54.332862955411656]
臨床試験は薬物開発に不可欠であるが、しばしば高価で非効率な患者募集に苦しむ。
近年,患者と臨床試験を自動マッチングすることで患者採用を高速化する機械学習モデルが提案されている。
本稿では,TREement という名前の動的ツリーベースメモリネットワークモデルを導入する。
論文 参考訳(メタデータ) (2023-07-19T12:35:09Z) - Medical Data Augmentation via ChatGPT: A Case Study on Medication
Identification and Medication Event Classification [2.980018103007841]
2022年のN2C2コンクールでは、電子健康記録の重要な要因の特定を促進するために様々なタスクが提示された。
事前訓練された大規模言語モデル (LLM) はこれらのタスクにおいて例外的な性能を示した。
本研究の目的は、注釈付きデータの限られた可用性を克服するために、データ拡張のためのLCM(特にChatGPT)の利用を検討することである。
論文 参考訳(メタデータ) (2023-06-10T20:55:21Z) - SPeC: A Soft Prompt-Based Calibration on Performance Variability of
Large Language Model in Clinical Notes Summarization [50.01382938451978]
本稿では,ソフトプロンプトを用いたモデルに依存しないパイプラインを導入し,確率に基づく要約の利点を保ちながら分散を減少させる。
実験結果から,本手法は性能を向上するだけでなく,様々な言語モデルの分散を効果的に抑制することが明らかとなった。
論文 参考訳(メタデータ) (2023-03-23T04:47:46Z) - sEHR-CE: Language modelling of structured EHR data for efficient and
generalizable patient cohort expansion [0.0]
sEHR-CEは、異種臨床データセットの統合表現型化と分析を可能にするトランスフォーマーに基づく新しいフレームワークである。
大規模研究である英国バイオバンクのプライマリ・セカンダリ・ケアデータを用いてアプローチを検証する。
論文 参考訳(メタデータ) (2022-11-30T16:00:43Z) - How to Leverage Multimodal EHR Data for Better Medical Predictions? [13.401754962583771]
電子健康記録(EHR)データの複雑さは、ディープラーニングの適用の課題である。
本稿では,まずEHRから臨床ノートを抽出し,これらのデータを統合する方法を提案する。
2つの医療予測タスクの結果、異なるデータを持つ融合モデルが最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2021-10-29T13:26:05Z) - Select-ProtoNet: Learning to Select for Few-Shot Disease Subtype
Prediction [55.94378672172967]
本研究は, 類似患者のサブグループを同定し, 数発の疾患のサブタイプ予測問題に焦点を当てた。
新しいモデルを開発するためにメタラーニング技術を導入し、関連する臨床課題から共通の経験や知識を抽出する。
我々の新しいモデルは、単純だが効果的なメタ学習マシンであるPrototypeal Networkと呼ばれる、慎重に設計されたメタラーナーに基づいて構築されている。
論文 参考訳(メタデータ) (2020-09-02T02:50:30Z) - Trajectories, bifurcations and pseudotime in large clinical datasets:
applications to myocardial infarction and diabetes data [94.37521840642141]
混合データ型と欠落値を特徴とする大規模臨床データセット分析のための半教師付き方法論を提案する。
この手法は、次元の減少、データの可視化、クラスタリング、特徴の選択と、部分的に順序付けられた観測列における測地距離(擬時)の定量化のタスクを同時に扱うことのできる弾性主グラフの適用に基づいている。
論文 参考訳(メタデータ) (2020-07-07T21:04:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。