論文の概要: SAGE: Semantic Anchor-Guided Evolution for Grounded Medical QA Data Synthesis
- arxiv url: http://arxiv.org/abs/2610.08093v1
- Date: Tue, 06 Oct 2026 10:23:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.931929
- Title: SAGE: Semantic Anchor-Guided Evolution for Grounded Medical QA Data Synthesis
- Title(参考訳): SAGE: 接地医療用QAデータ合成のためのセマンティックアンカーガイドによる進化
- Abstract要約: SAGEは、小規模でローカルにデプロイされたモデルで高品質な医療訓練データを生成することができる新しいデータ合成フレームワークである。
コアとなるSAGEは、最小の種子から、原子(個別の概念に基づく)と連想(関連に基づく)合成を反復的にインターリーブし、学習データをブートストラップする。
- 参考スコア(独自算出の注目度): 18.146231159833373
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Developing reliable models for clinical tasks, such as Medical Question Answering (QA), is severely constrained by the limited availability of high-quality, expert-annotated training data. This challenge is exacerbated by stringent privacy requirements and the impracticality of utilizing large open-source corpora or proprietary cloud APIs within resource-limited clinical settings. To address these obstacles, we introduce SAGE (\textit{Semantic Anchor-Guided Evolution}), a novel data synthesis framework that enables small, locally deployed models to generate high-quality medical training data. SAGE leverages lightweight, publicly available taxonomies such as MeSH as semantic anchors, imposing a structured prior to effectively guide and ground the data generation process. At its core, SAGE iteratively interleaves atomic (individual concept-based) and associative (relation-based) synthesis, bootstrapping training data from minimal seeds. This approach eliminates the need for large collections of medical documents or reliance on external APIs, providing a practical solution for on-premises data creation. Extensive experiments across multiple medical question-answering benchmarks demonstrate that models fine-tuned with SAGE-synthesized data consistently outperform those trained using self-derived or conventional document-based paradigms, highlighting tangible improvements in data efficiency and resource utilization for medical LLM development. Code is available at https://github.com/DIaacKr/SAGE.
- Abstract(参考訳): 医療質問応答 (QA) などの信頼性の高い臨床タスクのモデルの開発は,高品質な専門家によるトレーニングデータの提供が限られているため,厳しい制約が課せられる。
この課題は、厳格なプライバシ要件と、リソース制限された臨床設定内で大規模なオープンソースコーパスやプロプライエタリなクラウドAPIを活用する非現実性によって悪化する。
SAGE(\textit{Semantic Anchor-Guided Evolution})は、小規模でローカルにデプロイされたモデルで高品質な医療訓練データを生成する新しいデータ合成フレームワークである。
SAGEは、MeSHのような軽量で一般公開された分類をセマンティックアンカーとして利用し、データ生成プロセスを効果的にガイドし、基盤化する前に構造化された構造を付与する。
コアとなるSAGEは、最小の種子から、原子(個別の概念に基づく)と連想(関連に基づく)合成を反復的にインターリーブし、学習データをブートストラップする。
このアプローチは、大量の医療文書や外部APIに依存する必要をなくし、オンプレミスデータ作成の実用的なソリューションを提供する。
複数の医学的質問答えベンチマークの広範な実験により、SAGE合成データで微調整されたモデルは、自己由来または従来の文書ベースのパラダイムを用いて訓練されたモデルよりも一貫して優れており、医学的LLM開発におけるデータ効率と資源利用の明確な改善が強調されている。
コードはhttps://github.com/DIaacKr/SAGE.comで入手できる。
関連論文リスト
- Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach [62.0906177191353]
既存のアプローチでは、教師付き微調整を経て、大規模プロプライエタリモデルからの連鎖推論トレースを蒸留し、強化学習(RL)を実施している。
MedSSRは,医療知識を付加したデータ合成と半教師付き強化学習フレームワークである。
本フレームワークはまず, 分布制御可能な推論質問を合成するために, 稀な疾患知識を利用する。
次に、ポリシーモデル自体を利用して高品質な擬似ラベルを生成する。これにより、擬似ラベルデータ上での自己教師型RLと、人間の注釈付き実データ上での教師型RLの2段階固有の訓練パラダイムが実現される。
論文 参考訳(メタデータ) (2026-04-13T14:37:38Z) - Zero-Training Task-Specific Model Synthesis for Few-Shot Medical Image Classification [5.59515535487396]
深層学習モデルは、医用画像解析において顕著な成功を収めてきたが、大規模かつ精巧に注釈付けされたデータセットの要求に制約されている。
ゼロトレーニングタスク特化モデル合成(ZS-TMS)という新しいパラダイムを提案する。
既存のモデルに適応したり、新しいモデルをトレーニングする代わりに、大規模で事前訓練された生成エンジンを活用して、タスク固有の分類器のパラメータ集合全体を直接的に合成する。
論文 参考訳(メタデータ) (2025-11-18T03:12:01Z) - GENIE: Generative Note Information Extraction model for structuring EHR data [14.057531175321113]
生成ノート情報抽出システムGENIEを紹介する。
GENIEは1つのパスで全段落を処理し、エンティティ、アサーションステータス、ロケーション、修飾子、値、目的を高精度に抽出する。
堅牢なデータ準備パイプラインと微調整された小型LLMを使用して、GENIEは複数の情報抽出タスク間での競合性能を実現する。
論文 参考訳(メタデータ) (2025-01-30T15:42:24Z) - A text-to-tabular approach to generate synthetic patient data using LLMs [0.3628457733531155]
そこで本研究では,患者データへのアクセスを必要としない人工的な患者データを生成する手法を提案する。
我々は,大言語モデルの先行医療知識とコンテキスト内学習能力を活用して,現実的な患者データを生成する。
論文 参考訳(メタデータ) (2024-12-06T16:10:40Z) - How Good Are Synthetic Medical Images? An Empirical Study with Lung
Ultrasound [0.3312417881789094]
生成モデルを使用して合成トレーニングデータを追加することで、データの不足に対処するための低コストな方法が提供される。
合成データと実データの両方によるトレーニングは、実データのみによるトレーニングよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-10-05T15:42:53Z) - Learnable Weight Initialization for Volumetric Medical Image Segmentation [66.3030435676252]
本稿では,学習可能な重みに基づくハイブリッド医療画像セグメンテーション手法を提案する。
我々のアプローチはどんなハイブリッドモデルにも簡単に統合でき、外部のトレーニングデータを必要としない。
多臓器・肺がんセグメンテーションタスクの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-06-15T17:55:05Z) - STAR: Boosting Low-Resource Information Extraction by Structure-to-Text
Data Generation with Large Language Models [56.27786433792638]
STARは大規模言語モデル(LLM)を利用してデータインスタンスを合成するデータ生成手法である。
我々は、初期データインスタンスを取得するための詳細なステップバイステップ命令を設計する。
実験の結果,STARが生成したデータは,低リソースイベント抽出および関係抽出タスクの性能を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2023-05-24T12:15:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。