論文の概要: Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG
- arxiv url: http://arxiv.org/abs/2604.16422v1
- Date: Fri, 03 Apr 2026 16:23:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:13.98413
- Title: Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG
- Title(参考訳): 言語モデルに構造化バイオメディカル知識を注入する:連続事前学習 vs. GraphRAG
- Authors: Jaafer Klila, Sondes Bannour Souihi, Rahma Boujelben, Nasredine Semmar, Lamia Hadrich Belguith,
- Abstract要約: まず,Neo4jに格納されたUMLS(340万概念と342万関係)から大規模バイオメディカル知識グラフを構築し,効率的なクエリを行う。
このグラフから1億のテキストコーパスを導き,BERTUMLS(BERT)とBioBERTUMLS(BioBERT)の2つのモデルを継続的に事前学習する。
これらモデルを5つのタスクタイプにまたがる6つのBLURBデータセット上で評価し、2つのデータセット(QA, BioASQ)上でGraphRAGを評価する。
- 参考スコア(独自算出の注目度): 0.16997935926371668
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The injection of domain-specific knowledge is crucial for adapting language models (LMs) to specialized fields such as biomedicine. While most current approaches rely on unstructured text corpora, this study explores two complementary strategies for leveraging structured knowledge from the UMLS Metathesaurus: (i) Continual pretraining that embeds knowledge into model parameters, and (ii) Graph Retrieval-Augmented Generation (GraphRAG) that consults a knowledge graph at inference time. We first construct a large-scale biomedical knowledge graph from UMLS (3.4 million concepts and 34.2 million relations), stored in Neo4j for efficient querying. We then derive a ~100-million-token textual corpus from this graph to continually pretrain two models: BERTUMLS (from BERT) and BioBERTUMLS (from BioBERT). We evaluate these models on six BLURB (Biomedical Language Understanding and Reasoning Benchmark) datasets spanning five task types and evaluate GraphRAG on the two QA (Question Answering) datasets (PubMedQA, BioASQ). On BLURB tasks, BERTUMLS improves over BERT, with the largest gains on knowledge-intensive QA. Effects on BioBERT are more nuanced, suggesting diminishing returns when the base model already encodes substantial biomedical text knowledge. Finally, augmenting LLaMA 3-8B with our GraphRAG pipeline yields over than 3 points accuracy on PubMedQA and 5 points on BioASQ without any retraining, delivering transparent, multi-hop, and easily updated knowledge access. We release the processed UMLS Neo4j graph to support reproducibility.
- Abstract(参考訳): ドメイン固有知識の注入は、バイオメディシンのような専門分野に言語モデル(LM)を適用するために重要である。
現在のほとんどのアプローチは構造化されていないテキストコーパスに依存しているが、UMLSメタテーラスからの構造化知識を活用するための2つの補完的な戦略を探求する。
一 モデルパラメータに知識を組み込んだ連続事前学習
(ii)知識グラフを推論時に参照するGraphRAG(Graph Retrieval-Augmented Generation)。
我々はまず,Neo4jに格納されたUMLS(340万概念と342万関係)から大規模バイオメディカル知識グラフを構築し,効率的なクエリを行う。
次に、このグラフから約100万のテキストコーパスを導き、BERTUMLS(BERT)とBioBERTUMLS(BioBERT)の2つのモデルを継続的に事前学習する。
5種類のタスクタイプにまたがる6つのBLURB(Biomedical Language Understanding and Reasoning Benchmark)データセット上でこれらのモデルを評価し、2つのQAデータセット(PubMedQA, BioASQ)上でGraphRAGを評価する。
BLURBタスクでは、BERTUMLSはBERTよりも改善され、知識集約型QAで最大の利益を得ている。
BioBERTの効果はよりニュアンスが高く、ベースモデルがすでにかなりのバイオメディカルテキスト知識を符号化している場合のリターンの低下を示唆している。
最後に、GraphRAGパイプラインでLLaMA 3-8Bを拡張することで、PubMedQAでは3ポイント以上、BioASQでは5ポイント以上、透過的でマルチホップで容易に更新可能な知識アクセスを提供する。
再現性をサポートするために、処理されたUMLS Neo4jグラフをリリースします。
関連論文リスト
- BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment [12.413588969346627]
BALI(Biomedical Knowledge Graph and Language Model Alignment)は、新しい共同学習手法である。
これは、専用のKGエンコーダの同時学習と、LMとグラフの両方の表現の整合によって、外部知識でLMを増強する。
実験の結果,PubMedBERT や BioLinkBERT などの先進的なバイオメディカル LM に本手法を適用することにより,言語理解タスクにおける性能が向上することが示唆された。
論文 参考訳(メタデータ) (2025-09-09T10:59:47Z) - Diversifying Knowledge Enhancement of Biomedical Language Models using
Adapter Modules and Knowledge Graphs [54.223394825528665]
我々は、軽量なアダプターモジュールを用いて、構造化された生体医学的知識を事前訓練された言語モデルに注入するアプローチを開発した。
バイオメディカル知識システムUMLSと新しいバイオケミカルOntoChemの2つの大きなKGと、PubMedBERTとBioLinkBERTの2つの著名なバイオメディカルPLMを使用している。
計算能力の要件を低く保ちながら,本手法がいくつかの事例において性能改善につながることを示す。
論文 参考訳(メタデータ) (2023-12-21T14:26:57Z) - Biomedical knowledge graph-optimized prompt generation for large language models [1.6658478064349376]
大規模言語モデル(LLM)は前例のない速度で採用されているが、バイオメディシンのような知識集約ドメインでは依然として課題に直面している。
本稿では,トークン最適化およびロバストな知識グラフに基づくRetrieval Augmented Generationフレームワークを紹介する。
論文 参考訳(メタデータ) (2023-11-29T03:07:00Z) - Deep Bidirectional Language-Knowledge Graph Pretraining [159.9645181522436]
DRAGONは、テキストとKGを大規模に融合した言語知識基盤モデルを事前学習するための自己教師型アプローチである。
我々のモデルは、入力としてテキストセグメントと関連するKGサブグラフのペアを取り、両モードから情報を双方向に融合する。
論文 参考訳(メタデータ) (2022-10-17T18:02:52Z) - Mixture-of-Partitions: Infusing Large Biomedical Knowledge Graphs into
BERT [17.739843061394367]
Mixture-of-Partitions (MoP)は、非常に大きな知識グラフ(KG)を小さなサブグラフに分割し、その特定の知識を軽量アダプタを使用して様々なBERTモデルに注入することで処理することができる。
SciBERT, BioBERT, PubmedBERTの3つのバイオメディカルBERTを下流6つのタスク(NLI, QA, 分類)で評価した。
論文 参考訳(メタデータ) (2021-09-10T11:54:25Z) - Scientific Language Models for Biomedical Knowledge Base Completion: An
Empirical Study [62.376800537374024]
我々は,KG の完成に向けた科学的 LM の研究を行い,生物医学的リンク予測を強化するために,その潜在知識を活用できるかどうかを探る。
LMモデルとKG埋め込みモデルを統合し,各入力例をいずれかのモデルに割り当てることを学ぶルータ法を用いて,性能を大幅に向上させる。
論文 参考訳(メタデータ) (2021-06-17T17:55:33Z) - Investigating Pretrained Language Models for Graph-to-Text Generation [55.55151069694146]
Graph-to-text生成は、グラフベースのデータから流動的なテキストを生成することを目的としている。
本稿では,3つのグラフ領域,つまり表現,ウィキペディア知識グラフ(KG),科学的なKGについて検討する。
我々は, PLM の BART と T5 が新たな最先端の成果を達成し, タスク適応型事前学習戦略が性能をさらに向上することを示す。
論文 参考訳(メタデータ) (2020-07-16T16:05:34Z) - Students Need More Attention: BERT-based AttentionModel for Small Data
with Application to AutomaticPatient Message Triage [65.7062363323781]
BioBERT (Bidirectional Representations from Transformers for Biomedical Text Mining) に基づく新しいフレームワークを提案する。
LESA-BERTと呼ぶBERTの各層にラベル埋め込みを導入し、(ii)LESA-BERTを小さな変種に蒸留することにより、小さなデータセットで作業する際のオーバーフィッティングとモデルサイズを低減することを目指す。
アプリケーションとして,本フレームワークを用いて,患者ポータルメッセージトリアージのモデルを構築し,メッセージの緊急度を非緊急度,中度度,緊急度という3つのカテゴリに分類する。
論文 参考訳(メタデータ) (2020-06-22T03:39:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。