論文の概要: Ensembles of Large Language Models for Identifying EQ-5D Studies in PubMed Based on Their Abstracts
- arxiv url: http://arxiv.org/abs/2606.19345v1
- Date: Fri, 24 Apr 2026 21:42:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.917536
- Title: Ensembles of Large Language Models for Identifying EQ-5D Studies in PubMed Based on Their Abstracts
- Title(参考訳): PubMedにおけるEQ-5D研究の要約に基づく大規模言語モデルの集合
- Abstract要約: EQ-5Dデータのような健康関連QOLの結果を明確に報告する分類研究は、高いレベルの臨床解釈を必要とする。
本研究では,Google の Gemini と Gemma の大規模言語モデル (LLMs) を用いて,バイオメディカルデータベース PubMed における EQ-5D の自動検出について検討した。
- 参考スコア(独自算出の注目度): 0.30786914102688595
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The rapid increase in scientific publications leads to the fact that manual study screening in systematic literature reviews (SLRs) is increasingly resource consuming, inefficient, and inconsistent. Classifying studies that clearly report health-related quality-of-life results, such as EQ-5D data, requires a high level of clinical interpretation and poses challenges for human reviewers. This study investigates the use of Google's Gemini and Gemma large language models (LLMs) in automating EQ-5D detection in the PubMed biomedical database based only on published abstracts. A multi-phase framework is proposed that integrates few-shot prompting, weight ensembling aggregation, and a soft stacking meta-classifier. Nine LLMs are evaluated on a dataset of PubMed studies manually labeled by two experts regarding EQ-5D reporting. The weighted ensemble of gemini-2.5-pro, gemma-3-12b, and gemma-3-27b obtained a 0.74 weighted F1-score and 0.74 accuracy, exceeding individually attained results. The ensembling of top-performing models improved the balance between precision and recall compared to individual models, while the soft stacking approach provided greater reliability and interpretability. Feature analysis shows that the probability results from the models are important in guiding the final predictions. The findings suggest that an ensemble-based LLM setup is a reliable and scalable approach for automating screening in biomedical research.
- Abstract(参考訳): 学術出版物の急速な増加は、体系的文献レビュー(SLR)における手作業による研究のスクリーニングが、資源消費、非効率、一貫性を増しているという事実につながっている。
EQ-5Dデータのような健康関連の結果をはっきりと報告する分類研究は、高いレベルの臨床解釈を必要とし、ヒトレビュアーに課題を提起する。
本研究では,Google の Gemini と Gemma の大規模言語モデル (LLMs) を用いて,バイオメディカルデータベース PubMed における EQ-5D の自動検出を行う。
数発のプロンプト,重み付けアグリゲーション,ソフトな積み重ねメタクラシファイアを統合した多相フレームワークを提案する。
9つのLCMを、EQ-5Dレポートに関する2人の専門家によって手作業でラベル付けされたPubMed研究のデータセットで評価する。
gemini-2.5-pro、gemma-3-12b、gemma-3-27bの重み付けアンサンブルは0.74の重み付けF1スコアと0.74の精度を持ち、個々の結果を上回った。
トップパフォーマンスモデルのアンサンブルにより、個々のモデルと比較して精度とリコールのバランスが向上し、ソフトスタック方式により信頼性と解釈性が向上した。
特徴分析により,最終的な予測を導く上で,モデルから得られる確率は重要であることが示された。
その結果, アンサンブルをベースとしたLCMセットアップは, バイオメディカル研究におけるスクリーニングの自動化のための信頼性とスケーラブルなアプローチであることが示唆された。
関連論文リスト
- Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech [69.86604856129883]
外科的音声品質評価(DSQA)は臨床診断と包括的音声技術において重要である。
本研究では,未ラベルの変形音声と大規模典型的な音声データセットを併用した3段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-16T23:00:07Z) - When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation [18.338933046286257]
大きな言語モデル(LLM)は、医学的なクエリを含む様々な問題に対処するために、ますます採用されている。
LLMは医学的文脈では性能が悪く、ユーザにとって有害な誤認につながる可能性がある。
本稿では,実際の患者-医師間相互作用の転写を用いたトランスフォーマーベースデコーダモデルであるLlama 2 7Bの微調整に焦点を当てた。
論文 参考訳(メタデータ) (2026-02-27T21:09:43Z) - EQ-5D Classification Using Biomedical Entity-Enriched Pre-trained Language Models and Multiple Instance Learning [0.42970700836450487]
健康経済学において、体系的な文献レビューは、EQ-5Dを使用する出版物の正しい識別に依存している。
大量の科学文献の手作業によるスクリーニングは、時間を要する、エラーを起こし、一貫性がない。
本研究では,汎用言語モデル(BERT)とドメイン固有言語モデル(SciBERT, BioBERT)の微調整について検討する。
論文 参考訳(メタデータ) (2026-01-30T20:10:34Z) - Investigating the Impact of Histopathological Foundation Models on Regressive Prediction of Homologous Recombination Deficiency [52.50039435394964]
回帰に基づくタスクの基礎モデルを体系的に評価する。
我々は5つの最先端基礎モデルを用いて、スライド画像全体(WSI)からパッチレベルの特徴を抽出する。
乳房、子宮内膜、肺がんコホートにまたがるこれらの抽出された特徴に基づいて、連続したRDDスコアを予測するモデルが訓練されている。
論文 参考訳(メタデータ) (2026-01-29T14:06:50Z) - BioPulse-QA: A Dynamic Biomedical Question-Answering Benchmark for Evaluating Factuality, Robustness, and Bias in Large Language Models [7.8780007697387235]
本稿では,新たに公開されたバイオメディカル文書からの質問に答える上で,大規模言語モデル(LLM)を評価するベンチマークであるBioPulse-QAを紹介する。
GPT-o1, GPT-o1, Gemini-2.0-Flash, LLaMA-3.1 8B の4つの LLM の評価を行った。
論文 参考訳(メタデータ) (2026-01-19T00:38:33Z) - Benchmarking Open-Source Large Language Models on Healthcare Text Classification Tasks [2.7729041396205014]
本研究では,オープンソースの5つの大言語モデル(LLM)の分類性能を評価する。
全てのモデルとタスクの組み合わせに対して、95%の信頼区間を有する精度、リコール、F1スコアを報告する。
論文 参考訳(メタデータ) (2025-03-19T12:51:52Z) - Uncertainty-aware abstention in medical diagnosis based on medical texts [87.88110503208016]
本研究は,AI支援医療診断における信頼性の重要課題について論じる。
本研究は,診断に自信がなければ,診断システムによる意思決定の回避を可能にする選択予測手法に焦点をあてる。
我々は、選択予測タスクにおける信頼性を高めるための新しい最先端手法であるHUQ-2を紹介する。
論文 参考訳(メタデータ) (2025-02-25T10:15:21Z) - LlaMADRS: Prompting Large Language Models for Interview-Based Depression Assessment [75.44934940580112]
LlaMADRSは、オープンソースのLarge Language Models(LLM)を利用して、うつ病の重症度評価を自動化する新しいフレームワークである。
本研究は,クリニカルインタヴューの解釈・スコアリングにおけるモデル指導のために,慎重に設計された手がかりを用いたゼロショットプロンプト戦略を用いている。
実世界における236件のインタビューを対象とし,臨床評価と強い相関性を示した。
論文 参考訳(メタデータ) (2025-01-07T08:49:04Z) - Zero-shot Generative Large Language Models for Systematic Review
Screening Automation [55.403958106416574]
本研究では,ゼロショット大言語モデルを用いた自動スクリーニングの有効性について検討した。
本研究では, 8種類のLCMの有効性を評価し, 予め定義されたリコール閾値を用いた校正手法について検討する。
論文 参考訳(メタデータ) (2024-01-12T01:54:08Z) - Large Language Models in Medical Term Classification and Unexpected
Misalignment Between Response and Reasoning [28.355000184014084]
本研究は, 軽度認知障害 (MCI) 患者を退院サマリーから識別する, 最先端の大規模言語モデル (LLMs) の有効性を評価するものである。
データは、モデルの微調整と評価のために、トレーニング、検証、テストセットに7:2:1の比率で分割された。
FalconやLLaMA 2のようなオープンソースのモデルは高い精度を達成したが、説明的推論に欠けていた。
論文 参考訳(メタデータ) (2023-12-19T17:36:48Z) - A multi-stage machine learning model on diagnosis of esophageal
manometry [50.591267188664666]
このフレームワークには、飲み込みレベルにおけるディープラーニングモデルと、学習レベルにおける機能ベースの機械学習モデルが含まれている。
これは、生のマルチスワローデータからHRM研究のCC診断を自動的に予測する最初の人工知能モデルである。
論文 参考訳(メタデータ) (2021-06-25T20:09:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。