論文の概要: Human-in-the-Loop Large Language Model Framework for Identification of Cutaneous Immune-Related Adverse Events
- arxiv url: http://arxiv.org/abs/2607.20428v1
- Date: Sat, 09 May 2026 16:37:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.156072
- Title: Human-in-the-Loop Large Language Model Framework for Identification of Cutaneous Immune-Related Adverse Events
- Title(参考訳): 自己免疫関連副次事象の同定のためのループ型大規模言語モデルフレームワーク
- Authors: Charles Lu, Olivia Burke, Debby Cheng, Adam Kashlan, Caitlyn Duffy, Zeyun Lu, Lirit Fuksman, Jin Ning Tian, Andrew Sedlack, Priya Katyal, Eudora Lee, Ralina Karagenova, Chuck Lin, Kun-Hsing Yu, Nicole LeBoeuf, Alexander Gusev, Yevgeniy R. Semenov,
- Abstract要約: 本研究は,臨床ノートから皮膚免疫関連有害事象(cirAEs)を検出するための,LLM駆動型多エージェント大規模言語モデル(Human-in-the-loop framework)について検討した。
手動による手動レビューと比較して、LLM支援ワークフローは精度を向上し(F1 = 0.88 vs 0.77)、コーエンのカッパ(Kappa = 0.82 vs 0.50)で測定されたラッター間合意(Kappa = 0.82 vs 0.50)、平均レビュー時間を約半分短縮した。
- 参考スコア(独自算出の注目度): 28.98687051413094
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This study evaluated a retrieval-augmented, multi-agent large language model (LLM)-driven, human-in-the-loop framework for detecting cutaneous immune-related adverse events (cirAEs) from clinical notes. Compared with unassisted manual review, the LLM-assisted workflow improved accuracy (F1 = 0.88 vs 0.77), inter-rater agreement measured by Cohen's kappa (kappa = 0.82 vs 0.50), and reduced average review time by approximately half. This framework pilots how LLMs can be applied to identify immune-related toxicities across organ systems and, more broadly, enable accurate, scalable, and transparent adverse event data extraction.
- Abstract(参考訳): 本研究は,臨床ノートから皮膚免疫関連有害事象(cirAEs)を検出するための,LLM駆動型多エージェント大規模言語モデル(Human-in-the-loop framework)について検討した。
手動による手動レビューと比較して、LLM支援ワークフローは精度を向上し(F1 = 0.88 vs 0.77)、コーエンのカッパ(Kappa = 0.82 vs 0.50)で測定されたラッター間合意(Kappa = 0.82 vs 0.50)、平均レビュー時間を約半分短縮した。
このフレームワークは、LLMが臓器系全体にわたる免疫関連毒性を識別するためにどのように応用できるかをパイロットし、より広範に、正確でスケーラブルで透明なイベントデータ抽出を可能にする。
関連論文リスト
- Temporally Phenotyping GLP-1RA Case Reports with Large Language Models: A Textual Time Series Corpus and Risk Modeling [3.6611037112655818]
グルカゴン様ペプチド1受容体アゴニストを含む症例報告の時系列コーパスを開発した。
臨床領域の専門家によるゴールド・スタンダード・タイムラインに対するLPMタイムラインの自動抽出について検討した。
最高の性能のLCMは、高いイベントカバレッジ、症状、診断、治療、検査、結果の信頼できる時間的シークエンシングを実現した。
論文 参考訳(メタデータ) (2026-03-12T20:45:06Z) - PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation [51.96735866702332]
PreBAはPCA重み付き検索とベイズ平均アグリゲーションを統合した検索拡張フレームワークである。
例えば、PreBAはパフォーマンスを大幅に改善し、MAEを最大40%削減し、ゼロショット推論でR2を-0.13から0.62に引き上げる。
論文 参考訳(メタデータ) (2026-02-27T07:19:23Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing [0.4349324020366305]
大規模言語モデル(LLM)は、医療問題に対する回答を約束するが、臨床的使用は、弱い検証、不十分な証拠の根拠、信頼できない信頼のシグナルによって制限される。
本稿では,補完的なLCMとエビデンス検索,不確実性推定,バイアスチェックを組み合わせて回答信頼性を向上させるマルチエージェント医療QAフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-15T14:17:27Z) - Stroke Lesions as a Rosetta Stone for Language Model Interpretability [6.528508321422611]
本稿では、大規模な言語モデルを評価するための外部参照構造として、Brain-LLM Unified Model(BLUM)を提案する。
慢性期脳卒中後失語患者のデータを用いて,行動的エラープロファイルから脳損傷位置を予測する症状・症状・症状モデルを構築した。
BLUMのエラープロファイルは、偶然に一致したヒトの実際の病変に対応するような、人間のエラープロファイルと十分に類似していた。
論文 参考訳(メタデータ) (2026-02-03T23:22:37Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - LRMR: LLM-Driven Relational Multi-node Ranking for Lymph Node Metastasis Assessment in Rectal Cancer [12.795639054336226]
直腸癌リンパ節転移の術前評価は治療決定を導く。
一部の人工知能モデルはブラックボックスとして機能し、臨床信頼に必要な解釈性に欠ける。
LLM-Driven Multi-node Ranking frameworkであるLRMRを紹介する。
論文 参考訳(メタデータ) (2025-07-15T16:29:45Z) - Predicting Length of Stay in Neurological ICU Patients Using Classical Machine Learning and Neural Network Models: A Benchmark Study on MIMIC-IV [49.1574468325115]
本研究は、MIMIC-IVデータセットに基づく神経疾患患者を対象とした、ICUにおけるLOS予測のための複数のMLアプローチについて検討する。
評価されたモデルには、古典的MLアルゴリズム(K-Nearest Neighbors、Random Forest、XGBoost、CatBoost)とニューラルネットワーク(LSTM、BERT、テンポラルフュージョントランス)が含まれる。
論文 参考訳(メタデータ) (2025-05-23T14:06:42Z) - GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation [7.838068874909676]
Granular Explainable Multi-Agent Score (GEMA-Score)は、大規模言語モデルに基づくマルチエージェントワークフローを通じて、客観的および主観的評価を行う。
GEMA-Scoreは、公開データセット上での人間の専門家評価と最も高い相関を達成している。
論文 参考訳(メタデータ) (2025-03-07T11:42:22Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z) - Learning to diagnose cirrhosis from radiological and histological labels
with joint self and weakly-supervised pretraining strategies [62.840338941861134]
そこで本稿では, 放射線学者が注釈付けした大規模データセットからの転写学習を活用して, 小さい付加データセットで利用できる組織学的スコアを予測することを提案する。
我々は,肝硬変の予測を改善するために,異なる事前訓練法,すなわち弱い指導法と自己指導法を比較した。
この方法は、METAVIRスコアのベースライン分類を上回り、AUCが0.84、バランスの取れた精度が0.75に達する。
論文 参考訳(メタデータ) (2023-02-16T17:06:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。