論文の概要: Answering clinicians' questions over trial evidence tables with verifiable, feedback-driven language models
- arxiv url: http://arxiv.org/abs/2610.02576v1
- Date: Thu, 01 Oct 2026 23:12:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.121596
- Title: Answering clinicians' questions over trial evidence tables with verifiable, feedback-driven language models
- Title(参考訳): 検証可能なフィードバック駆動言語モデルを用いた試験的エビデンス表に対する臨床医の質問への回答
- Abstract要約: 両問に答える言語モデルフレームワークであるFD-SCoPEを紹介する。
免疫チェックポイント阻害剤の臨床試験記録159件のオンコロジーエビデンス表では、FD-SCoPEは140の臨床医スタイルのタスクを完了した。
- 参考スコア(独自算出の注目度): 6.4825749257052045
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Systematic reviews condense clinical trials into evidence tables, yet clinicians can interrogate these tables only through database queries, and many questions concern attributes that the table does not record, such as a drug's target class or a harmonised endpoint. Here we introduce FD-SCoPE, a language-model framework that answers both kinds of question, exposes the query, the selected trials and the derivation rule behind every answer, and learns from expert corrections. On an oncology evidence table of 159 immune checkpoint inhibitor trial records, FD-SCoPE completed all 140 clinician-style tasks (alternatives, 90.7-97.9%). For questions needing derived attributes it retrieved 99.3% of relevant trial records at a positive predictive value of 89.8% and outperformed four alternative approaches (derived-value F1 77.7% versus 64.8-73.4%). Corrections on 299 questions, simulated from reference answers, raised F1 on 1,201 unseen questions from 77.9% to 84.9%. Language models coupled with executable queries, verified programs and expert feedback can give clinicians auditable access to trial evidence.
- Abstract(参考訳): 体系的なレビューは、臨床試験をエビデンステーブルにまとめるが、臨床医はデータベースクエリを通してのみ、これらのテーブルを尋問することができる。
本稿では,FD-SCoPEについて紹介する。FD-SCoPEは,問合せ,選択された試行,およびすべての回答の背後にある導出規則を公開し,専門家の補正から学習する言語モデルフレームワークである。
免疫チェックポイント阻害薬の臨床試験記録159件のオンコロジーエビデンス表では、FD-SCoPEは140のクリニカルなタスク(代替薬、90.7-97.9%)を完了した。
派生属性を必要とする質問に対して、99.3%の関連試験記録を89.8%の正の予測値で回収し、4つの代替手法(F1 77.7%対64.8-73.4%)を上回った。
基準回答からシミュレーションした299の質問の訂正は、77.9%から84.9%まで、見当たらない質問1,201件に対してF1を上昇させた。
言語モデルと実行可能なクエリ、検証済みプログラム、専門家のフィードバックが組み合わさって、臨床医は試験的な証拠に監査可能なアクセスを与えることができる。
関連論文リスト
- Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models [0.0]
ローカルにデプロイ可能なフレームワークは、外部データ転送なしでEHRから直接臨床質問に答える。
オープンソースの大規模言語モデル(LLM)は、4Bから70Bまでのパラメータを完全にオフラインでベンチマークした。
論文 参考訳(メタデータ) (2026-03-27T14:03:51Z) - A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations [60.2076951536797]
大規模言語モデル(LLM)は、医療シナリオにますます多くデプロイされている。
LLMが会話中に臨床ガイドラインを特定・遵守できるのかは不明確である。
CPGBenchは、LSMの臨床ガイドラインの検出と付着能力をベンチマークする自動フレームワークである。
論文 参考訳(メタデータ) (2026-03-26T09:00:55Z) - Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL [63.578576078216976]
CLINはMIMICIV v3.1の633のエキスパートアノテートタスクのベンチマークである。
我々はChain-of-Thoughtセルフリファインメントの下で22のプロプライエタリモデルとオープンソースモデルを評価した。
最近の進歩にもかかわらず、パフォーマンスは臨床的な信頼性には程遠い。
論文 参考訳(メタデータ) (2026-01-14T21:12:06Z) - End-To-End Clinical Trial Matching with Large Language Models [0.6151041580858937]
大言語モデル(LLM)を用いた臨床試験のためのエンドツーエンドパイプラインを提案する。
本研究は,93.3%の症例において関連する候補試験を同定し,88.0%の予備的精度を達成している。
私たちの完全なエンドツーエンドパイプラインは、自律的または人間の監督の下で運用することができ、オンコロジーに限定されません。
論文 参考訳(メタデータ) (2024-07-18T12:36:26Z) - Panacea: A foundation model for clinical trial search, summarization, design, and recruitment [29.099676641424384]
パナセアという臨床試験基盤モデルを提案する。
Panaceaは、トライアル検索、トライアル要約、トライアルデザイン、患者と臨床のマッチングなど、複数のタスクを扱うように設計されている。
793,279のトライアル文書と1,113,207のトライアル関連科学論文からなる、TrialAlignという大規模なデータセットも収集しました。
論文 参考訳(メタデータ) (2024-06-25T21:29:25Z) - AutoTrial: Prompting Language Models for Clinical Trial Design [53.630479619856516]
本稿では,言語モデルを用いた臨床検査基準の設計を支援するAutoTrialという手法を提案する。
70K以上の臨床試験で、AutoTrialが高品質な基準テキストを生成することが確認された。
論文 参考訳(メタデータ) (2023-05-19T01:04:16Z) - Improving Patient Pre-screening for Clinical Trials: Assisting
Physicians with Large Language Models [0.0]
LLM(Large Language Models)は臨床情報抽出や臨床推論に有効であることが示されている。
本稿では,患者の総合的医療プロファイルに基づく臨床治験の適性判定に医師を支援するために,インストラクションGPTを用いることを検討した。
論文 参考訳(メタデータ) (2023-04-14T21:19:46Z) - Clinical trial site matching with improved diversity using fair policy
learning [56.01170456417214]
我々は,臨床治験記述を潜在的な試験現場のランクリストにマッピングするモデルを学習する。
既存のフェアネスフレームワークとは異なり、各トライアルサイトのグループメンバーシップは非バイナリである。
このようなマルチグループメンバーシップシナリオに対処するために、人口統計学的妥当性に基づく公平性基準を提案する。
論文 参考訳(メタデータ) (2022-04-13T16:35:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。