論文の概要: Evaluating Biomedical Reranking for LLM-Based Question Answering over Longitudinal Clinical Notes
- arxiv url: http://arxiv.org/abs/2610.01324v1
- Date: Thu, 01 Oct 2026 08:49:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.0175
- Title: Evaluating Biomedical Reranking for LLM-Based Question Answering over Longitudinal Clinical Notes
- Title(参考訳): 経時的臨床ノートによるLCMに基づく質問紙調査におけるバイオメディカルリクリートの評価
- Abstract要約: 再任は、限られたコンテキストウィンドウ内の関連する臨床証拠の配置を改善することができる。
これらの結果から, バイオメディカル・リランクは, 限られたコンテキストウインドウ内において, 関連する臨床証拠の配置を改善することが示唆された。
- 参考スコア(独自算出の注目度): 3.4686589889029147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Patient-specific clinical question answering requires locating the right evidence within long, heterogeneous longitudinal clinical records in which relevant facts may be scattered across encounters, repeated in copied-forward notes, or expressed using different clinical terminology. We evaluated whether biomedical reranking can improve evidence selection and downstream answer quality in a locally deployed retrieval-augmented generation pipeline for longitudinal clinical notes. The pipeline combines PubMedBERT dense retrieval, BM25 lexical retrieval, weighted reciprocal-rank fusion, and MedCPT cross-encoder reranking. Across 1,000 open- and closed-ended question-answer pairs from a cohort of 200 bariatric surgery patients, reranking increased exact source-chunk retrieval within the top 10 items, Hit@10 from 46.6% to 60.6% and mean reciprocal rank from 0.2371 to 0.3252. With Qwen3-8B generation, local judge-assessed answer correctness increased from 44.8% to 48.6%. These results show that biomedical reranking can improve the placement of relevant clinical evidence within a limited context window, although gains in retrieval do not translate proportionally into gains in answer correctness.
- Abstract(参考訳): 患者固有の臨床質問応答は、関連する事実が遭遇中に散らばり、コピーフォワードノートで繰り返されたり、異なる臨床用語を用いて表現される、長い、異種な経時的臨床記録の中で正しい証拠を見つける必要がある。
本研究では, バイオメディカルリランクが, 局所的に展開した検索拡張生成パイプラインにおけるエビデンス選択とダウンストリーム応答品質を向上させることができるかを検討した。
このパイプラインは、PubMedBERT高密度検索、BM25語彙検索、重み付けされた逆数核融合、MedCPTクロスエンコーダを組み合わせている。
患者200人のコホートから1000対のオープン・アンド・クローズドな質問応答対が抽出され、上位10項目の正確なソース・チャンク検索が増加し、hit@10が46.6%から60.6%に、平均逆位が0.2371から0.3252に上昇した。
Qwen3-8B世代では、局所的な判断による回答の正しさは44.8%から48.6%に増加した。
これらの結果から, バイオメディカルリランクは, 検索の利得が回答の正しさの利得に比例するものではないものの, 限られたコンテキストウインドウ内での関連臨床証拠の配置を改善することが示唆された。
関連論文リスト
- MedSNIP: Building and Benchmarking Snippet-Level Granularity for Medical Fact Verification [50.13873960887466]
我々はスニペットレベルの医療事実検証のベンチマークであるMedSNIP-Benchを紹介する。
また,自動スニペット生成パイプラインであるMedSNIPを導入する。
MedSNIP-Bench、HealthFC、MedHallu全体で、スニペットレベルの検証は偽クラスF1を保存または改善する。
論文 参考訳(メタデータ) (2026-09-11T14:08:44Z) - Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting [59.709162055944915]
ThyroidXAgentは、特殊な診断ツールをコーディネートし、その出力を監査可能なケースレベルの証拠記録として保存するエージェントAIシステムである。
NHC-MISD-TUSコホート内35施設8,721件を含む,重複しない28,458件の検査を行った。
セグメンテーションでは平均Diceスコアが87.21パーセント、良悪性分類では平均AUROCが0.9466だった。
論文 参考訳(メタデータ) (2026-08-12T21:02:59Z) - Grounded in Consensus, In Step With Emerging Science: A Consensus-Anchored Multi-Corpus Clinical Chatbot for Long COVID [1.8229646064376668]
関連する証拠は、異なる更新サイクル、明らかな役割、臨床成熟度を持つソースに分散しているため、Long COVID (LC) は臨床上の意思決定支援に挑戦する。
本稿では,検索ワークフロー内で4つのソースを編成する臨床用ロボットを提案する。
論文 参考訳(メタデータ) (2026-07-27T19:57:23Z) - Privacy-Preserving Local Language Models for Longitudinal Data Retrieval in Chronic Dermatologic Disease: Implementation in Pemphigus Patients [0.28909295536379814]
ペムフィガスのような慢性皮膚疾患は長期の経過観察を必要とする。
プライバシ保存型小言語モデル(SLM)は、構造化された臨床特徴を検索し、長手要約を生成する。
論文 参考訳(メタデータ) (2026-05-24T12:00:13Z) - Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture [71.46525715889656]
汎用エージェントメモリシステムは、ユーザの最新のステートメントで古い事実を上書きすることでコヒーレンスを最適化する。
本稿では,患者の物語を構造化された臨床記録から厳密に分離するDual-Stream Memory Architectureを提案する。
675日間のウェルネスコーチングセッションにおいて,26名の患者を対象にこのアーキテクチャを評価した。
論文 参考訳(メタデータ) (2026-04-29T17:59:28Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models [0.0]
ローカルにデプロイ可能なフレームワークは、外部データ転送なしでEHRから直接臨床質問に答える。
オープンソースの大規模言語モデル(LLM)は、4Bから70Bまでのパラメータを完全にオフラインでベンチマークした。
論文 参考訳(メタデータ) (2026-03-27T14:03:51Z) - Self-MedRAG: a Self-Reflective Hybrid Retrieval-Augmented Generation Framework for Reliable Medical Question Answering [39.146761527401424]
Self-MedRAGは、臨床推論の反復的仮説検証プロセスを模倣するために設計された自己反射型ハイブリッドフレームワークである。
Sparse(BM25)とReciprocal Rank Fusion(Reciprocal Rank Fusion)による高密度(Contriever)レトリバーを組み合わせたハイブリッド検索戦略を統合している。
ジェネレータを使用して、支持する合理性で回答を生成し、軽量な自己回帰モジュールで評価する。
論文 参考訳(メタデータ) (2026-01-08T02:56:04Z) - Evaluating Large Language Models for Evidence-Based Clinical Question Answering [4.101088122511548]
大規模言語モデル (LLMs) は, 医学的, 臨床的応用において著しく進歩している。
Cochraneの体系的レビューと臨床ガイドラインから得られたベンチマークをキュレートする。
我々はソースと臨床領域間で一貫したパフォーマンスパターンを観察する。
論文 参考訳(メタデータ) (2025-09-13T15:03:34Z) - Exploiting segmentation labels and representation learning to forecast
therapy response of PDAC patients [60.78505216352878]
化学療法に対する腫瘍反応を予測するためのハイブリッドディープニューラルネットワークパイプラインを提案する。
セグメンテーションから分類への表現伝達の組み合わせと、ローカライゼーションと表現学習を利用する。
提案手法は, 合計477個のデータセットを用いて, ROC-AUC 63.7% の処理応答を予測できる, 極めて効率的な手法である。
論文 参考訳(メタデータ) (2022-11-08T11:50:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。