論文の概要: When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification
- arxiv url: http://arxiv.org/abs/2608.01409v1
- Date: Sun, 02 Aug 2026 17:43:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.196008
- Title: When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification
- Title(参考訳): 検索が役に立った場合: バイオメディカルクレーム検証のための証拠生成LDMの評価
- Authors: Pritam Deka, Prabhjot Singh,
- Abstract要約: バイオメディカルおよびヘルスファクトチェックを行う5つの情報源にまたがる統合ベンチマークであるCARE-XAIについて,このエビデンス生成環境について検討した。
Bio-GRACEは、検索ユーティリティがソースに依存し、選択的検索を動機付け、なぜ検索リコールと語彙的証拠の重複がバイオメディカルな事実チェックに不十分であるかを明らかにする。
- 参考スコア(独自算出の注目度): 0.17188280334580197
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Biomedical fact-checking systems must do more than predict whether a claim is supported, contradicted, or unaddressed: they should also produce evidence that is faithful, complete, and useful for verification. We study this evidence-generation setting on CARE-XAI, a unified benchmark spanning five biomedical and health fact-checking sources. We compare base instruction LLMs, PubMed retrieval-augmented LLMs, fine-tuned LLMs, label-only LLMs, and biomedical encoder classifiers under a shared evaluation protocol. Biomedical classifiers remain strongest for verdict-only prediction, while fine-tuned LLMs are the strongest evidence-generating systems. PubMed retrieval is mixed: it helps PubMed-aligned sources such as PubMedQA and SciFact, but can distract models on broader public-health claims. We introduce Bio-GRACE, a gold-reference-normalized diagnostic for measuring whether retrieved evidence recovers the decision benefit of reference evidence. Bio-GRACE shows that retrieval utility is source-dependent, motivates selective retrieval, and exposes why retrieval recall and lexical evidence overlap are insufficient for biomedical fact-checking.
- Abstract(参考訳): バイオメディカルなファクトチェックシステムは、クレームが支持されているか、矛盾しているか、または未承認であるかを予測する以上のことをしなければならない。
バイオメディカルおよびヘルスファクトチェックを行う5つの情報源にまたがる統合ベンチマークであるCARE-XAIについて,このエビデンス生成環境について検討した。
評価プロトコルを用いて,基本命令LLM,PubMed検索拡張LDM,微調整LDM,ラベル専用LDM,バイオメディカルエンコーダ分類器を比較した。
バイオメディカル分類器は検証のみの予測で最強であり、微調整LDMは最強のエビデンス生成システムである。
PubMed検索はPubMedQAやSciFactなどのPubMed対応ソースを支援するが、より広範な公衆衛生クレームのモデルを邪魔する可能性がある。
検索された証拠が基準証拠の決定利益を回復するかどうかを測定するための,ゴールド参照正規化診断法であるBio-GRACEを紹介する。
Bio-GRACEは、検索ユーティリティがソースに依存し、選択的検索を動機付け、なぜ検索リコールと語彙的証拠の重複がバイオメディカルな事実チェックに不十分であるかを明らかにする。
関連論文リスト
- PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering [12.717987334814692]
バイオメディカルQA剤PubMed Reasonerについて紹介する。
自己批判的なクエリ改善は、PubMedクエリを強化するために、カバレッジ、アライメント、冗長性に関するMeSH用語を評価する。
十分な証拠が収集されるまで 記事はバッチで処理される
Evidence-grounded response generation(英語版)は明示的な引用を伴う回答を生成する。
論文 参考訳(メタデータ) (2026-03-28T16:41:57Z) - MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation [8.37586466142299]
バイオメディカルRAGのためのクレームレベル検証および診断フレームワークであるMedRAGCheckerを紹介する。
MedRAGCheckerは、質問、証拠の回収、そして生成された回答を与えられた上で、答えを原子的クレームに分解し、クレームのサポートを見積もる。
我々は、MedRAGCheckerが確実にフラグを解除し、主張を否定し、ジェネレータ間で異なるリスクプロファイルを明らかにしていることを示す。
論文 参考訳(メタデータ) (2026-01-10T10:40:42Z) - MedTrust-RAG: Evidence Verification and Trust Alignment for Biomedical Question Answering [21.855579328680246]
MedTrust-Guided Iterative RAGは,医療用QAにおける事実整合性と幻覚を高めるためのフレームワークである。
第一に、検索された医療文書に、すべての生成されたコンテンツを明示的に根拠付けることを要求することにより、引用認識推論を強制する。
第2に、検証エージェントが証拠の妥当性を評価する反復的な検索検証プロセスを採用する。
論文 参考訳(メタデータ) (2025-10-16T07:59:11Z) - Combating Biomedical Misinformation through Multi-modal Claim Detection and Evidence-based Verification [11.555285143713315]
CER(Combining Evidence and Reasoning)は、バイオメディカルな事実チェックのための新しいフレームワークである。
科学的エビデンス検索、大規模言語モデルによる推論、および教師付き正確性予測を統合している。
幻覚のリスクを効果的に軽減し、生成したアウトプットが検証可能なエビデンスベースの情報源で根拠付けられていることを保証する。
論文 参考訳(メタデータ) (2025-09-17T10:31:09Z) - Enhancing LLM Generation with Knowledge Hypergraph for Evidence-Based Medicine [22.983780823136925]
エビデンスベースの医療(EBM)は、医療における大規模言語モデル(LLM)の適用において重要な役割を担っている。
本稿では,複数の情報源から散在する証拠をLCMを用いて収集し,知識ハイパーグラフに基づく証拠管理モデルを提案する。
本手法は,医療クイズ,幻覚検出,意思決定支援など,EMMに関心のあるアプリケーション領域において,既存のRAG技術よりも優れている。
論文 参考訳(メタデータ) (2025-03-18T09:17:31Z) - Fact or Guesswork? Evaluating Large Language Models' Medical Knowledge with Structured One-Hop Judgments [108.55277188617035]
大規模言語モデル(LLM)は、様々な下流タスクドメインで広く採用されているが、実際の医学的知識を直接呼び起こし、適用する能力は、まだ探索されていない。
標準化された語彙と知識グラフの包括的なリポジトリであるUMLS(Unified Medical Language System)から派生したデータセットであるMKJ(Messical Knowledge Judgment dataset)を紹介する。
バイナリ分類フレームワークを通じて、MKJは、簡潔なワンホップ文の妥当性を評価することによって、LCMが基本的な医学的事実を把握できることを評価する。
論文 参考訳(メタデータ) (2025-02-20T05:27:51Z) - Reasoning-Enhanced Healthcare Predictions with Knowledge Graph Community Retrieval [61.70489848327436]
KAREは、知識グラフ(KG)コミュニティレベルの検索と大規模言語モデル(LLM)推論を統合する新しいフレームワークである。
MIMIC-IIIでは最大10.8~15.0%、MIMIC-IVでは12.6~12.7%である。
論文 参考訳(メタデータ) (2024-10-06T18:46:28Z) - SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation [50.26966969163348]
大規模言語モデル(LLM)は,検索増強世代(RAG)の進展に伴い,生物医学領域において大きな可能性を示した。
既存の検索強化アプローチは、様々なクエリやドキュメント、特に医療知識クエリに対処する上で、課題に直面している。
モンテカルロ木探索(MCTS)と自己回帰パラダイムに基づく自己回帰木探索(SeRTS)を提案する。
論文 参考訳(メタデータ) (2024-06-17T06:48:31Z) - Don't Ignore Dual Logic Ability of LLMs while Privatizing: A
Data-Intensive Analysis in Medical Domain [19.46334739319516]
本研究では, LLMの二重論理能力が, 医療領域の民営化過程における影響について検討した。
以上の結果から,LLMに汎用ドメイン二重論理データを組み込むことによって,LLMの二重論理能力が向上するだけでなく,精度も向上することが示唆された。
論文 参考訳(メタデータ) (2023-09-08T08:20:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。