論文の概要: Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering
- arxiv url: http://arxiv.org/abs/2609.15964v2
- Date: Thu, 17 Sep 2026 02:12:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.422166
- Title: Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering
- Title(参考訳): コンストラクタによる検証 : 臨床質問応答におけるめまい評価
- Abstract要約: 大規模言語モデル(LLMs)はQAに広く採用されている。
我々は、現在のモデルがこのタスクをエンド・ツー・エンドで実行する能力を評価する。
ほとんどのモデルでは、クレームの90%以上に動詞の引用をアタッチできるのです。
- 参考スコア(独自算出の注目度): 7.032489574139469
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have been widely adopted for clinical question answering (QA). Current systems can attach citations to their answers, but these often point to broad texts, leaving time-pressed clinicians unable to verify them efficiently. An alternative is to ensure that responses are verifiable by construction: providing fine-grained verbatim quotes from reference material that substantiate claims, so users can verify an answer without opening other documents. In this paper, we evaluate the ability of current models to perform this task end-to-end: from providing citations for every factual claim, to producing verbatim quotes, to ensuring that those quotes fully substantiate the claims. To do so, we build a standardized harness over four clinical practice guidelines and evaluate twelve LLMs on 222 synthetic clinical questions, measuring each of these stages separately. We find that most models can attach verbatim quotes to over 90% of their claims from prompting alone, apart from some lightweight models such as claude-haiku-4.5. Yet these quotes often fail to substantiate every detail of the claims they accompany. For instance, claude-opus-5 produces verbatim quotes for 98.0% of its claims, but fully substantiates only 37.1%. Our work provides insights into the current capability gap of LLMs in building verifiable clinical QA systems, along with artifacts for future research.
- Abstract(参考訳): 大規模言語モデル (LLM) は臨床質問応答 (QA) に広く採用されている。
現在のシステムでは、回答に引用を付けることができるが、これらはしばしば広義のテキストを指しており、タイムプレッシャーのある臨床医はそれらを効果的に検証できない。
別の方法は、要求を裏付ける基準資料から詳細な動詞の引用を提供することで、ユーザーは他の文書を開かずに回答を検証できる。
本稿では,現行のモデルがこのタスクを終末に実行する能力を評価する。すべての事実的クレームに対して引用を提供することから,冗長なクレームを生成すること,クレームが完全に裏付けられること,などである。
そこで我々は,4つの臨床実践ガイドラインを標準化し,12のLSMを222の総合臨床質問に対して評価し,それぞれの段階を別々に測定した。
クロードハイク4.5のような軽量モデルとは異なり,ほとんどのモデルでは,クレームの90%以上を単独で引用することができる。
しかし、これらの引用はしばしば、それらが付随する主張のあらゆる詳細を裏付けることに失敗する。
例えば、claude-opus-5は98.0%の格言で動詞の引用を生成するが、完全な置換は37.1%である。
本研究は,臨床QAシステムの構築におけるLCMの現在の能力ギャップと,今後の研究のためのアーティファクトに関する知見を提供する。
関連論文リスト
- ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers [0.0]
ResearchQAは、494のオープンアクセス論文から6,211のシングルペーパー質問応答ペアのベンチマークである。
ResearchQAは引用地上評価のために設計されている。
提案手法は,8つの先行したクローズドウェイトモデルとオープンウェイトモデルについて,引用グラウンド・チャット・ウィズ・ペーパー・セッティングで評価する。
論文 参考訳(メタデータ) (2026-07-13T04:26:51Z) - EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries [13.472329890204831]
EHRNote-ChatQAは,患者の複数の退院サマリーに答えるエビデンスグラウンドド・マルチターン臨床質問に対する最初のベンチマークである。
EHRNote-ChatQAは、特定されていないMIMIC-IV放電サマリーから作られ、患者レベル967個のマルチターンサンプルを1から5つのノートと16,072個の医療専門家が検証したQAペアを含む。
論文 参考訳(メタデータ) (2026-06-14T10:35:19Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - Evaluating Large Language Models for Evidence-Based Clinical Question Answering [4.101088122511548]
大規模言語モデル (LLMs) は, 医学的, 臨床的応用において著しく進歩している。
Cochraneの体系的レビューと臨床ガイドラインから得られたベンチマークをキュレートする。
我々はソースと臨床領域間で一貫したパフォーマンスパターンを観察する。
論文 参考訳(メタデータ) (2025-09-13T15:03:34Z) - Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs [15.61511109105186]
大型言語モデル (LLM) は医学的知識が豊富であるが、幻覚や不正確な引用の傾向にある。
Retrieval Augmented Generationのような現在の手法は、ソース文書の回答を根拠にすることで、これらの問題に部分的に対処する。
我々は,LLMの信頼性と説明可能性を高めるために,新しい原子ファクトチェックフレームワークを導入する。
論文 参考訳(メタデータ) (2025-05-30T17:33:07Z) - Structured Outputs Enable General-Purpose LLMs to be Medical Experts [50.02627258858336]
大規模言語モデル(LLM)は、しばしばオープンエンドの医学的問題に苦しむ。
本稿では,構造化医療推論を利用した新しいアプローチを提案する。
我々の手法は85.8のファクチュアリティスコアを達成し、微調整されたモデルを上回る。
論文 参考訳(メタデータ) (2025-03-05T05:24:55Z) - Usefulness of LLMs as an Author Checklist Assistant for Scientific Papers: NeurIPS'24 Experiment [59.09144776166979]
大規模言語モデル(LLM)は、科学的ピアレビューを支援する上で有望だが議論の余地のあるツールである。
本研究は,論文提出を提出基準に適合させるツールとして,会議環境におけるLCMの有用性を評価する。
論文 参考訳(メタデータ) (2024-11-05T18:58:00Z) - Answering real-world clinical questions using large language model based systems [2.2605659089865355]
大規模言語モデル(LLM)は、出版された文献を要約するか、実世界データ(RWD)に基づいた新しい研究を生成することによって、両方の課題に対処できる可能性がある。
臨床50問に回答する5つのLCMベースのシステムについて検討し,9名の医師に関連性,信頼性,行動性について検討した。
論文 参考訳(メタデータ) (2024-06-29T22:39:20Z) - Attribute Structuring Improves LLM-Based Evaluation of Clinical Text Summaries [56.31117605097345]
大規模言語モデル(LLM)は、正確な臨床テキスト要約を生成する可能性を示しているが、根拠付けと評価に関する問題に苦慮している。
本稿では、要約評価プロセスを構成するAttribute Structuring(AS)を用いた一般的な緩和フレームワークについて検討する。
ASは、臨床テキスト要約における人間のアノテーションと自動メトリクスの対応性を一貫して改善する。
論文 参考訳(メタデータ) (2024-03-01T21:59:03Z) - Self-Verification Improves Few-Shot Clinical Information Extraction [73.6905567014859]
大規模言語モデル (LLMs) は、数発のテキスト内学習を通じて臨床キュレーションを加速する可能性を示している。
正確性や解釈可能性に関する問題、特に健康のようなミッションクリティカルな領域ではまだ苦戦している。
本稿では,自己検証を用いた汎用的な緩和フレームワークについて検討する。このフレームワークはLLMを利用して,自己抽出のための証明を提供し,その出力をチェックする。
論文 参考訳(メタデータ) (2023-05-30T22:05:11Z) - Generating Literal and Implied Subquestions to Fact-check Complex Claims [64.81832149826035]
我々は、複雑なクレームを、そのクレームの正確性に影響を及ぼす「イエス・ノー・サブクエスト」の包括的集合に分解することに集中する。
我々は1000以上のクレームに対する分解のデータセットである ClaimDecomp を提示する。
これらのサブクエストは、関連する証拠を特定し、すべてのクレームを事実確認し、回答を通じて正確性を引き出すのに役立ちます。
論文 参考訳(メタデータ) (2022-05-14T00:40:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。