論文の概要: Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2607.09349v1
- Date: Fri, 10 Jul 2026 12:29:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.839381
- Title: Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation
- Title(参考訳): 認知的接地:臨床検索・拡張世代におけるエンティティ帰属障害
- Abstract要約: Retrieval-augmented generation evaluationは、検索された文書にモデルクレームが実際に根拠付けられているかどうかをチェックする。
臨床RAG応答は、クリードドドラッグXの証拠としてYの臨床証拠を提示しながら、すべての自動チェックをパスすることができる。
抽出された文書からエンティティ固有の臨床証拠を除去することで、エンティティ属性の失敗を完全に排除する。
- 参考スコア(独自算出の注目度): 7.901904409617788
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Retrieval-augmented generation evaluation checks whether model claims are factually grounded in retrieved documents. It does not check whether retrieved evidence is attributed to the correct entity. A clinical RAG response can pass every automated check (zero hallucinations, near-perfect faithfulness, real citations) while presenting drug Y's clinical evidence as evidence about queried drug X. We term this deceptive grounding (DG): a failure invisible to faithfulness, hallucination, and citation checks because every claim is sourced from a real document, about the wrong entity. Using a controlled factorial benchmark across 13 models, we find DG rates spanning 8-87% at peak adversarial conditions. Medical and biomedical fine-tuned models reach up to 86.7%; domain specialization amplifies the failure rather than mitigating it. A controlled ablation identifies the mechanism: removing entity-specific clinical evidence from retrieved documents eliminates entity-attribution failure entirely, shifting all failures to confabulation. The two failure modes respond to the same trigger, taking different paths. Production measurement across 740 drug-disease pairs finds 7.8% overall DG in a deployed RAG system, rising to 13.6% for recently approved drugs. Entity-attribution verification (checking that cited evidence applies to the queried entity) detects DG at 97.0% precision and 98.7% DG recall (IPW-adjusted human gold standard); no existing framework implements it.
- Abstract(参考訳): Retrieval-augmented generation evaluationは、検索された文書にモデルクレームが実際に根拠付けられているかどうかをチェックする。
回収された証拠が正しい実体に帰属するか否かは確認されていない。
臨床RAG応答は, あらゆる自動チェック (ゼロ幻覚, ほぼ完全忠実, 実際の引用) をパスし, 薬剤Yの臨床的証拠をクエリドドラッグXの証拠として提示する。
13モデルにまたがる因子分析により, ピーク逆境条件下でのDG比は8~87%であった。
医学的および生物医学的な微調整されたモデルは86.7%に達するが、ドメインの特殊化はそれを緩和するよりも失敗を増幅する。
抽出された文書からエンティティ固有の臨床証拠を除去することで、エンティティ属性の失敗を完全に排除し、すべての失敗を報告に移す。
2つの障害モードは同じトリガーに反応し、異なるパスを取る。
740組のドラッグ・ディスリーズ・ペアの生産量は、配備されたRAGシステムで全体の7.8%を占め、最近承認された薬物の13.6%まで上昇した。
エンティティ属性検証(引用された証拠を引用する)は、97.0%の精度でDGを検出し、98.7%のDGリコール(IPW調整された人間の金標準)を行う。
関連論文リスト
- CiteGuard-RAG: A Validation-Centered AI System for Evidence-Grounded Question Answering [0.21748200848556343]
CiteGuard-RAGは、根拠に基づく質問応答のための検証中心のAIシステムである。
システムはセマンティックレキシカル検索、引用制約付き生成、文レベルの接地検証、シングルパス再生を統合している。
CiteGuard-RAGは、コントロールされた住宅法データセット全体で400の質問に対して評価される。
論文 参考訳(メタデータ) (2026-09-14T16:30:54Z) - IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications [52.570108663867046]
研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
論文 参考訳(メタデータ) (2026-09-09T17:59:04Z) - Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records [0.8594140167290097]
大規模言語モデルは医療文書を構造化されたデータに変換することができるが、信頼できる出力は情報源によってもサポートされない可能性がある。
本稿では,情報源文書に対して決定論的モニタが検証するまで,生成したデータを暫定的に保持するエビデンス付き信頼促進モデルを提案する。
個人健康記録アプリケーションであるMedical DataCloudにこのモデルを実装し、自動テストと保存出力の再生を通じて評価する。
論文 参考訳(メタデータ) (2026-08-30T18:51:43Z) - EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards [73.12811119273206]
我々は,包括的調査を通じて科学的エージェントを評価するベンチマークであるEarthVerseを紹介する。
エージェントは異種イベントパッケージを検査し、互換性のあるエビデンスを選択し、透過的な計算を実行し、ソース差を調整し、最終回答で証明を保存する。
システム全体では、平均回答ユニットの精度は84.65%であり、最も高いStrict@95は34.81%である。
論文 参考訳(メタデータ) (2026-08-24T17:29:16Z) - CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction [0.0]
我々は、実際のTCGA患者の腫瘍データに対するノックダウンの逆転のプロキシとして、焦点遺伝子コピーナンバーアンプリフィケーション(cuscus-gene copy-number amplification)を用いる。
MYCの場合、CASCADEの予測されたノックダウンターゲットは、実際のvs非増幅腫瘍の発現と強い一致を示した。
その精度は、MYCまたはE2F駆動生物学の既存の公的な知識を超えないことが示されている。
論文 参考訳(メタデータ) (2026-08-05T19:30:44Z) - From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - When Confidence Takes the Wrong Path: Diagnosing Retrieval-State Lock-In in RAG [0.0]
多くのブラックボックスの不確実性法は、まだサンプル回答間の合意を自信として読んでいる。
問題は、デプロイされたRAGで認識されるが、名前、測定可能なシグネチャ、および有病率境界が欠落している。
故障検索状態のロックインを命名し、3つのオブジェクトを1つの信頼スコアが混在して診断する。
論文 参考訳(メタデータ) (2026-06-22T00:08:00Z) - Configurable Clinical Information Extraction with Agentic RAG: What Works, What Breaks, and Why [4.527967729863067]
患者コンテキストは、何百もの異種文書と何千もの構造化されたデータポイントにまたがる。
標準的な検索拡張生成は、このデータ、時間的推論、文書間の依存関係、メタデータの欠如に失敗する。
本稿では,ACIE (Agentic Clinical Information extract) を医科大学 Essen に導入する。
メタデータのギャップを定量化し、それが形成したアーキテクチャ上の決定をトレースし、独立した振り返りリンパ腫登録研究と共に抽出を評価する。
論文 参考訳(メタデータ) (2026-06-17T21:12:35Z) - Claim-Selective Certification for High-Risk Medical Retrieval-Augmented Generation [0.0]
混在した証拠は、ある主張を支持し、別の主張の条件を必要とし、第三の主張に矛盾する可能性がある。
我々は、クレーム選択応答を検証可能なクレームに検証し、回収された証拠に対して評価し、インテントを意識したセレクタによって完全な、部分的、紛争、棄却にマッピングする。
結果として生じるインターフェースは、アクションラベル予測と、混在する証拠の下でのエビデンスリンクされたクレーム選択を分離する。
論文 参考訳(メタデータ) (2026-05-21T03:29:50Z) - VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems [79.51005192758262]
大規模言語モデル駆動型マルチエージェントシステムは複雑なタスクで優れている。
しかし、信頼性の低いエージェントは、システムレベルの信頼性にとって重要なボトルネックである。
本稿では,エージェント故障の帰属に関する仮説検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T14:09:35Z) - FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition [54.31138496553705]
日常生活におけるきめ細かい認識は、しばしばクローズドブックの分類問題ではない。
既存のベンチマークは主に視覚的認識を評価しており、このアクティブな外部知識獲得能力は過小評価されている。
そこでは,システムが外部の証拠を探し,検証し,利用し,オープンエンドのきめ細かい認識質問に答えなければならない,きめ細かな知識獲得について検討する。
論文 参考訳(メタデータ) (2026-05-13T08:49:51Z) - Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture [71.46525715889656]
汎用エージェントメモリシステムは、ユーザの最新のステートメントで古い事実を上書きすることでコヒーレンスを最適化する。
本稿では,患者の物語を構造化された臨床記録から厳密に分離するDual-Stream Memory Architectureを提案する。
675日間のウェルネスコーチングセッションにおいて,26名の患者を対象にこのアーキテクチャを評価した。
論文 参考訳(メタデータ) (2026-04-29T17:59:28Z) - A self-evolving agent for explainable diagnosis of DFT-experiment band-gap mismatch [3.3602370127893724]
本稿では,ミスマッチを自動的に診断するクローズドループエージェントであるXDFTを紹介する。
検証された124項目のベンチマークでは、XDFTは90件中70件のミスマッチの解決メカニズムを特定している。
論文 参考訳(メタデータ) (2026-04-29T14:11:03Z) - The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning [1.4676581933580473]
最前線の大規模言語モデルは臨床的に正確な出力を生成するが、それらの引用は製造されている。
HEG-TKGは,4つのPubMedレコードと高品質な階層化と1,280の病的軌跡を持つキュレートされたソースから構築された時間的知識グラフに臨床的主張を基礎づけるシステムである。
論文 参考訳(メタデータ) (2026-04-18T19:10:12Z) - Agentic Cognitive Profiling: Realigning Automated Alzheimer's Disease Detection with Clinical Construct Validity [66.94391219005291]
本稿では,臨床プロトコルロジックによる自動スクリーニングを実現するエージェント認知プロファイリング(ACP)を提案する。
我々の設計の中心は、すべての定量化を決定論的関数呼び出しに委譲することで、測定から意味的理解を分離することである。
ACPは、タスク試験で90.5%のスコアマッチ率、AD予測で85.3%の精度を達成し、一般的な基準を上回っている。
論文 参考訳(メタデータ) (2026-03-18T06:15:35Z) - Medical Hallucinations in Foundation Models and Their Impact on Healthcare [71.15392179084428]
基礎モデルの幻覚は自己回帰訓練の目的から生じる。
トップパフォーマンスモデルは、チェーン・オブ・シークレット・プロンプトで強化された場合、97%の精度を達成した。
論文 参考訳(メタデータ) (2025-02-26T02:30:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。