論文の概要: Framework for Grounding Healthcare LLMs in a Causal Knowledge Graph: A Cardiovascular Example Pilot
- arxiv url: http://arxiv.org/abs/2608.15382v2
- Date: Sat, 22 Aug 2026 18:43:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.866385
- Title: Framework for Grounding Healthcare LLMs in a Causal Knowledge Graph: A Cardiovascular Example Pilot
- Title(参考訳): 因果知識グラフを用いた医療用LDMの接地フレームワーク:心臓血管例パイロット
- Abstract要約: 大規模言語モデル(LLM)は、医療上の意思決定支援のためにますます提案されている。
LLMは介入、メカニズム、害、証拠、不確実性を推論するよりも、シングルアンサーの精度に報いる。
本稿では,医療における介入指向LDM行動のためのグラフ中心評価フレームワークを提案し,心臓血管パイロットでストレステストを行う。
- 参考スコア(独自算出の注目度): 0.9685837672183747
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly proposed for healthcare decision support, but their evaluations still reward single-answer accuracy rather than reasoning about interventions, mechanisms, harms, evidence, and uncertainty. We propose a reproducible, graph-centered evaluation framework for intervention-oriented LLM behavior in healthcare and stress-test it in a cardiovascular pilot. The framework has four components: (i) a domain causal knowledge graph in which assertions are first-class, provenance-preserving nodes with stable identifiers; (ii) a scenario-conditioned subgraph extraction step that, given any clinical scenario, retrieves the relevant reified-assertion subgraph; (iii) four controlled grounding conditions that vary how the retrieved subgraph is composed into the model's context (ungrounded C1, knowledge-graph C2, causal-graph C3, integrated C4); and (iv) an automated scoring pipeline, anchored on assertion identifiers, that computes intervention accuracy, and other evaluation measures on a single pass. To test the framework, we built a category-balanced scenario generator across eight reasoning failure modes and instantiated it on a cardiovascular graph. The metric panel discriminates conditions along interpretable, non-redundant axes: C4 obtains the strongest causal edge F1 (0.838), adverse-effect F1 (0.833), evidence accuracy (0.738), and unsupported claim rate (0.114), while C1 obtains the highest raw intervention accuracy (0.948) with no measurable causal or evidential grounding.
- Abstract(参考訳): 大きな言語モデル(LLM)は、医療の意思決定支援のためにますます提案されているが、その評価は介入、メカニズム、害、証拠、不確実性を推論するよりも、シングル・アンサーの正確性に報いる。
医療における介入指向LLM行動の再現可能なグラフ中心評価フレームワークの提案と,循環器パイロットによるストレステストについて述べる。
フレームワークには4つのコンポーネントがある。
i) アサーションが第1級,証明保存ノードで安定した識別子を有するドメイン因果知識グラフ
二 臨床上のシナリオがあつたときは、当該再確認準用する部分グラフを回収するシナリオ条件付き部分グラフ抽出ステップ
三 検索した部分グラフがモデルの文脈にどのように構成されるか(未踏C1、知識グラフC2、因果グラフC3、統合C4)の四つの制御された接地条件
(iv)アサーション識別子に固定された自動スコアリングパイプラインで、介入精度を計算し、1回のパスで他の評価基準を演算する。
このフレームワークをテストするために、8つの推論失敗モードにまたがるカテゴリバランスシナリオジェネレータを構築し、それを心臓血管グラフ上でインスタンス化した。
計量パネルは、解釈可能な非冗長軸に沿った条件を判別する:C4は、最強因果エッジF1(0.838)、悪影響F1(0.833)、エビデンス精度0.738)、保留クレームレート0.114)、C1は測定可能な因果的または明確な接地のない最高の生介入精度0.948(0.948)を得る。
関連論文リスト
- CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation [0.0]
既存のAIシステムは一貫性を向上させることができるが、監査可能な意思決定プロセスが欠如している。
我々はCAGパイプラインの推論コアとして機能する統合された大きな視覚言語モデルであるCARDEAを開発した。
CARDEAは、選択から研究レベルの診断を通じて、生のマルチビュービデオからエンドツーエンドのCAGパイプラインを実行する。
論文 参考訳(メタデータ) (2026-09-07T02:01:27Z) - IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care [0.0]
IyawoBench v2.0 は,大言語モデルによる臨床トリアージの診断に有用である。
トリアージ安全性を3つの異なる障害モード(保守的エスカレーションバイアス、システマティックダウングレードバイアス、ミドルタイア不安定)に分解するフォーマルな数学的枠組みを導入する。
論文 参考訳(メタデータ) (2026-07-31T07:11:55Z) - Beyond Local Inspection: Global, Guideline-Grounded Evaluation of Post-hoc XAI Methods for ECG Classification [0.0]
本報告では, 心室筋電図から心室筋電図を抽出し, 臨床的に定義された関心領域に対して評価する枠組みを提案する。
その結果,コンピュータビジョンから転送される手法の体系的失敗が明らかになった。
13の手法のうち9つは、少なくとも1つの条件で失敗し、パターン間の不整合性を示す。
論文 参考訳(メタデータ) (2026-07-27T06:16:28Z) - SVC-Probe: A Framework for Evaluating Perturbation Generalization in Spatial Foundation-Model Embeddings [3.884856136722027]
本研究では,蛍光顕微鏡画像から得られた空間基底モデル埋め込みの一般化について検討する。
本稿では,SVC-Probeについて紹介する。SVC-Probeは細胞内埋め込みアトラス安定性,Mondrian Neighborhood Graphs,Foundation Model Perturbation Probeを組み合わせた摂動認識フレームワークである。
論文 参考訳(メタデータ) (2026-06-26T13:46:36Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - ClinNet: Evidential Ordinal Regression with Bilateral Asymmetry and Prototype Memory for Knee Osteoarthritis Grading [3.337151338735509]
X線画像に基づく膝関節症(KOA)の診断は極めて難しい課題である。
本研究では, KOA グレーディングに対処する信頼性の高い新しいフレームワーク ClinNet を提案する。
論文 参考訳(メタデータ) (2026-01-24T05:49:41Z) - VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension [51.76841625486355]
Referring Expression (REC) は、自然言語クエリに対応する画像領域をローカライズすることを目的としている。
最近のニューロシンボリックRECアプローチは、大規模言語モデル(LLM)と視覚言語モデル(VLM)を利用して構成推論を行う。
推論ステップ内に軽量な演算子レベルの検証器を組み込む,ニューロシンボリックなフレームワークであるVIROを紹介する。
論文 参考訳(メタデータ) (2026-01-19T07:21:19Z) - Compressed Causal Reasoning: Quantization and GraphRAG Effects on Interventional and Counterfactual Accuracy [0.0]
本研究は, パールズ・コーサル・ラダーの全3レベルにわたる定量化効果を系統的に評価した。
Llama 3 8Bのラングレベルの精度は、量子化下では広く安定であり、NF4は全体の1%未満の劣化を示した。
CRASSベンチマークの実験では、既存のコモンセンスの反事実データセットには、量子化による推論ドリフトを明らかにするのに必要な構造感度が欠如していることが示されている。
論文 参考訳(メタデータ) (2025-12-13T17:54:15Z) - MeCaMIL: Causality-Aware Multiple Instance Learning for Fair and Interpretable Whole Slide Image Diagnosis [40.3028468133626]
MIL(Multiple Case Learning)は、コンピュータ病理学における全スライド画像(WSI)解析の主流パラダイムとして登場した。
因果関係を意識したMILフレームワークである textbfMeCaMIL は、構造化因果グラフを通じて、階層的共同創設者を明示的にモデル化する。
MeCaMILは優れた公正性を達成する -- 人口格差の分散は、属性全体の平均で65%以上減少する。
論文 参考訳(メタデータ) (2025-11-14T06:47:21Z) - Conformal Lesion Segmentation for 3D Medical Images [82.92159832699583]
本稿では,データ駆動しきい値の校正をコンフォーマル化することで,テスト時間FNRが目標許容値以下であることを保証する,リスク制約付きフレームワークを提案する。
5つのバックボーンモデルにまたがる6つの3D-LSデータセット上でのCLSの統計的健全性と予測性能を検証し,臨床実践におけるリスク認識セグメンテーションの展開に関する実用的な知見を得た。
論文 参考訳(メタデータ) (2025-10-19T08:21:00Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - GRID: Graph-based Reasoning for Intervention and Discovery in Built Environments [0.31096636737010974]
商業ビルにおける手動のHVAC故障診断には、インシデント毎に8~12時間かかり、診断精度は60%に過ぎません。
本稿では,制約に基づく探索,ニューラル構造方程式モデリング,言語モデルなどを組み合わせた3段階の因果探索パイプラインGRIDについて述べる。
このフレームワークは制約ベースの手法、ニューラルアーキテクチャ、ドメイン固有の言語モデルを統合し、分析を構築する際の観察と因果的なギャップに対処する。
論文 参考訳(メタデータ) (2025-09-19T20:19:48Z) - CRTRE: Causal Rule Generation with Target Trial Emulation Framework [47.2836994469923]
ターゲットトライアルエミュレーションフレームワーク(CRTRE)を用いた因果ルール生成という新しい手法を提案する。
CRTREは、アソシエーションルールの因果効果を推定するためにランダム化トライアル設計原則を適用している。
次に、病気発症予測などの下流アプリケーションにそのような関連ルールを組み込む。
論文 参考訳(メタデータ) (2024-11-10T02:40:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。