論文の概要: T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph
- arxiv url: http://arxiv.org/abs/2606.24145v1
- Date: Tue, 23 Jun 2026 05:02:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.77512
- Title: T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph
- Title(参考訳): T2D-Bench:多層クリニカルライフスタイル知識グラフを用いた2型糖尿病のLCM出力のエビデンスグラフによる評価
- Authors: Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani,
- Abstract要約: 大型言語モデル(LLMs)は、ガイドライン上の制約を満たすことや、ライフスタイルに関連するグリセミッククレームを明確に正当化することに失敗したまま、2型糖尿病に対する臨床的に流動的なレコメンデーションを生成することができる。
本稿では,LLM出力が明示的かつグラフチェック可能な証拠要求を満たすかどうかを検証するための再現可能なベンチマークとエビデンス付き評価フレームワークであるT2D-Benchを提案する。
- 参考スコア(独自算出の注目度): 2.065923495101083
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) can produce clinically fluent recommendations for type 2 diabetes while failing to satisfy guideline constraints or explicitly justify lifestyle-related glycemic claims. We present T2D-Bench, a reproducible benchmark and evidence-gated evaluation framework for testing whether LLM outputs satisfy explicit, graph-checkable evidence requirements. T2D-Bench is built on a multi-layer clinical-lifestyle knowledge graph that combines a biomedical spine (UMLS, DrugBank, SIDER), computable ADA Standards of Care rules, and lifestyle knowledge connected through a mechanistic bridge to glycemic laboratory effects. Across 100 structured vignettes spanning diagnosis, medication safety, and adversarial lifestyle conflicts, baseline outputs failed benchmark-defined evidence-path checks in 35% of cases for GPT-4o-mini and 33% for GPT-4o. The evidence gate detects unsupported omissions and uses constrained revision to bring outputs into verifier-level compliance with benchmark-defined evidence requirements. These results show that computable evidence constraints can make unsupported clinical omissions explicit, measurable, and correctable in diabetes-focused LLM outputs.
- Abstract(参考訳): 大型言語モデル(LLMs)は、ガイドライン上の制約を満たすことや、ライフスタイルに関連するグリセミッククレームを明確に正当化することに失敗したまま、2型糖尿病に対する臨床的に流動的なレコメンデーションを生成することができる。
本稿では,LLM出力が明示的かつグラフチェック可能な証拠要求を満たすかどうかを検証するための再現可能なベンチマークとエビデンス付き評価フレームワークであるT2D-Benchを提案する。
T2D-Benchは、バイオメディカルスピーン(UMLS, DrugBank, SIDER)、計算可能なADAケア基準、および機械的ブリッジを介してグリセミック実験効果に繋がるライフスタイルの知識を組み合わせた多層臨床ライフスタイルの知識グラフの上に構築されている。
GPT-4o-miniは35%, GPT-4oは33%であった。
エビデンスゲートは欠落を検知し、制約付きのリビジョンを使用して、ベンチマーク定義エビデンス要件の検証レベルコンプライアンスに出力を投入する。
以上の結果から,糖尿病に焦点をあてたLCM出力では,有意な臨床的欠失が明確で,測定可能で,修正可能であることが示唆された。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - LLM-Powered Personalized Glycemic Assessment in Type 2 Diabetes with Wearable Sensor Data [9.444206455565482]
2型糖尿病(T2D)は、パーソナライズされ改善された糖尿病ケアをサポートするための効果的な血糖評価を要求する、世界的な健康上の脅威となる。
我々は、ウェアラブルセンサデータと構造化メタデータの統合により、CGMに基づくグリセミックダイナミクスをモデル化するLLMベースのフレームワークであるGlyLLMを提案する。
論文 参考訳(メタデータ) (2026-06-10T21:39:02Z) - CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations [16.42889396398046]
マルチシーケンス心血管磁気共鳴(CMR)のためのリーク抵抗性評価ベッドである CardioLens について紹介する。
CardioLensは473,896個のスライスと13,494個のQAペアを4D Cine, LGE, 灌流, T2強調画像に収めている。
CardioLensは24の最先端MLLMをまたいで、実際のCMRワークフローに沿ってパフォーマンスを劣化させながら、モデル全体のパフォーマンスが不十分な、相当な臨床現実のギャップを明らかにしている。
論文 参考訳(メタデータ) (2026-05-28T11:03:06Z) - Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence [51.57735743553791]
今回我々はFundusGroundを紹介した。これは臨床的に解釈可能な眼科用VQAの空間的根拠を用いた新しいベンチマークである。
この構造された病変の証拠に基づいて、72,706の質問が4つのフォーマットにまたがって生成される。
実験により、病変レベルの視覚的エビデンスを組み込むことで、モデルの性能と透明性が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-05-21T12:37:03Z) - A Unified Three-Stage Machine Learning Framework for Diabetes Detection, Subtype Discrimination, and Cognitive-Metabolic Hypothesis Testing [0.5599792629509229]
糖尿病は世界中で5億3700万人以上の成人に影響を与えており、依然として予防医療において大きな課題となっている。
本稿では,糖尿病検出,サブタイプ指向クラスタリング,メタボリック認知関連解析のための再現可能な3段階機械学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T12:53:39Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis [13.241795322837861]
MedEinstは,49の疾患に5,383対の臨床症例を比較検討した。
バイアストラップ速度による感受性の測定-正確な診断制御にもかかわらず、誤診断トラップの確率について検討する。
論文 参考訳(メタデータ) (2026-01-10T17:39:25Z) - Refine Medical Diagnosis Using Generation Augmented Retrieval and Clinical Practice Guidelines [16.56254046507092]
GARMLE-Gは、医療用言語モデルの出力を権威的ガイドラインに根拠づけた、世代別検索フレームワークである。
従来のRetrieval-Augmented Generationベースのアプローチとは異なり、GARMLE-Gは権威的なガイドラインコンテンツを直接検索することで幻覚のない出力を可能にする。
高血圧診断のためのプロトタイプシステムを開発し, 検索精度, 意味的関連性, 臨床ガイドラインの適合性を実証した。
論文 参考訳(メタデータ) (2025-06-22T11:31:13Z) - Less is More: Adaptive Curriculum Learning for Thyroid Nodule Diagnosis [50.231954872304314]
不整合ラベルによるサンプルの発見と破棄を適応的に行うAdaptive Curriculum Learningフレームワークを提案する。
また、TNCD: Thyroid Nodule Classification データセットも提供します。
論文 参考訳(メタデータ) (2022-07-02T11:50:02Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z) - A Benchmark for Studying Diabetic Retinopathy: Segmentation, Grading,
and Transferability [76.64661091980531]
糖尿病患者は糖尿病網膜症(DR)を発症するリスクがある
コンピュータ支援型DR診断は、DRの早期検出と重度評価のための有望なツールである。
このデータセットは、ピクセルレベルのDR関連病変アノテーションを持つ1,842枚の画像と、6人の眼科医によって評価された画像レベルのラベルを持つ1,000枚の画像を有する。
論文 参考訳(メタデータ) (2020-08-22T07:48:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。