論文の概要: GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
- arxiv url: http://arxiv.org/abs/2607.26160v1
- Date: Tue, 28 Jul 2026 18:10:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.446955
- Title: GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
- Title(参考訳): GuideSkill: ガイドライン付き臨床推論のための実行可能なLLMエージェントスキルの進化
- Abstract要約: 疾患特異的な基準を実行可能な関数にコンパイルする外部推論層である GuideSkill を導入する。
4つのベンチマークと4つのバックボーンで、ガイドスキルゼロはガイドラインRAGのマクロ平均精度を平均13.45%改善した。
GuideSkill-Evoはすべてのバックボーンで最高マクロ平均を達成し、直接推論よりも18.49%向上し、ゴールドラベルのスキルカバレッジを56.5%から99.5%に向上させた。
- 参考スコア(独自算出の注目度): 10.602857619056744
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical practice guidelines (CPGs) encode diagnostic criteria, but LLM systems typically retrieve guideline text or absorb it through training rather than execute its rules. We introduce GuideSkill, an external reasoning layer that compiles disease-specific criteria into executable functions returning ordinal diagnostic-support scores. GuideSkill-Zero is initialized from guidelines, while GuideSkill-Evo uses case--diagnosis pairs to refine covered skills and add missing diagnoses. At inference, an LLM proposes a differential diagnosis, grounds the features required by each matched skill, and fuses its ranking with the executed skill scores. Across four benchmarks and four backbones, GuideSkill-Zero improves macro-average accuracy over guideline RAG by 13.45% on average. GuideSkill-Evo achieves the highest macro-average for every backbone, improves over direct inference by 18.49% relatively, and increases gold-label skill coverage from 56.5% to 99.5%. On Qwen3.5-9B, it also exceeds the strongest parameter-update baseline by 11.16% without updating the backbone. Expert evaluation further indicates that GuideSkill produces clinically sound and broadly acceptable skills, suggesting that its initialized and evolved rules are reliable and practically meaningful. These results support executable skills as a model-agnostic mechanism for combining guideline-derived procedures with case-derived diagnostic patterns.
- Abstract(参考訳): 臨床実習ガイドライン(CPG)は診断基準を符号化するが、LCMシステムは通常、ガイドラインのテキストを検索するか、その規則を実行するよりもトレーニングを通じて吸収する。
診断支援スコアを返却する実行可能な機能に病原性基準をコンパイルする外部推論層である GuideSkill を導入する。
GuideSkill-Zeroはガイドラインから初期化され、 GuideSkill-Evoはケース-診断ペアを使用してカバースキルを洗練し、不足する診断を追加する。
推論において、LLMは、差分診断を提案し、マッチしたスキルごとに要求される特徴を根拠として、そのランクを実行されたスキルスコアと融合させる。
4つのベンチマークと4つのバックボーンで、ガイドスキルゼロはガイドラインRAGのマクロ平均精度を平均13.45%改善した。
GuideSkill-Evoはすべてのバックボーンで最高マクロ平均を達成し、直接推論よりも18.49%向上し、ゴールドラベルのスキルカバレッジを56.5%から99.5%に向上させた。
Qwen3.5-9Bでは、バックボーンを更新することなく最強のパラメータ更新ベースラインを11.16%超える。
専門家による評価は、ガイドスキルが臨床的に健全で広く受け入れられるスキルを生み出すことを示し、その初期化および進化したルールが信頼性と実用的な意味を持つことを示唆している。
これらの結果は、ガイドライン由来の手順とケース由来の診断パターンを組み合わせるためのモデルに依存しないメカニズムとして実行可能なスキルをサポートする。
関連論文リスト
- EviCare: Enhancing Diagnosis Prediction with Deep Model-Guided Evidence for In-Context Reasoning [62.61394722212386]
EviCareは、大規模言語モデルにディープモデルガイダンスを統合する、コンテキスト内推論フレームワークである。
LLMのみのベースラインと深層モデルのみのベースラインを2つの実世界のEHRベンチマークで連続的に上回っている。
論文 参考訳(メタデータ) (2026-04-12T04:35:14Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis [13.241795322837861]
MedEinstは,49の疾患に5,383対の臨床症例を比較検討した。
バイアストラップ速度による感受性の測定-正確な診断制御にもかかわらず、誤診断トラップの確率について検討する。
論文 参考訳(メタデータ) (2026-01-10T17:39:25Z) - Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis [8.935425124628452]
透明性,信頼性,信頼性を高める2段階の診断フレームワークを提案する。
Evidence-Guided Diagnostic Reasoning (EGDR) を導入する。
第2に、生成された診断の事実的精度と論理的整合性を評価するための診断信頼度スコアリング(DCS)モジュールを提案する。
論文 参考訳(メタデータ) (2025-11-22T07:08:23Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - LTR-ICD: A Learning-to-Rank Approach for Automatic ICD Coding [0.0]
臨床ノートには、患者との遭遇時に臨床医が提供した構造化されていないテキストが含まれている。
これらのメモには、通常、国際疾患分類(ICD)に続く一連の診断コードが添付されている。
最先端の手法はこの問題を分類タスクとして扱い、異なる目的に欠かせないICD符号の順序を無視した。
論文 参考訳(メタデータ) (2025-10-15T11:46:42Z) - From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations [45.414878840652115]
大規模言語モデル(LLM)は医療ベンチマークで有望な性能を示した。
しかし、医学的な計算を行う能力は未熟であり、評価も不十分である。
本研究は,臨床信頼性を重視した医療計算評価を再考する。
論文 参考訳(メタデータ) (2025-09-20T09:10:26Z) - Evaluating Large Language Models for Evidence-Based Clinical Question Answering [4.101088122511548]
大規模言語モデル (LLMs) は, 医学的, 臨床的応用において著しく進歩している。
Cochraneの体系的レビューと臨床ガイドラインから得られたベンチマークをキュレートする。
我々はソースと臨床領域間で一貫したパフォーマンスパターンを観察する。
論文 参考訳(メタデータ) (2025-09-13T15:03:34Z) - Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models [52.2001050216955]
既存の方法は、モデル構造を調整したり、高品質なデータで微調整したり、好みの微調整によって、医療ビジョン言語モデル(MedVLM)の性能を向上させることを目的としている。
我々は,MedVLMと臨床専門知識の連携を図るために,Expert-Controlled-Free Guidance (Expert-CFG) という,ループ内のエキスパート・イン・ザ・ループフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-12T09:03:30Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - Extracting Diagnosis Pathways from Electronic Health Records Using Deep
Reinforcement Learning [2.0191844627740254]
我々は,電子カルテから正しい診断を得るために,行動の最適なシーケンスを学習することを目指している。
この課題に様々な深層強化学習アルゴリズムを適用し、貧血の鑑別診断のために、合成だが現実的なデータセットを実験する。
論文 参考訳(メタデータ) (2023-05-10T16:36:54Z) - Exploiting prompt learning with pre-trained language models for
Alzheimer's Disease detection [70.86672569101536]
アルツハイマー病(AD)の早期診断は予防ケアの促進とさらなる進行の遅らせに不可欠である。
本稿では,AD分類誤差をトレーニング対象関数として一貫して用いたPLMの高速微調整法について検討する。
論文 参考訳(メタデータ) (2022-10-29T09:18:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。