論文の概要: MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction
- arxiv url: http://arxiv.org/abs/2608.23397v2
- Date: Tue, 25 Aug 2026 10:41:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.308347
- Title: MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction
- Title(参考訳): メディスキル・エボ: プロセスに制約された自己進化によるエビデンスと臨床の相互作用
- Authors: Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao,
- Abstract要約: バックボーンを微調整することなくプロセス知識を自己進化させるメディスキル・エボを紹介する。
Qwen FullChainでは、メディスキル・エボは診断精度を7.81%改善し、最も優れた先行剤よりも70.67%向上した。
マルチモーダルNEJM診断において、オプションのMedSkill-Evoは診断精度を2.56%、コアスコアを18.96%向上させる。
- 参考スコア(独自算出の注目度): 8.036967404810378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interactive clinical agents operate under partial observability, so reliable care depends on reaching the correct diagnosis through evidence-grounded, safe interactions. Yet existing agents struggle to convert experience into reusable process knowledge with explicit provenance and authority. To address this gap, we introduce MediSkill-Evo, which self-evolves governed process knowledge without fine-tuning the backbone. It realizes this self-evolution by updating clinical, process, symbolic, and visual knowledge in four typed banks under type-specific validation and scope rules. The Process-Constrained Preference Harness then turns validated knowledge into action by grounding candidates in evidence and prioritizing safer decisions. We evaluate on 300 MIMIC-IV-derived FullChain encounters, 180 hard-isolation conditions covering six process obligations, and 100 multimodal NEJM image-diagnosis cases. On Qwen FullChain, MediSkill-Evo improves diagnosis accuracy by 7.81% and treatment-intent coverage by 70.67% over the best-performing prior agent, while reducing critical failures by 43.04%. Under stress, it improves the stress-process composite by 7.77% and required-action completion by 12.41% over the best-performing agent for each metric, with stronger patient-fact, temporal-evidence, and triage-red-flag recovery and no controller-scored errors in unavailable-evidence, treatment, and triage safety checks. On multimodal NEJM diagnosis, MediSkill-Evo with optional MedSAM localization improves diagnosis accuracy by 2.56% and core score by 18.96% over the best-performing memory agent. Code is available at https://anonymous.4open.science/r/mediskill-evo_anonymous-68E7.
- Abstract(参考訳): 対話型臨床薬は部分的観察可能性の下で作用するため、信頼できるケアは証拠と安全な相互作用を通じて正しい診断に達することに依存する。
しかし、既存のエージェントは、経験を明示的な証明と権威で再利用可能なプロセス知識に変換するのに苦労している。
このギャップに対処するために、バックボーンを微調整することなくプロセス知識を自己進化させるMedicSkill-Evoを導入する。
タイプ別検証とスコープルールに基づく4つの型付き銀行における臨床、プロセス、象徴的、視覚的知識の更新により、この自己進化を実現する。
Process-Constrained Preference Harnessは、検証済みの知識を証拠の候補を根拠にし、より安全な決定を優先順位付けすることで行動させる。
我々は,MIMIC-IV由来フルチェイン遭遇300件,プロセス義務を含む180件のハードアイソレーション条件,マルチモーダルNEJM画像診断症例100件について検討した。
Qwen FullChainでは、メディスキル・エボは診断精度を7.81%改善し、治療インテリジェントは70.67%向上し、致命的な障害は43.04%減少する。
ストレス下では、ストレス・プロセス・コンポジットを7.77%改善し、要求・アクション・コンプリートを12.41%改善する。
マルチモーダルNEJM診断において、オプションのMedSkill-Evoは診断精度を2.56%、コアスコアを18.96%向上させる。
コードはhttps://anonymous.4open.science/r/mediskill-evo_anonymous-68E7で公開されている。
関連論文リスト
- Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting [59.709162055944915]
ThyroidXAgentは、特殊な診断ツールをコーディネートし、その出力を監査可能なケースレベルの証拠記録として保存するエージェントAIシステムである。
NHC-MISD-TUSコホート内35施設8,721件を含む,重複しない28,458件の検査を行った。
セグメンテーションでは平均Diceスコアが87.21パーセント、良悪性分類では平均AUROCが0.9466だった。
論文 参考訳(メタデータ) (2026-08-12T21:02:59Z) - CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR [15.66578453195388]
CliniCARE-Benchは、振り返り臨床検査のベンチマークである。
実患者由来MIMIC-IVデータより, 患者特異的症例750例と推定した。
システムは4つの評決のうちの1つを返す: Yes, No, Indeterminate: Lack of Data, or Indeterminate: Medically Ambiguous。
論文 参考訳(メタデータ) (2026-08-07T22:39:13Z) - ResidencyRL: Reinforcement Learning in Simulated Clinical Environments [53.76751756107077]
臨床人工知能(AI)エージェントを模擬多ターン臨床で訓練するための強化学習(RL)手法であるResidencyRLを提案する。
ホールドアウト評価では、ResidencyRLエージェントは、対向条件下で診断精度を7.0%向上させる。
盲目の専門医はこれらの利得を検証し、訓練されたエージェントをサイドバイサイド比較の87.6%で好んだ。
論文 参考訳(メタデータ) (2026-08-07T17:04:41Z) - PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents [5.247635961504091]
patientAgentBenchは、患者が直面するエージェント医療をベンチマークする。
シミュレーションされた患者と会話しながら、医療ツールのサンドボックスでエージェントにラップされた基礎モデルを評価する。
同じ1200のシナリオで、同じ4つのファミリーで10のモデルをベンチマークし、臨床的なギャップを見つけました。
論文 参考訳(メタデータ) (2026-07-28T09:24:04Z) - Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation [0.32553561239735207]
臨床的判断に取って代わるのではなく、拡張するように設計されたエンジンであるxAARAを提示する。
xAARAは、タスク、ムーブメントフェーズ、ムーブメント品質のレベルを越えて、キャリブレーションされた不確実性と説明でARATアセスメントを返します。
105回のストロークサバイバー(788回の運動)では、xAARAは94.2%のタスク精度と81.3%の移動位相精度を達成した。
論文 参考訳(メタデータ) (2026-06-23T09:00:15Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring [2.0918370570198763]
遠隔患者モニタリング(RPM)は膨大なデータを生成するが、データ量が臨床スタッフを圧倒したため、目覚ましい臨床試験(Tele-HF, BEAT-HF)は失敗した。
RPMバイタルのコンテキストトリアージにモデルコンテキストプロトコル(MCP)を用いた自律型AIエージェントSentinelを開発した。
論文 参考訳(メタデータ) (2026-03-10T00:50:54Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - End-To-End Clinical Trial Matching with Large Language Models [0.6151041580858937]
大言語モデル(LLM)を用いた臨床試験のためのエンドツーエンドパイプラインを提案する。
本研究は,93.3%の症例において関連する候補試験を同定し,88.0%の予備的精度を達成している。
私たちの完全なエンドツーエンドパイプラインは、自律的または人間の監督の下で運用することができ、オンコロジーに限定されません。
論文 参考訳(メタデータ) (2024-07-18T12:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。