論文の概要: MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction
- arxiv url: http://arxiv.org/abs/2608.23397v1
- Date: Mon, 24 Aug 2026 15:45:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:37.019348
- Title: MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction
- Title(参考訳): メディスキル・エボ: プロセスに制約された自己進化によるエビデンスと臨床の相互作用
- Abstract要約: バックボーンを微調整せずにプロセス知識を進化させる臨床薬であるMediSkill-Evoを紹介する。
公開性、サポート、リプレイ、コントローラ定義の安全チェックは、公開を凍結されたテストタイムスナップショットとして管理する。
300回のQwenの遭遇で、メディスキル・エボは診断精度を61.33パーセントから69.00パーセントに改善し、治療対象範囲を33.62パーセントから66.44パーセントに改善した。
- 参考スコア(独自算出の注目度): 8.036967404810378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interactive clinical agents must gather decisive evidence and convert it into grounded actions under partial observability. A correct final diagnosis alone does not show that an agent respected evidence and care-process constraints. We introduce MediSkill-Evo, a clinical agent that evolves governed process knowledge without backbone fine-tuning. It separates experience into four typed banks for clinical skills, process rules, symbolic schemas, and measurement procedures. Provenance, support, replay, and controller-defined safety checks govern publication to a frozen test-time snapshot. A Process-Constrained Preference Harness binds evidence to its source, rejects controller-invalid candidates, and ranks actions with a safety-prioritized Clinical Process Critic. We evaluate complete agent systems across two backbone endpoints and six controlled stress dimensions under the same Doctor-turn limit. On 300 held-out Qwen encounters, MediSkill-Evo improves diagnosis accuracy from 61.33 percent to 69.00 percent and treatment-intent coverage from 33.62 percent to 66.44 percent, while reducing automatically scored critical failures from 31.00 percent to 16.33 percent relative to AgentClinic. On 180 hard-isolation conditions derived from 30 cases, target recovery reaches 93.61 percent under patient-behavior pressure, 100.00 percent for temporal evidence, and 92.22 percent for triage red flags. An exploratory 100-case MedSAM comparison evaluates request-gated tool-interface feasibility. These results provide descriptive end-to-end evidence for the complete system on fixed evaluation suites, not causal evidence for an individual bank or clinical validation of the automatic judge.
- Abstract(参考訳): インタラクティブな臨床薬品は、決定的な証拠を集め、部分的な観察可能性の下で根拠付けられた行動に変換する必要がある。
正しい最終診断だけでは、エージェントがエビデンスとケアプロセスの制約を尊重していることは示さない。
バックボーンを微調整せずにプロセス知識を進化させる臨床薬であるMediSkill-Evoを紹介する。
経験を臨床スキル、プロセスルール、シンボリックスキーマ、測定手順の4つのタイプドバンクに分ける。
公開性、サポート、リプレイ、コントローラ定義の安全チェックは、公開を凍結されたテストタイムスナップショットとして管理する。
Process-Constrained Preference Harnessは、証拠をソースに束縛し、コントローラ非有能な候補を拒絶し、安全を優先した臨床プロセス批判でアクションをランク付けする。
2つのバックボーン終端と6つの制御された応力次元にまたがる完全エージェントシステムの評価を行った。
300回のQwenの遭遇で、メディスキル・エボは診断精度を61.33パーセントから69.00パーセントに改善し、治療対象範囲を33.62パーセントから66.44パーセントに減らし、自動的に31.00パーセントから16.33パーセントに減らした。
30件から派生した180のハードアイソレーション条件では、患者行動圧力下での目標回復率は93.66%、時間的証拠では100.00%、トリアージ赤旗では92.22%に達する。
探索的な100ケースのMedSAM比較は、リクエストゲートツール-インタフェースの実現可能性を評価する。
これらの結果は、個々の銀行の因果的証拠や自動判断器の臨床的検証ではなく、固定評価スイートの完全なシステムに関する記述的なエンドツーエンドの証拠を提供する。
関連論文リスト
- Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting [59.709162055944915]
ThyroidXAgentは、特殊な診断ツールをコーディネートし、その出力を監査可能なケースレベルの証拠記録として保存するエージェントAIシステムである。
NHC-MISD-TUSコホート内35施設8,721件を含む,重複しない28,458件の検査を行った。
セグメンテーションでは平均Diceスコアが87.21パーセント、良悪性分類では平均AUROCが0.9466だった。
論文 参考訳(メタデータ) (2026-08-12T21:02:59Z) - CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR [15.66578453195388]
CliniCARE-Benchは、振り返り臨床検査のベンチマークである。
実患者由来MIMIC-IVデータより, 患者特異的症例750例と推定した。
システムは4つの評決のうちの1つを返す: Yes, No, Indeterminate: Lack of Data, or Indeterminate: Medically Ambiguous。
論文 参考訳(メタデータ) (2026-08-07T22:39:13Z) - ResidencyRL: Reinforcement Learning in Simulated Clinical Environments [53.76751756107077]
臨床人工知能(AI)エージェントを模擬多ターン臨床で訓練するための強化学習(RL)手法であるResidencyRLを提案する。
ホールドアウト評価では、ResidencyRLエージェントは、対向条件下で診断精度を7.0%向上させる。
盲目の専門医はこれらの利得を検証し、訓練されたエージェントをサイドバイサイド比較の87.6%で好んだ。
論文 参考訳(メタデータ) (2026-08-07T17:04:41Z) - PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents [5.247635961504091]
patientAgentBenchは、患者が直面するエージェント医療をベンチマークする。
シミュレーションされた患者と会話しながら、医療ツールのサンドボックスでエージェントにラップされた基礎モデルを評価する。
同じ1200のシナリオで、同じ4つのファミリーで10のモデルをベンチマークし、臨床的なギャップを見つけました。
論文 参考訳(メタデータ) (2026-07-28T09:24:04Z) - A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis [22.43455890575628]
仮説導出型臨床推論のための安全指向フレームワークであるAegisDxについて紹介する。
AegisDx は広範囲の鑑別診断を生成し、危険な "must-not-miss" 条件の明示的なスクリーニングを強制する。
AegisDxは5点のスケールで医師評価の複合安全性スコアを4.31から4.55に改善した。
論文 参考訳(メタデータ) (2026-07-09T01:30:24Z) - Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation [0.32553561239735207]
臨床的判断に取って代わるのではなく、拡張するように設計されたエンジンであるxAARAを提示する。
xAARAは、タスク、ムーブメントフェーズ、ムーブメント品質のレベルを越えて、キャリブレーションされた不確実性と説明でARATアセスメントを返します。
105回のストロークサバイバー(788回の運動)では、xAARAは94.2%のタスク精度と81.3%の移動位相精度を達成した。
論文 参考訳(メタデータ) (2026-06-23T09:00:15Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA [0.0]
マルチエージェントフレームワークはドメイン固有の特殊エージェントとTwo-Phase VerificationとS-Score Weighted Fusionを組み合わせたものだ。
4つの専門エージェントがQwen2.5-7B-Instructを使用して独立した診断を生成する。
Sスコアは最終回答を選択する重み付き融合戦略を推進し、信頼性を報告している。
論文 参考訳(メタデータ) (2026-03-25T16:22:53Z) - Emulating Clinician Cognition via Self-Evolving Deep Clinical Research [104.66211772795747]
このギャップを橋渡しする自己進化型診断剤DxEvolveを,インタラクティブな深層臨床研究ワークフローを通じて開発しました。
MIMIC-CDMベンチマークでは、DxEvolveは平均オーバーボーンモデルで診断精度を11.2%改善した。
DxEvolveは、経験を管理可能な学習資産に変えることによって、臨床AIの継続的な進化のための説明可能な経路をサポートする。
論文 参考訳(メタデータ) (2026-03-11T11:41:51Z) - From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring [2.0918370570198763]
遠隔患者モニタリング(RPM)は膨大なデータを生成するが、データ量が臨床スタッフを圧倒したため、目覚ましい臨床試験(Tele-HF, BEAT-HF)は失敗した。
RPMバイタルのコンテキストトリアージにモデルコンテキストプロトコル(MCP)を用いた自律型AIエージェントSentinelを開発した。
論文 参考訳(メタデータ) (2026-03-10T00:50:54Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - End-To-End Clinical Trial Matching with Large Language Models [0.6151041580858937]
大言語モデル(LLM)を用いた臨床試験のためのエンドツーエンドパイプラインを提案する。
本研究は,93.3%の症例において関連する候補試験を同定し,88.0%の予備的精度を達成している。
私たちの完全なエンドツーエンドパイプラインは、自律的または人間の監督の下で運用することができ、オンコロジーに限定されません。
論文 参考訳(メタデータ) (2024-07-18T12:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。