論文の概要: Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation
- arxiv url: http://arxiv.org/abs/2607.25489v1
- Date: Tue, 28 Jul 2026 09:25:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.784552
- Title: Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation
- Title(参考訳): 医学におけるエージェントAI : アーキテクチャ、応用、評価、臨床翻訳の課題
- Authors: Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang,
- Abstract要約: 医療におけるエージェントAIの範囲は依然として未解決であり、現在の評価プラクティスは、まだ臨床使用の要件に合致していない。
5つの電子源にまたがる系統的エビデンスマッピング,1649件の輸出記録,57件の特有な研究を含むスコーピングレビューを行った。
これらの研究は、検索および外部知識、マルチモーダルエージェント、および医療質問応答、画像解釈、電子健康記録分析、薬物安全性、臨床治験予測に適用されるマルチエージェントシステムによって支援される、外部ツールを使用する単一のエージェントについて記述している。
- 参考スコア(独自算出の注目度): 16.678400738326236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models and multimodal foundation models are enabling medical artificial intelligence (AI) systems to move beyond isolated prediction and undertake multistep clinical tasks that require planning, tool use, memory, iterative correction, and coordination among specialized agents. However, the scope of agentic AI in medicine remains unsettled, and current evaluation practices are not yet aligned with the requirements of clinical use. We conducted a scoping review with systematic evidence mapping across five electronic sources, screened 1,649 exportable records, and provisionally included 557 unique studies that met predefined criteria for goal-directed task execution, tool use, interaction with external resources, feedback-based refinement, or multi-agent collaboration. The included studies describe single agents that use external tools, workflows supported by retrieval and external knowledge, multimodal agents, and multi-agent systems applied to medical question answering, image interpretation, electronic health record analysis, drug safety, and clinical trial prediction. The evidence base remains dominated by public benchmarks, simulated settings, retrospective datasets, and small-scale expert evaluation. Process reliability, evidence traceability, uncertainty, safety, workflow impact, and external validity are evaluated less consistently. Clinical translation will depend on clearer definitions, reproducible evaluation, auditable oversight, interoperable system design, and prospective validation in real-world clinical workflows.
- Abstract(参考訳): 大規模言語モデルとマルチモーダル基盤モデルにより、医療人工知能(AI)システムは、孤立した予測を超えて、計画、ツールの使用、記憶、反復的修正、特殊エージェント間の調整を必要とする多段階臨床タスクを遂行することができる。
しかし、医学におけるエージェントAIの範囲は未解決のままであり、現在の評価プラクティスは、まだ臨床応用の要件に合致していない。
我々は,5つの電子源にまたがる系統的エビデンスマッピング,1,649個の輸出可能な記録のスクリーニング,目標指向タスク実行,ツール使用,外部リソースとのインタラクション,フィードバックベースリファインメント,マルチエージェントコラボレーションの既定基準を満たす557個のユニークな研究を含むスコーピングレビューを行った。
対象となった研究は、外部ツール、検索および外部知識の支援されたワークフロー、マルチモーダルエージェント、医療質問応答、画像解釈、電子健康記録分析、薬物安全性、臨床治験予測に適用されるマルチエージェントシステムである。
エビデンスベースには、公開ベンチマーク、シミュレートされた設定、ふりかえりデータセット、小規模の専門家による評価が引き続き使用されている。
プロセスの信頼性、エビデンストレーサビリティ、不確実性、安全性、ワークフローへの影響、外部の妥当性は、一貫して評価されません。
臨床翻訳は、より明確な定義、再現可能な評価、監査可能な監視、相互運用可能なシステム設計、実際の臨床ワークフローにおける予測検証に依存する。
関連論文リスト
- Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems [64.88044474617854]
大規模言語モデルベースのエージェントをリコメンダシステムに迅速に統合することで、静的なランキングベースのパイプラインから、自律的でインタラクティブなシステムへのシフトが加速した。
この調査では、自律性のレベルとエージェントレコメンデータシステムの3つのコアパラダイムを基盤とした統合された分類法を紹介した。
論文 参考訳(メタデータ) (2026-07-05T17:55:05Z) - MedCTA: A Benchmark for Clinical Tool Agents [47.47354499871572]
MedCTA(MedCTA)は,臨床医が有する段階的作業における医療ツールエージェントの評価のためのベンチマークである。
MedCTAは、実世界の107の臨床的タスクと、臨床者が検証した5つのデプロイツール以上の実行可能な軌道から構成される。
我々は18のオープンソースおよびクローズドソースマルチモーダルモデルをベンチマークし、フロンティアシステムでさえもマルチステップ臨床ツールの使用において脆弱であることを発見した。
論文 参考訳(メタデータ) (2026-06-10T06:26:52Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI [0.0]
Doctorina MedBenchは、現実的な医師と患者の相互作用のシミュレーションに基づいて、エージェントベースの医療AIの包括的な評価フレームワークである。
このフレームワークは、安全指向のトラップケース、臨床シナリオのカテゴリベースのランダムサンプリング、完全な回帰テストをサポートしている。
評価指標の普遍性は、このフレームワークを医療AIシステムの評価だけでなく、医師を評価し、臨床推論スキルの開発を支援するためにも使用できる。
論文 参考訳(メタデータ) (2026-03-26T18:38:25Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models [15.91764739198419]
5,200件の患者と6万件以上のきめ細粒度評価ルーブリックからなる新規なベンチマークであるMedDialogRubricsについて紹介する。
本フレームワークでは,実世界の電子的健康記録にアクセスすることなく,現実的な患者記録と主訴を合成するマルチエージェントシステムを採用している。
論文 参考訳(メタデータ) (2026-01-06T13:56:33Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications [59.721265428780946]
医学における大きな言語モデル(LLM)は印象的な能力を実現しているが、体系的で透明で検証可能な推論を行う能力に重大なギャップが残っている。
本稿は、この新興分野に関する最初の体系的なレビューを提供する。
本稿では,学習時間戦略とテスト時間メカニズムに分類した推論強化手法の分類法を提案する。
論文 参考訳(メタデータ) (2025-08-01T14:41:31Z) - MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow [14.478357882578234]
現代医学では、臨床診断は主にテキストおよび視覚データの包括的分析に依存している。
大規模視覚言語モデル(VLM)およびエージェントベース手法の最近の進歩は、医学的診断に大きな可能性を秘めている。
現代医学における診断原理に従う新しいエージェント推論パラダイムであるMedAgent-Proを提案する。
論文 参考訳(メタデータ) (2025-03-21T14:04:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。