論文の概要: MedZERO: Self-Evolving Agents for Open-Ended Medical Reasoning Through Controlled Knowledge Accumulation
- arxiv url: http://arxiv.org/abs/2610.08327v1
- Date: Tue, 06 Oct 2026 13:25:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.00734
- Title: MedZERO: Self-Evolving Agents for Open-Ended Medical Reasoning Through Controlled Knowledge Accumulation
- Title(参考訳): MedZERO:制御知識蓄積によるオープンエンド医療推論のためのセルフ進化エージェント
- Abstract要約: オープンエンド医療推論のための自己進化型フレームワークであるMedZEROについて紹介する。
4Bスケールと8Bスケールのベースモデルを用いて、5つの公開医療推論ベンチマークでMedZEROを評価した。
- 参考スコア(独自算出の注目度): 49.29414422255548
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have shown promise in medical question answering and clinical reasoning, yet their improvement remains constrained by static parametric knowledge and costly expert supervision. Self-evolving agents offer a promising alternative by enabling models to improve through iterative task generation and problem-solving. However, most existing self-evolving methods are designed for easily verifiable domains such as mathematics and coding, where solutions can be checked by exact answers or executable programs. Medical reasoning is fundamentally different: it is open-ended, knowledge-intensive, and often only partially verifiable. We present MedZERO, a self-evolving framework for open-ended medical reasoning. MedZERO couples an Examiner that generates frontier medical question-option pairs with a Reasoner that solves them through evidence-grounded multi-turn reasoning with external knowledge tools. To support reliable, continual improvement, MedZERO adopts controlled knowledge accumulation, which maintains temporary exploratory knowledge and curated persistent knowledge in reasoning. We evaluate MedZERO on five public medical reasoning benchmarks using 4B- and 8B-scale base models under open-ended evaluation. Across all settings, MedZERO consistently outperforms the underlying base models and prior self-evolving baselines, achieving up to 13.7 average accuracy-point gains over the next-best self-evolving baseline.
- Abstract(参考訳): 大規模言語モデル (LLMs) は, 医療質問応答や臨床推論において有望であるが, 静的パラメトリック知識と費用がかかる専門家の監督によって改善が制限されている。
自己進化エージェントは、反復的なタスク生成と問題解決を通じてモデルを改善することによって、有望な代替手段を提供する。
しかし、既存の自己進化的手法のほとんどは、正確な答えや実行可能なプログラムによって解をチェックできる数学やコーディングといった、容易に検証できる領域のために設計されている。
医学的推論は根本的に異なり、オープンエンドであり、知識集約であり、しばしば部分的に検証されるのみである。
オープンエンド医療推論のための自己進化型フレームワークであるMedZEROについて紹介する。
MedZEROは、エビデンスベースのマルチターン推論と外部知識ツールで解決するReasonerと、フロンティアの医療用質問-オプションペアを生成するExaminerを結合する。
信頼性と継続的な改善を支援するため、MedZEROは、一時的な探索的な知識を維持し、推論において永続的な知識をキュレートする制御された知識蓄積を採用する。
我々は4Bスケールと8Bスケールのベースモデルを用いて5つの公開医療推論ベンチマークでMedZEROを評価した。
すべての設定において、MedZEROは基礎となるベースモデルとそれ以前の自己進化ベースラインを一貫して上回り、次の最高の自己進化ベースラインよりも平均13.7の精度ポイントゲインを達成する。
関連論文リスト
- MedRSI: Recursive Self-Improvement for Medical Agents via Clinically Aligned Self-Evolution [25.076838954854964]
再帰的自己改善(RSI)は、エージェントが自身の失敗から学び、自律的に能力を拡張する、異なるパラダイムを提供する。
MedRSIを導入し,診断障害を新たな臨床機能に継続的に変換する。
以上の結果から, 医療機関は, 展開前に特定された能力に制約を課す必要はないことが示唆された。
論文 参考訳(メタデータ) (2026-09-21T16:19:33Z) - MedCTA: A Benchmark for Clinical Tool Agents [47.47354499871572]
MedCTA(MedCTA)は,臨床医が有する段階的作業における医療ツールエージェントの評価のためのベンチマークである。
MedCTAは、実世界の107の臨床的タスクと、臨床者が検証した5つのデプロイツール以上の実行可能な軌道から構成される。
我々は18のオープンソースおよびクローズドソースマルチモーダルモデルをベンチマークし、フロンティアシステムでさえもマルチステップ臨床ツールの使用において脆弱であることを発見した。
論文 参考訳(メタデータ) (2026-06-10T06:26:52Z) - EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning [72.70291772077738]
エージェントのマルチターン診断能力を評価するためのベンチマークであるMed-Inquireを提案する。
次に、テスト時に効率的な診断戦略を学ぶ自己進化エージェントであるEvoClinicianを紹介する。
実験の結果,EvoClinicianは連続学習ベースラインや,メモリエージェントなどの自己進化エージェントよりも優れていた。
論文 参考訳(メタデータ) (2026-01-30T13:26:18Z) - Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models [52.2001050216955]
既存の方法は、モデル構造を調整したり、高品質なデータで微調整したり、好みの微調整によって、医療ビジョン言語モデル(MedVLM)の性能を向上させることを目的としている。
我々は,MedVLMと臨床専門知識の連携を図るために,Expert-Controlled-Free Guidance (Expert-CFG) という,ループ内のエキスパート・イン・ザ・ループフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-12T09:03:30Z) - Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards [28.419723761732357]
Med-PRMは、確立した医療知識ベースに対する各推論ステップを検証するためのプロセス報酬モデリングフレームワークである。
Med-PRMは最先端のパフォーマンスを実現し、ベースモデルの性能を最大13.50%向上させた。
我々は、Med-PRMの汎用性を、Meerkatのような強力なポリシーモデルとプラグイン・アンド・プレイ方式で統合することで示す。
論文 参考訳(メタデータ) (2025-06-13T05:36:30Z) - ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning [54.30630356786752]
ReasonMedは、これまでで最大の医療推論データセットで、370万の高品質な例がある。
マルチエージェント生成、検証、改善プロセスを通じて構築される。
ReasonMedを用いて、簡潔な答えの要約と詳細なCoT推論を統合することで、最も堅牢な微調整結果が得られる。
論文 参考訳(メタデータ) (2025-06-11T08:36:55Z) - MedBrowseComp: Benchmarking Medical Deep Research and Computer Use [10.565661515629412]
MedBrowseCompは、エージェントが医療事実を検索し、合成する能力を体系的にテストするベンチマークである。
臨床シナリオを反映した1,000以上の人為的な質問が含まれている。
MedBrowseCompをフロンティアエージェントシステムに適用すると、パフォーマンスの欠点が10%も低くなる。
論文 参考訳(メタデータ) (2025-05-20T22:42:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。