FuguReport

An AI agent for treatment reasoning over a biomedical tool universe

著者 Shanghua Gao, Ayush Noori, Richard Zhu, Curtis Ginder, Zhenglun Kong, Xiaorui Su, Justin Kauffman, Benjamin S. Glicksberg, Joshua Lampert, Ankit Sakhuja, Ashwin Sawant, ATHENA-R1 Evaluation Consortium, David A. Clifton, Noa Dagan, Ran Balicer, Marinka Zitnik
所属 ATHENA-R1 Evaluation Group / Icahn School of Medicine at Mount Sinai / Mount Sinai Health System / Clalit Research Institute / Harvard Medical School / University of Oxford / Brigham and Women’s Hospital / Broad Institute of MIT and Harvard / Harvard University / Ben Gurion University of the Negev
カテゴリ Application / Biomedical AI / AI agent for drug treatment, Method / Reinforcement Learning / Training on biomedical tool universe, Evaluation / Treatment Effectiveness / Pharmacological treatment accuracy
ライセンス CC BY 4.0

Abstractの概要

本論文では、212の生物医学ツールのライブラリから反復的に証拠を収集し統合する、治療推論のためのAIエージェント「ATHENA-R1」を紹介する。システムは、パラメータ化された知識にのみ依存するのではなく、不足している情報を特定し、FDAのラベル内容などの証拠を検索して、段階的に推論を更新する。トレーニングパイプラインは、自己生成された推論トレースと科学的フィードバックを用いた強化学習を組み合わせており、人間による推論のアノテーションを必要としない。このシステムは、ベンチマークとなる薬剤推論タスク、希少疾患に対する盲検化された専門家レビュー、医師が評価した入院患者のケース、および集団規模の電子健康記録(EHR)の検証において包括的に評価されている。

新規性

主な新規性は、治療推論を、言語モデルからの直接的な回答生成ではなく、大規模な生物医学ツールの世界を通じた学習可能な複数ステップの証拠探索プロセスとして定式化した点にある。さらに、マルチエージェントの自己学習と科学的フィードバックを用いた強化学習を活用する2段階のトレーニング手法を導入し、人間のアノテーションなしで推論トレースとツール使用行動を構築している。

成果

ベンチマーク評価において、本エージェントはDrugPCで94.7%、TreatmentPCで82.9%の精度を達成し、GPT-5やDeepSeek-R1などのモデルを上回った。盲検化された専門家評価ではその回答が臨床的基準全体で一貫して支持され、複雑な入院患者のケースでも推論を成功させた。さらに、540万人の患者を対象とした後ろ向きEHR分析により、モデルが生成した有害事象の仮説が検証され、予測された関連性の調整オッズ比は1.48〜1.84に達した。

論文の注目点

  1. ATHENA-R1は、212の生物医学ツールライブラリからリアルタイムでツールを選択・実行し、証拠に基づいた推論トレースを生成することで、複数ステップの治療推論を行う。
  2. システムは、自己生成された指示データセットと、多軸的な科学的フィードバックに基づく強化学習を組み合わせた2段階のスキームを使用してトレーニングされる。
  3. 実証評価により、対照ベンチマーク、盲検化された専門家の評価、複雑な症例に対する医師のレビュー、および集団規模のEHR仮説検証全体にわたり、最新技術(SOTA)のパフォーマンスが実証された。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。