An AI agent for treatment reasoning over a biomedical tool universe
Abstractの概要
本論文では、212の生物医学ツールのライブラリから反復的に証拠を収集し統合する、治療推論のためのAIエージェント「ATHENA-R1」を紹介する。システムは、パラメータ化された知識にのみ依存するのではなく、不足している情報を特定し、FDAのラベル内容などの証拠を検索して、段階的に推論を更新する。トレーニングパイプラインは、自己生成された推論トレースと科学的フィードバックを用いた強化学習を組み合わせており、人間による推論のアノテーションを必要としない。このシステムは、ベンチマークとなる薬剤推論タスク、希少疾患に対する盲検化された専門家レビュー、医師が評価した入院患者のケース、および集団規模の電子健康記録(EHR)の検証において包括的に評価されている。
新規性
主な新規性は、治療推論を、言語モデルからの直接的な回答生成ではなく、大規模な生物医学ツールの世界を通じた学習可能な複数ステップの証拠探索プロセスとして定式化した点にある。さらに、マルチエージェントの自己学習と科学的フィードバックを用いた強化学習を活用する2段階のトレーニング手法を導入し、人間のアノテーションなしで推論トレースとツール使用行動を構築している。
成果
ベンチマーク評価において、本エージェントはDrugPCで94.7%、TreatmentPCで82.9%の精度を達成し、GPT-5やDeepSeek-R1などのモデルを上回った。盲検化された専門家評価ではその回答が臨床的基準全体で一貫して支持され、複雑な入院患者のケースでも推論を成功させた。さらに、540万人の患者を対象とした後ろ向きEHR分析により、モデルが生成した有害事象の仮説が検証され、予測された関連性の調整オッズ比は1.48〜1.84に達した。
論文の注目点
- ATHENA-R1は、212の生物医学ツールライブラリからリアルタイムでツールを選択・実行し、証拠に基づいた推論トレースを生成することで、複数ステップの治療推論を行う。
- システムは、自己生成された指示データセットと、多軸的な科学的フィードバックに基づく強化学習を組み合わせた2段階のスキームを使用してトレーニングされる。
- 実証評価により、対照ベンチマーク、盲検化された専門家の評価、複雑な症例に対する医師のレビュー、および集団規模のEHR仮説検証全体にわたり、最新技術(SOTA)のパフォーマンスが実証された。