論文の概要: An AI agent for treatment reasoning over a biomedical tool universe
- arxiv url: http://arxiv.org/abs/2606.28692v1
- Date: Sat, 27 Jun 2026 02:24:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.655996
- Title: An AI agent for treatment reasoning over a biomedical tool universe
- Title(参考訳): バイオメディカルツール宇宙における治療推論のためのAIエージェント
- Authors: Shanghua Gao, Ayush Noori, Richard Zhu, Curtis Ginder, Zhenglun Kong, Xiaorui Su, Justin Kauffman, Benjamin S. Glicksberg, Joshua Lampert, Ankit Sakhuja, Ashwin Sawant, ATHENA-R1 Evaluation Consortium, David A. Clifton, Noa Dagan, Ran Balicer, Marinka Zitnik,
- Abstract要約: 1939年以降、FDAが承認した全ての薬物を治療するAIエージェントであるAtheNA-R1を紹介する。
AtheNA-R1は、212のバイオメディカルツールの宇宙上で強化学習によって訓練されている。
治療薬理学では94.7%、治療薬理学では82.9%に達する。
- 参考スコア(独自算出の注目度): 35.05540785374698
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Treatment reasoning underpins every therapeutic decision, integrating disease context, comorbidities, medications, contraindications, and evolving biomedical knowledge to select an appropriate therapy. It is inherently iterative: candidates are weighed against many constraints, revised as evidence emerges, and grounded in verifiable sources. Here we introduce ATHENA-R1, an AI agent for treatment reasoning across all FDA approved drugs since 1939, trained by reinforcement learning over a universe of 212 biomedical tools. At each step it identifies missing information, selects and runs relevant tools, and incorporates the evidence. To train it without human-annotated traces, we build a two-level self-learning framework: multi-agent systems construct the tools, tasks, and reasoning trajectories for supervised fine-tuning, then reinforcement learning with scientific feedback rewards reasoning quality (evidence gathering, grounded tool use, logical non-redundancy). Across five benchmarks of 3,168 drug reasoning tasks and 456 patient treatment cases, ATHENA-R1 outperforms language models and tool-use systems, reaching 94.7% accuracy on open-ended drug reasoning and 82.9% on treatment reasoning, 17.8 and 10.7 points above GPT-5. In blinded evaluations by experts from 28 rare disease organizations, it is preferred over reference models on all criteria, and physicians rated it favorably on complex hospitalized cardiovascular and infectious-disease cases. Adverse-event hypotheses it generated, tested in electronic health records from 5.4 million patients, reached adjusted odds ratios of 1.48-1.84, with no elevation among negative controls. Because it requires knowing what evidence to seek before concluding, treatment reasoning has long been hard for AI; we show it can be reframed as a learnable process of iterative evidence gathering that reinforcement learning can train AI to perform.
- Abstract(参考訳): 治療理由付けは、あらゆる治療上の決定を下し、疾患の文脈、共生性、薬物、禁忌、生物医学的知識の進化と統合し、適切な治療を選択する。
これは本質的に反復的であり、候補者は多くの制約に対して重み付けされ、証拠が出現するにつれて修正され、検証可能な情報源で根拠付けられている。
本稿では、1939年以降、FDAが承認したすべての薬物を治療するAIエージェントであるAtheNA-R1を紹介します。
各ステップで行方不明の情報を識別し、関連するツールを選択し、実行し、エビデンスを組み込む。
マルチエージェントシステムは、教師付き微調整のためのツール、タスク、推論の軌跡を構築し、その後、科学的フィードバックによる強化学習によって品質を推論する(証拠収集、接地ツールの使用、論理的非冗長性)。
3,168件の薬物推論タスクと456件の患者治療ケースの5つのベンチマークで、ATHENA-R1は言語モデルとツール使用システムを上回っ、オープンエンドドラッグ推論では94.7%、治療推論では82.9%、GPT-5以上では17.8および10.7ポイントに達した。
28の稀な疾患組織の専門家による盲目評価では、すべての基準の基準モデルよりも好まれ、医師は複雑な入院型心血管疾患および感染症の患者に対して好意的に評価した。
5.4万件の患者から得られた電子健康記録で検証された逆イベント仮説は、1.48-1.84の調整オッズ比に達し、負のコントロールでは上昇しなかった。
結論を出す前にどんな証拠を求めるかを知る必要があるため、治療的推論は長い間AIにとって困難であり、強化学習がAIを訓練することのできる反復的証拠の学習可能なプロセスとして再編成できることを示す。
関連論文リスト
- LiteOdyssey: A Lightweight Reasoning AI Agent for Interpretable Rare-Disease Diagnosis [5.485944483858884]
LiteOdysseyは、臨床遺伝学のワークフローを通じて推論言語モデルをガイドする軽量な希少な診断フレームワークである。
LiteOdysseyは、LIRICALとPhenoPacketストアの合計1,243件に対して、Recall@1の59.3%で最先端のパフォーマンスを達成した。
LiteOdyssey氏は、医師のレビューのために正確でデプロイが容易で透明性の高い、希少なAIシステムへの道筋を提案する。
論文 参考訳(メタデータ) (2026-06-15T03:10:17Z) - Causal-Enhanced AI Agents for Medical Research Screening [0.0]
体系的なレビューはエビデンスベースの医療には不可欠だが、150万以上の年次出版物を手作業でレビューすることは不可能である。
本稿では,因果推論と二段階知識グラフを組み合わせた因果グラフ強化検索生成システムを提案する。
提案手法では,すべての因果クレームが検索された文献に辿り着くエビデンスファーストプロトコルを適用し,介入-アウトカム経路を可視化する有向非巡回グラフを自動的に生成する。
論文 参考訳(メタデータ) (2026-01-06T08:41:16Z) - MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition [6.191248426050678]
臨床医学における治療的意思決定には、信頼できるバイオメディカル知識に基づく堅牢で多段階の推論が必要である。
TxAgentによって実証されたエージェントAI手法は、反復的検索強化生成(RAG)を通じてこれらの課題に対処する。
本研究はCURE-Bench NeurIPS 2025 Challengeへの参加から得られた知見を提示する。
論文 参考訳(メタデータ) (2025-12-12T16:01:48Z) - DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services [49.70819009392778]
大規模言語モデル (LLM) とマルチエージェントシステム (MAS) は、ディスパッチを増強する機会を提供する。
本研究の目的は,現実的なシナリオをシミュレートする分類基盤型マルチエージェントシステムの開発と評価である。
論文 参考訳(メタデータ) (2025-10-24T08:01:21Z) - A Multi-Agent Approach to Neurological Clinical Reasoning [0.0]
大規模言語モデル(LLM)は医学領域において有望であるが、専門的な神経学的推論を扱う能力は体系的な評価を必要とする。
我々は,イスラエルの神経学の認定試験から305の質問を用いたベンチマークを開発した。
ベースモデル,検索拡張生成(RAG),新しいマルチエージェントシステムを用いて10個のLLMを評価した。
論文 参考訳(メタデータ) (2025-08-10T14:52:27Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning [54.30630356786752]
ReasonMedは、これまでで最大の医療推論データセットで、370万の高品質な例がある。
マルチエージェント生成、検証、改善プロセスを通じて構築される。
ReasonMedを用いて、簡潔な答えの要約と詳細なCoT推論を統合することで、最も堅牢な微調整結果が得られる。
論文 参考訳(メタデータ) (2025-06-11T08:36:55Z) - TxAgent: An AI Agent for Therapeutic Reasoning Across a Universe of Tools [22.322166889507184]
TxAgentは、薬物相互作用、禁忌、患者固有の治療戦略を分析するAIエージェントである。
ToolUniverseは、1939年以降、FDAが承認したすべての薬物を含む信頼できる情報源から211のツールを統合する。
オープンエンドドラッグ推論タスクでは92.1%の精度で、GPT-4oを超え、構造化多段階推論ではDeepSeek-R1(671B)を上回っている。
論文 参考訳(メタデータ) (2025-03-14T00:28:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。