論文の概要: GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space
- arxiv url: http://arxiv.org/abs/2608.30188v1
- Date: Mon, 31 Aug 2026 03:13:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.20766
- Title: GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space
- Title(参考訳): GPAgentBench-2K:複雑な臨床行動空間における大規模言語モデルエージェントのベンチマーク
- Abstract要約: GPAgentBench-2Kは、プライマリケアの臨床的意思決定のための最初の制約付きMDPベンチマークである。
我々の環境は6つの基本的な臨床行動の完全なスペクトルをモデル化し、行動空間に先立ってトポロジカルなワークフローを課し、第一級の成果として安全インフォームドな禁忌を運用する。
- 参考スコア(独自算出の注目度): 23.17247034064766
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) show great potential as clinical agents, yet existing benchmarks reduce clinical workflows to static predictions or unconstrained Markov Decision Processes (MDPs) with coarse action sets. To address this, we introduce GPAgentBench-2K, the first Constrained MDP (CMDP) LLM-agent benchmark for primary-care clinical decision-making, constructed from expert-validated records of real-world GP encounters. Our environment models a full spectrum of six foundational clinical actions, imposes a topological workflow prior over the action space, and operationalizes safety-informed abstention as a first-class outcome. Evaluating 16 state-of-the-art LLMs reveals a significant performance degradation as the action space scales. Crucially, we uncover a clinical quality-safety gap: even frontier models with the highest diagnosis accuracy violate safety constraints in over half of high-risk cases. Finally, we establish a reference point using Constrained Group Relative Policy Optimization (C-GRPO), and show that while explicitly modeling constraints improves performance over unconstrained RL methods, it remains far from clinically acceptable safety.
- Abstract(参考訳): 大きな言語モデル(LLM)は、臨床薬として大きな可能性を秘めているが、既存のベンチマークでは、臨床ワークフローを静的な予測や、粗いアクションセットを持つ未制約のマルコフ決定プロセス(MDP)に還元している。
そこで本研究では,GP遭遇のエキスパート検証記録から構築したCMDP (Constrained MDP) LLM-agentベンチマークであるGPAgentBench-2Kを紹介する。
我々の環境は6つの基本的な臨床行動の完全なスペクトルをモデル化し、行動空間に先立ってトポロジカルなワークフローを課し、第一級の成果として安全インフォームドな禁忌を運用する。
16の最先端LCMを評価すると、アクション空間がスケールするにつれて性能が著しく低下する。
診断精度が最も高いフロンティアモデルでさえ、リスクの高いケースの半数以上で安全性の制約に違反している。
最後に、制約付きグループ相対ポリシー最適化(C-GRPO)を用いて基準点を確立し、制約を明示的にモデル化することで、制約のないRL法よりも性能が向上するが、臨床上許容できる安全性には程遠いことを示す。
関連論文リスト
- Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model [57.78184285979881]
敗血症治療推奨のための世界モデル拡張LDMエージェントであるSepsisAgentを紹介する。
SepsisAgentは、学習された臨床世界モデルを使用して、候補の流体圧薬の介入下での患者の反応をシミュレートする。
論文 参考訳(メタデータ) (2026-05-14T11:50:00Z) - EviCare: Enhancing Diagnosis Prediction with Deep Model-Guided Evidence for In-Context Reasoning [62.61394722212386]
EviCareは、大規模言語モデルにディープモデルガイダンスを統合する、コンテキスト内推論フレームワークである。
LLMのみのベースラインと深層モデルのみのベースラインを2つの実世界のEHRベンチマークで連続的に上回っている。
論文 参考訳(メタデータ) (2026-04-12T04:35:14Z) - Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging [10.955738714664276]
医療領域では,医療負担軽減のための医療資料として,大規模言語モデルが採用されている。
研究によると、LSMはタスク固有の医療データセットを使用して微調整を行う際に、かなりの量の指示追従能力を「忘れる」ことがしばしばある。
本研究では,汎用LSMを医療領域に効率的に適用するためのモデル統合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-02T02:18:49Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - Empowering Locally Deployable Medical Agent via State Enhanced Logical Skills for FHIR-based Clinical Tasks [15.634158040789474]
State-Enhanced Logical-Skill Memory (SELSM) は、シミュレートされた臨床軌道をエンティティに依存しない運用ルールに蒸留する、トレーニング不要のフレームワークである。
MedAgentBench - 実際の臨床データでベンチマークされた唯一の信頼性の高い高忠実な仮想EHRサンドボックス。
論文 参考訳(メタデータ) (2026-03-06T21:42:14Z) - PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation [51.96735866702332]
PreBAはPCA重み付き検索とベイズ平均アグリゲーションを統合した検索拡張フレームワークである。
例えば、PreBAはパフォーマンスを大幅に改善し、MAEを最大40%削減し、ゼロショット推論でR2を-0.13から0.62に引き上げる。
論文 参考訳(メタデータ) (2026-02-27T07:19:23Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - REACT-LLM: A Benchmark for Evaluating LLM Integration with Causal Features in Clinical Prognostic Tasks [13.484012983177168]
大言語モデル(LLM)と因果学習はそれぞれ、臨床意思決定(CDM)に強い可能性を秘めている
現実世界の医療では、結果に因果的影響のある特徴を特定することが、行動可能で信頼できる予測に不可欠である。
本稿では,LEMと因果的特徴の組み合わせが臨床予後を向上するかどうかを評価するためのベンチマークであるREACT-LLMを紹介する。
論文 参考訳(メタデータ) (2025-11-10T14:12:35Z) - CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning [28.737391224748798]
胸部X線(CXR)課題に対するインターリーブ"思考答え"推論を実現するための最初の生成モデルであるCX-Mindを提案する。
CX-Mindはカリキュラム強化学習と検証プロセス報酬(RL-VPR)によって駆動される
CX-Mindは、視覚的理解、テキスト生成、アライメントにおいて、既存の医用および一般ドメインMLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-07-31T05:07:18Z) - Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise [14.052630186550628]
プロセス教師付き報酬モデル(PRM)は、数学やコーディングといった分野において、大きな言語モデル(LLM)の出力に対してステップバイステップの検証を提供する。
LLM作成臨床ノートに段階的な報酬信号を提供するために,PRMを訓練するための新しい枠組みを導入する。
論文 参考訳(メタデータ) (2024-12-17T06:24:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。