論文の概要: CDEG: Learning Decision-Critical Evidence for Long-Horizon Diagnostic Agents
- arxiv url: http://arxiv.org/abs/2608.22899v2
- Date: Wed, 26 Aug 2026 02:12:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.002319
- Title: CDEG: Learning Decision-Critical Evidence for Long-Horizon Diagnostic Agents
- Title(参考訳): CDEG:長期診断用エージェントの学習決定批判的エビデンス
- Authors: Xiwei Dai, Zijie Meng, Zhiting Fan, Yixuan Tang, Guanyu Jiang, Ziru Niu, Zuozhu Liu,
- Abstract要約: 筆者らは,過去の診断軌跡から再利用可能な決定クリティカルな証拠を学習するグラフベースのフレームワークCDEGを紹介する。
我々はCDEGが診断性能を継続的に改善し、バニラ剤よりも11.5%の精度向上を実現していることを示す。
- 参考スコア(独自算出の注目度): 21.40725112789917
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unlike static medical question answering, long-horizon diagnosis captures the sequential nature of clinical practice: evidence is progressively acquired, integrated, and evaluated over multiple rounds of interaction before reaching a final diagnosis. However, existing doctor agents often fail when critical evidence is either not acquired or not adequately incorporated into diagnostic reasoning. Recent agentic approaches attempt to address these failures by reusing historical trajectories or distilled memories. But their diagnostic gains remain constrained because such experience may contain noisy or incidental information and is typically reused without validating which evidence actually drives diagnostic decisions. To address this limitation, we introduce CDEG, a graph-based framework that learns reusable decision-critical evidence from historical diagnostic trajectories. CDEG contrasts successful and failed trajectories from the same case to identify candidate evidence, validates their diagnostic impact through controlled counterfactual interventions, and organizes the resulting diagnosis--evidence--action relations into a structured graph. During inference, CDEG tracks the evolving patient evidence state to retrieve relevant diagnostic relations and selectively guide missing evidence acquisition or overlooked evidence reappraisal. Across in-domain and out-of-distribution benchmarks with multiple doctor agent backbones, CDEG consistently improves diagnostic performance, achieving up to an 11.5% accuracy gain over vanilla agents. These results demonstrate that reliable long-horizon diagnosis requires moving beyond trajectory-level experience reuse toward evidence-level learning of the factors that truly shape clinical decisions.
- Abstract(参考訳): 静的な医学的質問応答とは異なり、ロングホライゾン診断は臨床実践のシーケンシャルな性質を捉えており、証拠は最終診断に到達する前に、複数のラウンドにわたって段階的に取得され、統合され、評価される。
しかし、診断的理由付けに重要な証拠が得られていないか、適切に組み込まれていない場合、既存の医師エージェントは失敗することが多い。
最近のエージェント的アプローチは、歴史的軌跡や蒸留記憶を再利用することで、これらの障害に対処しようとしている。
しかし、そのような経験にはノイズや偶発的な情報が含まれており、どの証拠が実際に診断決定を導くかを検証することなく、一般的に再利用されるため、診断の利益は依然として制限されている。
この制限に対処するために,過去の診断軌跡から再利用可能な決定クリティカルな証拠を学習するグラフベースのフレームワークCDEGを紹介する。
CDEGは、同じ事例における成功と失敗の軌跡を対比して、候補の証拠を特定し、制御された反ファクト的介入を通じて診断への影響を検証し、その結果の診断-証拠-行動関係を構造化されたグラフに整理する。
推測中、CDEGは、進行する患者のエビデンス状態を追跡し、関連する診断関係を検索し、行方不明のエビデンス取得または見落としているエビデンスの再評価を選択的にガイドする。
ドメイン内および複数の医師エージェントのバックボーンによるアウト・オブ・ディストリビューションベンチマークを通じて、CDEGは診断性能を一貫して改善し、バニラエージェントよりも11.5%の精度向上を実現している。
これらの結果から, 信頼性の高い長期診断は, トラジェクトリレベルの体験の再利用を超えて, 臨床的決定を真に形成する要因のエビデンスレベルの学習へと移行する必要があることが示唆された。
関連論文リスト
- DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs [21.52456139726765]
ほとんどの医療AIベンチマークは、関連するコンテキストを事前に明らかにし、最終回答のみをスコア付けする。
MDX-TRACEはマルチモーダル・ニューロラジオロジーのための医師適応型ベンチマークである。
211件の難治性症例に対して、隠れた証拠の下で診断の軌跡を評価する。
論文 参考訳(メタデータ) (2026-05-22T13:41:10Z) - MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning [66.94527468532843]
2段階の診断推論フレームワークであるMultiDxを提案する。
まず Web 検索,SOAP 形式の症例,臨床症例データベースから知識を活用することにより,疑わしい診断と推論経路を生成する。
そして、マッチング、投票、および差分診断を通じて、複数のパースペクティブエビデンスを統合し、最終的な予測を生成する。
論文 参考訳(メタデータ) (2026-04-27T08:46:29Z) - Uncertainty-Guided Latent Diagnostic Trajectory Learning for Sequential Clinical Diagnosis [30.87842656331004]
臨床診断には、不確実性の下でのシーケンシャルな証拠取得が必要である。
ほとんどのLarge Language Model (LLM) ベースの診断システムは、完全に観察された患者情報を前提としている。
我々は、遅延診断軌道学習フレームワークとしてシーケンシャル診断を定式化する。
論文 参考訳(メタデータ) (2026-04-06T19:21:56Z) - Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning [16.709358805587506]
臨床診断は、臨床医が証拠を集め、仮説を定め、代替的な説明に対してそれらをテストする複雑な推論プロセスである。
本稿では, 仮説テストの明確化とエビデンス・グラウンド化を図った臨床研修に触発された, 対物的マルチエージェント診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-29T19:14:26Z) - CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays [16.09644321057171]
胸部X線は胸部診断において中心的な役割を担い、その解釈は本質的に多段階の根拠に基づく推論を必要とする。
大規模視覚言語モデル(LVLM)は、診断的証拠に忠実に基づかない、もっともらしい応答を生成する。
本稿では,CXReasonAgentについて紹介する。CXReasonAgentは,大規模言語モデルと臨床診断ツールを統合した診断剤である。
論文 参考訳(メタデータ) (2026-02-26T17:51:21Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning [52.12425911708585]
Deep-DxSearchは、強化学習(RL)でエンドツーエンドに訓練されたエージェントRAGシステムである。
Deep-DxSearchでは,患者記録と信頼性のある医療知識情報を含む大規模医療検索コーパスを構築した。
実験により、エンドツーエンドのRLトレーニングフレームワークは、プロンプトエンジニアリングやトレーニングフリーなRAGアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-08-21T17:42:47Z) - Towards the Identifiability and Explainability for Personalized Learner
Modeling: An Inductive Paradigm [36.60917255464867]
本稿では,エンコーダ・デコーダモデルにインスパイアされた新しい応答効率応答パラダイムに基づく,識別可能な認知診断フレームワークを提案する。
診断精度を損なうことなく,ID-CDFが効果的に対処できることが示唆された。
論文 参考訳(メタデータ) (2023-09-01T07:18:02Z) - Towards Causality-Aware Inferring: A Sequential Discriminative Approach
for Medical Diagnosis [142.90770786804507]
医学診断アシスタント(MDA)は、疾患を識別するための症状を逐次調査する対話型診断エージェントを構築することを目的としている。
この研究は、因果図を利用して、MDAにおけるこれらの重要な問題に対処しようとする。
本稿では,他の記録から知識を引き出すことにより,非記録的調査に効果的に答える確率に基づく患者シミュレータを提案する。
論文 参考訳(メタデータ) (2020-03-14T02:05:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。