論文の概要: Examining the Vulnerability of Multi-Agent Medical Systems to Human Interventions for Clinical Reasoning
- arxiv url: http://arxiv.org/abs/2609.02191v1
- Date: Wed, 02 Sep 2026 06:54:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.126168
- Title: Examining the Vulnerability of Multi-Agent Medical Systems to Human Interventions for Clinical Reasoning
- Title(参考訳): 臨床診断のための多エージェント医療システムの人為的介入に対する脆弱性の検討
- Abstract要約: 障害点における人間の介入は、マルチエージェント医療システムの診断精度を変化させる可能性がある。
我々は、エージェントの推論が外部の影響に対して最も脆弱になったAIエージェントの会話において、障害点を瞬間として定義した。
本研究は、医師と患者との会話をシミュレートし、介入が推論と精度をどうシフトするかを計測した。
- 参考スコア(独自算出の注目度): 2.122439712004292
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human interventions at fault points can alter the diagnostic accuracy of multi-agent medical systems. We defined fault points as moments in AI agent conversations, in which an agent's reasoning became most vulnerable to external influence. Using the MedQA dataset, this study analyzed simulated doctor-patient conversations to measure how interventions shifted reasoning and accuracy. Correct intervention methods showed an improvement in baseline diagnostic accuracy of up to 40%, while incorrect or bias-related interventions degraded performance by up to 6% and increased diagnostic drift and uncertainty. Beyond performance changes, our analysis revealed behavioral similarities between cognitive biases in simulated agent environments and real-world clinical practice. Examples included premature closure and susceptibility to misleading cues. Overall, these findings demonstrate that identifying and guiding fault points with human interventions may provide a mechanism for improving diagnostic robustness in multi-agent medical systems.
- Abstract(参考訳): 障害点における人間の介入は、マルチエージェント医療システムの診断精度を変化させる可能性がある。
我々は、障害点をAIエージェントの会話の瞬間として定義し、エージェントの推論が外部の影響に対して最も脆弱になった。
本研究は、MedQAデータセットを用いて、医師と患者との会話をシミュレートし、介入が推論と精度をどうシフトするかを計測した。
正しい介入法は、基準線診断精度を最大40%向上させ、誤りまたはバイアス関連介入は、パフォーマンスを最大6%低下させ、診断ドリフトと不確実性を高めた。
評価結果から,シミュレーションエージェント環境における認知バイアスと実世界の臨床実践との行動的類似性を明らかにした。
例えば、早期閉鎖や誤解を招く手がかりへの感受性があった。
これらの結果から, 人的介入による障害点の同定と誘導が, 多エージェント医療システムにおける診断堅牢性向上のメカニズムを提供する可能性が示唆された。
関連論文リスト
- MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning [66.94527468532843]
2段階の診断推論フレームワークであるMultiDxを提案する。
まず Web 検索,SOAP 形式の症例,臨床症例データベースから知識を活用することにより,疑わしい診断と推論経路を生成する。
そして、マッチング、投票、および差分診断を通じて、複数のパースペクティブエビデンスを統合し、最終的な予測を生成する。
論文 参考訳(メタデータ) (2026-04-27T08:46:29Z) - Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning [16.709358805587506]
臨床診断は、臨床医が証拠を集め、仮説を定め、代替的な説明に対してそれらをテストする複雑な推論プロセスである。
本稿では, 仮説テストの明確化とエビデンス・グラウンド化を図った臨床研修に触発された, 対物的マルチエージェント診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-29T19:14:26Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - Evolving Diagnostic Agents in a Virtual Clinical Environment [75.59389103511559]
本稿では,大規模言語モデル(LLM)を強化学習を用いた診断エージェントとして訓練するためのフレームワークを提案する。
本手法は対話型探索と結果に基づくフィードバックによって診断戦略を取得する。
DiagAgentはDeepSeek-v3やGPT-4oなど、最先端の10のLLMを著しく上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:19:47Z) - MedAgentAudit: Diagnosing and Quantifying Collaborative Failure Modes in Medical Multi-Agent Systems [28.028343705313805]
大規模言語モデル(LLM)に基づくマルチエージェントシステムは,医療相談のシミュレーションにおいて有望であることを示す。
しかし、その評価は最終回答精度に制限されることが多い。
この慣行は、内部の協調プロセスを不透明な「ブラックボックス」として扱う
論文 参考訳(メタデータ) (2025-10-11T11:48:57Z) - Ensemble Deep Learning and LLM-Assisted Reporting for Automated Skin Lesion Diagnosis [2.9307254086347427]
皮膚科診断のためのAI統合を再定義する統合フレームワークを導入する。
第一に、アーキテクチャ的に多様である畳み込みニューラルネットワークの目的的にヘテロジニアスなアンサンブルは、相補的な診断の視点を提供する。
第2に、診断ワークフローに直接大きな言語モデル機能を組み込んで、分類出力を臨床的に意味のある評価に変換する。
論文 参考訳(メタデータ) (2025-10-05T08:07:33Z) - How to Evaluate Medical AI [4.23552814358972]
アルゴリズム診断(RPAD, RRAD)の相対精度とリコールについて紹介する。
RPADとRADは、AIの出力を単一の参照ではなく複数の専門家の意見と比較する。
大規模な研究によると、DeepSeek-V3のようなトップパフォーマンスモデルは、専門家のコンセンサスに匹敵する一貫性を達成している。
論文 参考訳(メタデータ) (2025-09-15T14:01:22Z) - Uncertainty-aware abstention in medical diagnosis based on medical texts [87.88110503208016]
本研究は,AI支援医療診断における信頼性の重要課題について論じる。
本研究は,診断に自信がなければ,診断システムによる意思決定の回避を可能にする選択予測手法に焦点をあてる。
我々は、選択予測タスクにおける信頼性を高めるための新しい最先端手法であるHUQ-2を紹介する。
論文 参考訳(メタデータ) (2025-02-25T10:15:21Z) - Enhancing Diagnostic Accuracy through Multi-Agent Conversations: Using Large Language Models to Mitigate Cognitive Bias [5.421033429862095]
臨床的意思決定における認知的バイアスは、診断の誤りや患者下結果に大きく寄与する。
本研究では,多エージェントフレームワークの利用を通じて,これらのバイアスを軽減するために,大規模言語モデルが果たす役割について検討する。
論文 参考訳(メタデータ) (2024-01-26T01:35:50Z) - Clinical Outcome Prediction from Admission Notes using Self-Supervised
Knowledge Integration [55.88616573143478]
臨床テキストからのアウトカム予測は、医師が潜在的なリスクを見落としないようにする。
退院時の診断,手術手順,院内死亡率,長期予測は4つの一般的な結果予測対象である。
複数の公開資料から得られた患者結果に関する知識を統合するために,臨床結果の事前学習を提案する。
論文 参考訳(メタデータ) (2021-02-08T10:26:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。