論文の概要: MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction
- arxiv url: http://arxiv.org/abs/2606.25651v2
- Date: Fri, 26 Jun 2026 15:03:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 13:57:07.323706
- Title: MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction
- Title(参考訳): MedGuards:信頼性の高い医療エラー検出・修正のためのマルチエージェントシステム
- Abstract要約: MedGuardsは、医療エラーの検出と修正をマルチエージェントのインコンテキスト学習タスクとして扱う新しいフレームワークである。
特別エージェントは別々にエラーを検出し、ローカライズし、修正する一方、信頼誘導仲裁機構は不一致を解消する。
我々の目標は、現実世界の医療アプリケーションにおいて、より安全な大規模言語モデルのデプロイを可能にすることです。
- 参考スコア(独自算出の注目度): 7.8939854491604455
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) are increasingly deployed in healthcare settings, accurate error detection and correction in generated or existing text becomes critical, as even minor mistakes can pose risks to patient safety. Existing methods for error detection and correction, including automated checks and heuristic-based approaches, do not generalize well across unseen datasets. In this paper, we propose MedGuards as a medical safety guardrail, which is a new framework that treats medical error detection and correction as a multi-agent in-context learning task. Specialized agents separately detect, localize, and correct errors, while a confidence-guided arbitration mechanism resolves disagreements using reasoning traces and confidence scores. This design enhances interpretability, robustness, and adaptability, without requiring additional training of the base LLMs. Additionally, we introduce the Keyword-Prioritized Correction Score (KPCS), a new evaluation metric that considers whether critical keywords within the reference text are generated correctly, providing a more comprehensive assessment than conventional metrics. Experiments across four multilingual medical datasets consisting of clinical notes demonstrate significant improvements by the proposed framework across several metrics and models. Our aim is to enable safer deployment of LLMs in real-world healthcare applications. For reproducibility, we make our code publicly available at https://github.com/congboma/MedGuards.
- Abstract(参考訳): 大きな言語モデル(LLM)が医療環境にますます導入されるにつれて、生成されたテキストや既存のテキストの正確なエラー検出と修正が重要になる。
自動チェックやヒューリスティックベースのアプローチを含む既存のエラー検出と修正の方法は、目に見えないデータセット間でうまく一般化しない。
本稿では,MedGuardsを医療安全ガードレールとして提案し,医療ミスの検出と修正をマルチエージェント・イン・コンテクスト学習タスクとして扱う新しいフレームワークを提案する。
特別エージェントは別々にエラーを検出し、ローカライズし、正解する一方、信頼誘導仲裁機構は、推論トレースと信頼スコアを用いて不一致を解消する。
この設計は、基本LLMのさらなる訓練を必要とせず、解釈可能性、堅牢性、適応性を向上させる。
さらに,キーワード・プリオライト化補正スコア (KPCS) を導入し,参照テキスト内の重要なキーワードが正しく生成されているかどうかを考慮し,従来の指標よりも総合的な評価を行う。
臨床ノートからなる4つの多言語医療データセットを対象とした実験は、いくつかの指標とモデルにまたがって提案されたフレームワークによる大幅な改善を示す。
我々の目標は、現実の医療アプリケーションにLLMを安全に展開できるようにすることです。
再現性については、https://github.com/congboma/MedGuards.comで公開しています。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety [1.4517170578045737]
クリティカルな意味は、エラーは多言語システムの信頼性、公平性、安全性を損なう可能性があるということだ。
本研究では,命令調整型大規模言語モデル(LLM)を用いて,そのような誤りを検出する能力について検討する。
その結果, モデルスケーリングと適応戦略(ゼロショット, 少数ショット, 微調整)が一貫した改善をもたらすことがわかった。
論文 参考訳(メタデータ) (2026-02-11T23:47:39Z) - Toward Reliable Clinical Coding with Language Models: Verification and Lightweight Adaptation [3.952186976672079]
本稿では,高速エンジニアリングや小型微調整を含む軽量な介入により,探索手法の計算オーバーヘッドを伴わずに精度を向上できることを示す。
階層的なニアミスエラーに対処するために,単体タスクとパイプラインコンポーネントの両方に臨床コード検証を導入する。
論文 参考訳(メタデータ) (2025-10-08T23:50:58Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models [52.2001050216955]
既存の方法は、モデル構造を調整したり、高品質なデータで微調整したり、好みの微調整によって、医療ビジョン言語モデル(MedVLM)の性能を向上させることを目的としている。
我々は,MedVLMと臨床専門知識の連携を図るために,Expert-Controlled-Free Guidance (Expert-CFG) という,ループ内のエキスパート・イン・ザ・ループフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-12T09:03:30Z) - GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation [7.838068874909676]
Granular Explainable Multi-Agent Score (GEMA-Score)は、大規模言語モデルに基づくマルチエージェントワークフローを通じて、客観的および主観的評価を行う。
GEMA-Scoreは、公開データセット上での人間の専門家評価と最も高い相関を達成している。
論文 参考訳(メタデータ) (2025-03-07T11:42:22Z) - PromptMind Team at MEDIQA-CORR 2024: Improving Clinical Text Correction with Error Categorization and LLM Ensembles [0.0]
本稿では,医療従事者による臨床ノートの誤り検出と修正を含むMEDIQA-CORR共有タスクへのアプローチについて述べる。
我々は,事実情報と信頼できない情報の両方を含む膨大なインターネットデータのコーパスに基づいて訓練された大規模言語モデルの能力を評価することを目的としている。
論文 参考訳(メタデータ) (2024-05-14T07:16:36Z) - WangLab at MEDIQA-CORR 2024: Optimized LLM-based Programs for Medical Error Detection and Correction [5.7931394318054155]
3つのサブタスクすべてでトップパフォーマンスを達成したアプローチを提示する。
微妙な誤りを含むMSデータセットに対して,検索に基づくシステムを開発した。
UWデータセットでは、より現実的な臨床ノートを反映して、エラーを検出し、ローカライズし、修正するためのモジュールのパイプラインを作成しました。
論文 参考訳(メタデータ) (2024-04-22T19:31:45Z) - Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding [72.18719355481052]
MRG(Messical Report Grounding)と呼ばれる新しい課題について紹介する。
MRGは医療報告から診断フレーズとその対応する接地箱を直接エンドツーエンドで識別することを目的としている。
マルチモーダルな大規模言語モデルを用いて診断フレーズを予測する,堅牢で信頼性の高いフレームワークである uMedGround を提案する。
論文 参考訳(メタデータ) (2024-04-10T07:41:35Z) - Improving Multiple Sclerosis Lesion Segmentation Across Clinical Sites:
A Federated Learning Approach with Noise-Resilient Training [75.40980802817349]
深層学習モデルは、自動的にMS病変を分節する約束を示しているが、正確な注釈付きデータの不足は、この分野の進歩を妨げている。
我々は,MS病変の不均衡分布とファジィ境界を考慮したDecoupled Hard Label Correction(DHLC)戦略を導入する。
また,集約型中央モデルを利用したCELC(Centrally Enhanced Label Correction)戦略も導入した。
論文 参考訳(メタデータ) (2023-08-31T00:36:10Z) - Self-Verification Improves Few-Shot Clinical Information Extraction [73.6905567014859]
大規模言語モデル (LLMs) は、数発のテキスト内学習を通じて臨床キュレーションを加速する可能性を示している。
正確性や解釈可能性に関する問題、特に健康のようなミッションクリティカルな領域ではまだ苦戦している。
本稿では,自己検証を用いた汎用的な緩和フレームワークについて検討する。このフレームワークはLLMを利用して,自己抽出のための証明を提供し,その出力をチェックする。
論文 参考訳(メタデータ) (2023-05-30T22:05:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。