論文の概要: Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs
- arxiv url: http://arxiv.org/abs/2607.24371v1
- Date: Mon, 27 Jul 2026 12:45:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.42065
- Title: Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs
- Title(参考訳): 医療連携のためのクローズドループ検証-リペア:臨床LLMにおけるスキーマ適合性に関する多モデル研究
- Authors: Jianru Shen,
- Abstract要約: Qwen2.5 7B, Llama 3.1 8B, Gemma2 9Bの3つのオープンソースモデルを評価する。
スキーマ非コンプライアンスは3つのモデルファミリ間で一貫性があり、ベースラインコンプライアンス率は85.9から91.6%である。
バリデーション・リペア・フレームワークは、モデル全体で98.4から99.4%の範囲で、全体的なコンプライアンスを99.0パーセント達成している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Healthcare interoperability requires AI systems to produce structured outputs conforming to standardized schemas including ICD-10 for diagnostic coding, CPT for procedure billing, and HL7 FHIR for data exchange. While large language models demonstrate clinical reasoning capabilities, their integration into electronic health record systems faces a critical barrier: schema noncompliance. We evaluate three open-source models, Qwen2.5 7B, Llama 3.1 8B, and Gemma2 9B, via local deployment across 320 clinical scenarios spanning ten medical specialties, yielding 960 model-scenario pairs assessed under paired baseline and validation-repair conditions. First, schema noncompliance is consistent across the three model families, with baseline compliance rates ranging from 85.9 to 91.6 percent despite varying architectures and training data, suggesting shared gaps in medical training corpora rather than model-specific limitations. Second, 96 percent of validator-detected failures are representation-level format violations such as alternative medical abbreviations and code prefixes, indicating models follow clinical writing conventions but lack awareness of healthcare IT standards. Third, the validation-repair framework achieves 99.0 percent overall compliance, ranging from 98.4 to 99.4 percent across models, with most errors resolving within one or two iterations. Exact McNemar p-values below 0.001 and absolute improvements of 7.8 to 12.5 percentage points across model sizes confirm statistical significance. These results support closed-loop validation-repair as an effective system-level safeguard for healthcare interoperability, improving schema-level readiness for downstream clinical system integration.
- Abstract(参考訳): 医療の相互運用性には、診断コーディングのためのICD-10、手続き請求のためのCPT、データ交換のためのHL7 FHIRなど、標準化されたスキーマに準拠した構造化出力を生成するAIシステムが必要である。
大きな言語モデルは臨床推論能力を示しているが、電子健康記録システムへの統合は、スキーマ非準拠という重要な障壁に直面している。
我々は,Qwen2.5 7B,Llama 3.1 8B,Gemma2 9Bの3つのオープンソースモデルを,10の専門分野にまたがる320の臨床シナリオに局所的な展開を通じて評価した。
まず、スキーマの非コンプライアンスは3つのモデルファミリ間で一貫性があり、アーキテクチャやトレーニングデータが異なるにもかかわらず、ベースラインのコンプライアンス率は85.9から91.6%の範囲であり、モデル固有の制限ではなく、医療訓練コーパスの共有ギャップを示唆している。
第二に、バリデータ検出障害の96%は、代替医療の略語やコードプレフィックスのような表現レベルのフォーマット違反であり、モデルが臨床書記規則に従うが、医療IT標準への認識が欠如していることを示している。
第3に、バリデーション・リペア・フレームワークは、モデル全体で98.4から99.4%の範囲で、全体的なコンプライアンスを99.0パーセント達成している。
マクネマールのp-値は0.001未満であり、モデルサイズで7.8から12.5ポイントの絶対的な改善は統計的に有意である。
これらの結果は、医療の相互運用性のための効果的なシステムレベルの安全ガードとして、クローズドループバリデーション・リペアをサポートし、下流臨床システム統合のためのスキーマレベルの準備性を改善した。
関連論文リスト
- MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning [7.000170880015254]
医療領域における最初のプロセスレベルの報酬モデルベンチマークであるMedPRMBenchを提案する。
臨床共鳴ブループリント(CRB)に基づく3相パイプラインで構築される。
ベンチマークには6500の質問と13,000の推論チェーン、113,910のステップレベルラベル、トレーニング用の6,879の質問が含まれている。
論文 参考訳(メタデータ) (2026-04-19T06:44:07Z) - HiPath: Hierarchical Vision-Language Alignment for Structured Pathology Report Prediction [5.151955122293638]
HiPathは、凍結したUNI2とQwen3のバックボーン上に構築された軽量な病理ビジョン言語フレームワークである。
HiPathは749Kのリアル・ワールド・チャイニーズ・サイコロジー・ケースで訓練されており、68.9%の厳格さと74.7%の臨床的に許容できる精度を97.3%の安全率で達成している。
論文 参考訳(メタデータ) (2026-03-20T13:58:02Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - From Performance to Practice: Knowledge-Distilled Segmentator for On-Premises Clinical Workflows [8.438143117044795]
本稿では,高パフォーマンスセグメンテーションモデルを拡張性のあるコンパクトな学生モデルファミリに変換するためのデプロイメント指向フレームワークを提案する。
提案手法は,既存の臨床システムとのアーキテクチャ互換性を維持しつつ,体系的な容量削減を実現している。
その結果、知識蒸留は、研究グレードのセグメンテーションモデルを保守可能で展開可能なコンポーネントに変換するための実用的で信頼性の高い経路を提供することを示した。
論文 参考訳(メタデータ) (2026-01-14T05:44:30Z) - Hybrid-Code: A Privacy-Preserving, Redundant Multi-Agent Framework for Reliable Local Clinical Coding [0.0]
クラウドベースのLarge Language Models(LLM)を使用した臨床コーディング自動化は、プライバシのリスクとレイテンシのボトルネックを引き起こす。
局所的な臨床コーディングのためのハイブリッド・ニューロシンボリック・マルチエージェント・フレームワークであるHybrid-Codeを導入する。
論文 参考訳(メタデータ) (2025-12-26T02:27:36Z) - Colorectal Cancer Histopathological Grading using Multi-Scale Federated Learning [0.0]
本稿では,大腸癌診断のための拡張性,プライバシ保護型フェデレーション学習フレームワークを提案する。
我々のフレームワークは全体の83.5%の精度を達成し、同等の集中型モデルよりも優れています。
提案されたモジュールパイプラインは、デジタル病理のためのデプロイ可能でプライバシに配慮した臨床AIに向けた基礎的なステップを確立する。
論文 参考訳(メタデータ) (2025-11-05T18:18:09Z) - Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models [57.73472878679636]
Med-RewardBenchは、医療報酬モデルと審査員を評価するために特別に設計された最初のベンチマークである。
Med-RewardBenchは、13の臓器系と8の臨床部門にまたがるマルチモーダルデータセットを特徴としている。
厳格な3段階のプロセスは、6つの臨床的に重要な次元にわたる高品質な評価データを保証する。
論文 参考訳(メタデータ) (2025-08-29T08:58:39Z) - Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models [52.2001050216955]
既存の方法は、モデル構造を調整したり、高品質なデータで微調整したり、好みの微調整によって、医療ビジョン言語モデル(MedVLM)の性能を向上させることを目的としている。
我々は,MedVLMと臨床専門知識の連携を図るために,Expert-Controlled-Free Guidance (Expert-CFG) という,ループ内のエキスパート・イン・ザ・ループフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-12T09:03:30Z) - An Agentic System for Rare Disease Diagnosis with Traceable Reasoning [69.46279475491164]
大型言語モデル(LLM)を用いた最初のまれな疾患診断エージェントシステムであるDeepRareを紹介する。
DeepRareは、まれな疾患の診断仮説を分類し、それぞれに透明な推論の連鎖が伴う。
このシステムは2,919の疾患に対して異常な診断性能を示し、1013の疾患に対して100%の精度を達成している。
論文 参考訳(メタデータ) (2025-06-25T13:42:26Z) - Towards Reliable Medical Image Segmentation by Modeling Evidential Calibrated Uncertainty [57.023423137202485]
医用画像のセグメンテーションの信頼性に関する懸念が臨床医の間で続いている。
本稿では,医療画像セグメンテーションネットワークにシームレスに統合可能な,実装が容易な基礎モデルであるDEviSを紹介する。
主観的論理理論を活用することで、医用画像分割の確率と不確実性を明示的にモデル化する。
論文 参考訳(メタデータ) (2023-01-01T05:02:46Z) - Advancing COVID-19 Diagnosis with Privacy-Preserving Collaboration in
Artificial Intelligence [79.038671794961]
我々はUCADI(Unified CT-COVID AI Diagnostic Initiative)を立ち上げ、各ホスト機関でAIモデルを分散的にトレーニングし、独立して実行することができる。
本研究は,中国とイギリスに所在する23の病院で採取した3,336例の胸部CT9,573例について検討した。
論文 参考訳(メタデータ) (2021-11-18T00:43:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。