論文の概要: Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI
- arxiv url: http://arxiv.org/abs/2608.01462v1
- Date: Sun, 02 Aug 2026 19:38:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.248265
- Title: Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI
- Title(参考訳): ラウドかサイレントか : マルチモーダル・クリニカルAIにおけるモーダリティ・フェール分析のための再利用可能なフレームワーク
- Abstract要約: 2つの疑問は、どのモダリティに責任があるか、そしてモデルがモダリティを落として大音量または無音で失敗するかである。
モデルに依存しないモダリティ・欠陥の枠組みとして、Nのモダリティの埋め込み、マスクを意識したプローブ、ラベルを与えられた場合、例ごとの故障分類を返します。
モダリティ当たりのVSサイレントレートを報告し、3つのモダリティ相補性行列にスケールする。
- 参考スコア(独自算出の注目度): 3.7524666944787644
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Multimodal clinical models are usually judged on accuracy with every modality present, but deployment removes modalities; an echocardiogram is often unavailable where an ECG is routine. Two questions then matter beyond the size of the accuracy loss: which modality was responsible, and whether the model fails loudly or silently once that modality is dropped. The distinction is per-example and modality-level, and is separate from post-hoc feature attribution (e.g. SHAP). Models are replaced often; the evaluation that answers these questions is reused. We present a model-agnostic modality-failure framework: given N modality embeddings, any mask-aware probe, and labels, it returns a per-example failure taxonomy, a per-modality complementarity matrix that attributes error to modalities, and a loud-vs-silent dropout profile separating monitorable failures from those that pass unflagged far from the decision boundary, using only deployment-observable signals. We release it as a small, unit-tested harness and validate it against planted ground truth. Across seeds it recovers that planted modality dominance and complementary subset, reports per-modality loud-vs-silent rates, and scales to a three-modality complementarity matrix; because the planted structure is known by construction, this validates recovery of per-example attribution rather than clinical performance. We then instantiate the framework on frozen EchoJEPA and HuBERT-ECG embeddings for LVEF and the EF <= 40% HFrEF gate over a paired MIMIC-IV cohort, where on the held-out test split (n = 245) dropping echo nearly doubles error. The narrow echo-to-ECG overlap that bounds cohort size is itself a deployment finding for cardiac foundation models. All of our work can be found at https://github.com/criticaldata/PRIMED-AI.
- Abstract(参考訳): マルチモーダルな臨床モデルは通常、すべてのモダリティが存在するかどうかの正確性に基づいて判断されるが、デプロイはモダリティを除去する。
2つの疑問は、どのモダリティが原因なのか、そしてモデルがモダリティを落とせば大音量または無音で失敗するのかという、精度損失のサイズを超えたものである。
この区別は、各例とモダリティレベルであり、ポストホック特徴属性(例えばSHAP)とは別物である。
モデルは頻繁に置き換えられ、これらの質問に答える評価は再利用されます。
我々は、Nのモダリティ埋め込み、マスク対応プローブ、ラベルが与えられた場合、それは、例ごとの故障分類、モダリティによるエラーを属性とするモダリティごとの相補性行列、および、監視可能な障害を決定境界から遠く離れた領域から切り離す大きなvs-サイレントなドロップアウトプロファイルを返却する。
私たちはそれを小型で単体テストのハーネスとしてリリースし、植えた地面の真実に対して検証します。
種子全体では、モダリティ支配と相補的なサブセットを植え付け、モダリティごとのラウドvs-サイレントレートを報告し、3つのモダリティ相補性マトリックスにスケールする。
次に,LVEF と EF <= 40% HFrEF ゲートをペアMIMIC-IVコホート上で凍結した EchoJEPA および HuBERT-ECG 埋め込みのフレームワークをインスタンス化する。
コホートサイズの狭いエコー-心電図の重なりは、それ自体が心臓基礎モデルの配置発見である。
私たちの作業はすべて、https://github.com/ criticaldata/PRIMED-AIで確認できます。
関連論文リスト
- FedCoRe: Target-Adaptive Completion for Missing Modalities in Healthcare Federated Learning [3.616090348351236]
統合マルチモーダルモデルでは、病院はEHR、胸部X線写真、ECGへのアクセスが異なるが、全てのサイトがあらゆるモダリティを持っていると仮定することが多い。
シミュレーションFLクライアントを用いたMIMIC由来の呼吸劣化タスクについて検討し,FedCoReを紹介する。
FedCoReは、合成ECGやCXR画像を生成するのではなく、表現空間またはロジット空間の補正を学ぶ。
論文 参考訳(メタデータ) (2026-08-18T20:45:23Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Variational Rectification Inference for Learning with Noisy Labels [74.85528327499662]
損失関数の適応的補正を定式化するために, 変分補正推論(VRI)を提案する。
VRIは、補正ベクトルを潜在変数として扱うことによって階層ベイズとして構成される。
VRIで変分項を導入することにより、条件付き後部を正確に推定し、ディラックデルタ関数への崩壊を避ける。
論文 参考訳(メタデータ) (2026-03-18T01:25:08Z) - Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis [14.922065513695294]
Resp-Agent(Resp-Agent)は、アクティブアドリキュラムエージェント(Thinker-A$2$CA)によって編成された自律型マルチモーダルシステムである。
表現ギャップに対処するため,EHRデータをストラテジックグローバルアテンションを介して音声トークンで織り込むModality-Weaving Diagnoserを導入する。
データギャップに対処するために,テキストのみのLarge Language Model (LLM) をモダリティインジェクションにより適応させるフローマッチングジェネレータを設計する。
論文 参考訳(メタデータ) (2026-02-16T14:48:24Z) - AnyAD: Unified Any-Modality Anomaly Detection in Incomplete Multi-Sequence MRI [16.227149608640477]
本稿では,任意のMRIモダリティ・アベイラビリティの下で,ロバストな異常検出と局所化を行う,Any-Modality 異常検出フレームワークを提案する。
Intrinsic Normal Prototypes (INPs) extractorとINP-guided Decoderを導入し、正常な解剖学的パターンのみを再構成し、異常な偏差を自然に増幅する。
我々のアプローチは、7つのモダリティの組み合わせにまたがって、最先端の産業と医療のADベースラインを一貫して超越し、より優れた一般化を実現している。
論文 参考訳(メタデータ) (2025-12-24T16:16:09Z) - Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech [51.14752758616364]
音声による抑うつ検出 (SDD) は、従来の臨床評価に代わる有望で非侵襲的な代替手段である。
HAREN-CTCは,マルチタスク学習フレームワーク内でのクロスアテンションを用いて,多層SSL機能を統合した新しいアーキテクチャである。
このモデルはDAIC-WOZで0.81、MODMAで0.82の最先端マクロF1スコアを達成し、両方の評価シナリオで先行手法より優れている。
論文 参考訳(メタデータ) (2025-10-05T09:32:12Z) - Enhanced Masked Image Modeling to Avoid Model Collapse on Multi-modal MRI Datasets [6.3467517115551875]
マスク付き画像モデリング(MIM)は、ラベルなしデータの利用において有望であることを示す。
モデル崩壊を, 完全崩壊と次元崩壊の2つのタイプで解析し, 対処する。
HMPとPBTモジュールを併用した拡張MIM(E-MIM)を構築し,マルチモーダルMRIのモデル崩壊を回避する。
論文 参考訳(メタデータ) (2024-07-15T01:11:30Z) - A Study of Dropout-Induced Modality Bias on Robustness to Missing Video
Frames for Audio-Visual Speech Recognition [53.800937914403654]
AVSR(Advanced Audio-Visual Speech Recognition)システムは、欠落したビデオフレームに敏感であることが観察されている。
ビデオモダリティにドロップアウト技術を適用することで、フレーム不足に対するロバスト性が向上する一方、完全なデータ入力を扱う場合、同時に性能損失が発生する。
本稿では,MDA-KD(Multimodal Distribution Approximation with Knowledge Distillation)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-07T06:06:55Z) - Cross-Attention is Not Enough: Incongruity-Aware Dynamic Hierarchical
Fusion for Multimodal Affect Recognition [69.32305810128994]
モダリティ間の同調性は、特に認知に影響を及ぼすマルチモーダル融合の課題となる。
本稿では,動的モダリティゲーティング(HCT-DMG)を用いた階層型クロスモーダルトランスを提案する。
HCT-DMG: 1) 従来のマルチモーダルモデルを約0.8Mパラメータで上回り、2) 不整合が認識に影響を及ぼすハードサンプルを認識し、3) 潜在レベルの非整合性をクロスモーダルアテンションで緩和する。
論文 参考訳(メタデータ) (2023-05-23T01:24:15Z) - Modality Completion via Gaussian Process Prior Variational Autoencoders
for Multi-Modal Glioma Segmentation [75.58395328700821]
本稿では,患者スキャンに欠落するサブモダリティを1つ以上のインプットするために,MGP-VAE(Multi-modal Gaussian Process Prior Variational Autoencoder)を提案する。
MGP-VAEは、変分オートエンコーダ(VAE)に先立ってガウス過程(GP)を利用して、被験者/患者およびサブモダリティ相関を利用することができる。
4つのサブモダリティのうち2つ、または3つが欠落している脳腫瘍に対するMGP-VAEの適用性を示す。
論文 参考訳(メタデータ) (2021-07-07T19:06:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。