論文の概要: Text Over Image: Auditing Multimodal Robustness in Synthetic Medical Image Detection
- arxiv url: http://arxiv.org/abs/2606.25375v2
- Date: Wed, 01 Jul 2026 07:46:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.044716
- Title: Text Over Image: Auditing Multimodal Robustness in Synthetic Medical Image Detection
- Title(参考訳): テキストオーバーイメージ:合成医用画像検出におけるマルチモーダルロバスト性の検討
- Abstract要約: 我々は、画像記録インタフェースにおけるマルチモーダルロバスト性の監査として、合成医用画像検出を再構成する。
メタデータのコンテキストだけを変えることで、信頼性の判断を覆すことがわかりました。
そこで本研究では,モデルの再学習を伴わずに,予測時間短縮パイプラインを用いて前兆ショートカットの検出と中和を行う。
- 参考スコア(独自算出の注目度): 38.146353416394234
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid adoption of generative AI, synthetic medical images pose growing risks, including diagnostic deception and insurance fraud. Although prior work has explored vision-language model (VLM)-based synthetic image detection, these evaluations typically consider images in isolation. In clinical practice, however, images are interpreted alongside structured records and metadata, and VLMs are increasingly deployed under joint image-record inputs. We uncover a previously underexamined multimodal vulnerability: when given both modalities, VLMs may overweight record context in authenticity judgments, such that the same image receives different predictions solely due to changes in its accompanying text. This raises concerns about robustness in real-world deployment. To systematically characterize this effect, we reformulate synthetic medical image detection as an audit of multimodal robustness at the image-record interface and introduce a paired benchmark that holds the image fixed while swapping controlled metadata variants. Across multiple imaging modalities, we evaluate diverse open-weight and frontier API VLMs and find that changing the metadata context alone can flip authenticity judgments, with accuracy on authentic images dropping by 61.1% on average under an explicit AI-origin tag. We further propose an inference-time mitigation pipeline that detects and neutralizes provenance shortcuts without model retraining, substantially outperforming direct prompt-based suppression on the affected subset. Our benchmark provides a standardized tool for assessing and improving multimodal robustness beyond image-only settings. Code and data will be released upon acceptance.
- Abstract(参考訳): 生成AIの急速な採用により、合成医療画像は、診断詐欺や保険詐欺などのリスクが増大する。
従来の研究は視覚言語モデル(VLM)に基づく合成画像検出を研究してきたが、これらの評価は通常、分離された画像を考える。
しかし、臨床実践では、画像は構造化された記録やメタデータと共に解釈され、VLMは共同画像記録入力の下でますます展開される。
両モードが与えられた場合、VLMは、同一画像が付随するテキストの変化によってのみ異なる予測を受けるように、認証判定における記録コンテキストを過度に重くすることができる。
これにより、現実世界のデプロイメントにおける堅牢性に対する懸念が高まる。
この効果を体系的に特徴づけるために,画像記録インタフェースにおけるマルチモーダルロバスト性の監査として合成医用画像検出を再構成し,制御されたメタデータの変種を交換しながら画像の固定を保持するペアベンチマークを導入する。
複数の画像モダリティにまたがって、多様なオープンウェイトおよびフロンティアAPI VLMを評価し、メタデータコンテキストの変更だけでは、明示的なAI-オリジンタグの下で、認証画像の精度が平均61.1%低下することを確認する。
さらに,モデル再トレーニングを伴わずに前処理を検知し,中和する推論時間緩和パイプラインを提案し,影響したサブセットに対する直接的プロンプトベース抑制を著しく向上させる。
我々のベンチマークは、画像のみの設定を超えてマルチモーダルロバスト性を評価し改善するための標準化されたツールを提供する。
コードとデータは受理時にリリースされる。
関連論文リスト
- Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection [52.986874008247554]
本稿では,静的アンカーを入力条件付きビジュアルプロトタイプに置き換える言語フリーフレームワークReCAPを提案する。
ReCAPリセンターは、境界ゲート変調により、各画像の正常と異常なプロトタイプを分離した。
3つのセグメンテーションデータセットで最高のゼロショットレベルのAUROCと、24の複数ショット設定のうち23のゼロショットレベルのAUROCを達成する。
論文 参考訳(メタデータ) (2026-08-01T04:46:55Z) - Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement [27.443476988184994]
医療画像分類のためのマルチモーダル知識グラフを用いたケースアウェア推論フレームワークを提案する。
入力画像が与えられた場合、このメモリから類似したケースを適応的に検索し、対応するケース中心のサブグラフを抽出する。
複数の医用画像データセットの実験は、我々のアプローチが強いベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-21T14:29:20Z) - GenShield: Unified Detection and Artifact Correction for AI-Generated Images [65.11434977803509]
GenShieldは、診断から修復までのクローズドループでAIGI検出とアーティファクト修正を実行するフレームワークである。
大規模なアーティファクト-restored'ペアを備えた高品質データセットは、統一された評価パイプラインと共に構築される。
論文 参考訳(メタデータ) (2026-05-15T16:06:20Z) - More Images, More Problems? A Controlled Analysis of VLM Failure Modes [80.64323947730905]
大規模視覚言語モデル (LVLM) は目覚ましい能力を示しているが、複数の画像に対する理解と推論の能力は未解明のままである。
LVLMのマルチイメージ能力を厳格に評価する新しいベンチマークMIMICを紹介する。
論文 参考訳(メタデータ) (2026-01-12T18:45:13Z) - INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts [0.0]
現在の法医学システムは、現実世界の条件下で急速に低下している。
ほとんどの検出器は不透明物として機能し、なぜ画像が合成物としてフラグ付けされるのかについての知見はほとんど得られない。
本稿では,AI生成画像のロバスト検出と透過的説明のための統合フレームワークであるINSIGHTを紹介する。
論文 参考訳(メタデータ) (2025-11-27T11:43:50Z) - From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection [19.240335260177382]
AIFo(Agent-based Image Forensics)は、マルチエージェントコラボレーションによる人間の法医学的調査をエミュレートする、トレーニング不要のフレームワークである。
従来の手法とは異なり,本フレームワークでは,リバース画像検索,メタデータ抽出,事前学習型分類器,VLM解析など,一連の法医学的ツールを用いている。
我々の総合的な評価は6000のイメージに及び、現代の生成プラットフォームや多様なオンラインソースの画像を含む現実世界のシナリオに挑戦する。
論文 参考訳(メタデータ) (2025-10-31T18:36:49Z) - UltraAD: Fine-Grained Ultrasound Anomaly Classification via Few-Shot CLIP Adaptation [39.48115172323913]
視覚言語モデル(VLM)に基づく,異常な局所化ときめ細かい分類のためのアプローチであるUltraADを提案する。
UltraADは乳房の3つのデータセットで広く評価されており、病変のデータセットと微細な医学的分類の両方において最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2025-06-24T15:00:38Z) - Explainable Synthetic Image Detection through Diffusion Timestep Ensembling [30.298198387824275]
本稿では,複数の雑音の時間ステップでアンサンブルを訓練することにより,中間雑音画像の特徴を直接活用する合成画像検出手法を提案する。
人間の理解を深めるために,メートル法に基づく説明文生成と改良モジュールを導入する。
本手法は, 正解率98.91%, 正解率95.89%, 正解率95.89%, 正解率98.91%, 正解率95.89%である。
論文 参考訳(メタデータ) (2025-03-08T13:04:20Z) - Fréchet Radiomic Distance (FRD): A Versatile Metric for Comparing Medical Imaging Datasets [13.737058479403311]
Fr'echet Radiomic Distance (Fr'echet Radiomic Distance) という医療画像に適した新しい知覚基準を導入する。
FRDは、様々な医療画像の分野で、他の画像分布指標よりも優れていることを示す。
FRDは、低いサンプルサイズでの安定性や計算効率などの付加的な利点を提供する。
論文 参考訳(メタデータ) (2024-12-02T13:49:14Z) - Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical Images [68.42215385041114]
本稿では,CLIPモデルを用いた医用異常検出のための軽量な多レベル適応と比較フレームワークを提案する。
提案手法では,複数の残像アダプタを事前学習した視覚エンコーダに統合し,視覚的特徴の段階的向上を実現する。
医学的異常検出ベンチマーク実験により,本手法が現在の最先端モデルを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2024-03-19T09:28:19Z) - Improving Adversarial Robustness of Masked Autoencoders via Test-time
Frequency-domain Prompting [133.55037976429088]
BERTプリトレーニング(BEiT, MAE)を備えた視覚変換器の対向ロバスト性について検討する。
意外な観察は、MAEが他のBERT事前訓練法よりも敵の頑健さが著しく悪いことである。
我々は,MAEの対角的堅牢性を高めるための,シンプルで効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-08-20T16:27:17Z) - Learning to Exploit Temporal Structure for Biomedical Vision-Language
Processing [53.89917396428747]
視覚言語処理における自己教師あり学習は、画像とテキストのモダリティのセマンティックアライメントを利用する。
トレーニングと微調整の両方で利用できる場合、事前のイメージとレポートを明示的に説明します。
我々のアプローチはBioViL-Tと呼ばれ、テキストモデルと共同で訓練されたCNN-Transformerハイブリッドマルチイメージエンコーダを使用する。
論文 参考訳(メタデータ) (2023-01-11T16:35:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。