論文の概要: Extending ZACH-ViT to Robust Medical Imaging: Corruption and Adversarial Stress Testing in Low-Data Regimes
- arxiv url: http://arxiv.org/abs/2604.06099v1
- Date: Tue, 07 Apr 2026 17:11:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.95695
- Title: Extending ZACH-ViT to Robust Medical Imaging: Corruption and Adversarial Stress Testing in Low-Data Regimes
- Title(参考訳): ZACH-ViTをロバスト・メディカル・イメージングに拡張する:低データレジームにおける破壊と逆ストレステスト
- Authors: Athanasios Angelakis, Marta Gomez-Barrero,
- Abstract要約: ZACH-ViT (Zero-token Adaptive Compact Hierarchical Vision Transformer) は、医療画像用のコンパクトな置換不変ビジョントランスである。
本稿では,ZACH-ViTの強靭性に着目した最初の拡張法について述べる。
- 参考スコア(独自算出の注目度): 0.23166812624868952
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The recently introduced ZACH-ViT (Zero-token Adaptive Compact Hierarchical Vision Transformer) formalized a compact permutation-invariant Vision Transformer for medical imaging and argued that architectural alignment with spatial structure can matter more than universal benchmark dominance. Its design was motivated by the observation that positional embeddings and a dedicated class token encode fixed spatial assumptions that may be suboptimal when spatial organization is weakly informative, locally distributed, or variable across biomedical images. The foundational study established a regime-dependent clean performance profile across MedMNIST, but did not examine robustness in detail. In this work, we present the first robustness-focused extension of ZACH-ViT by evaluating its behavior under common image corruptions and adversarial perturbations in the same low-data setting. We compare ZACH-ViT with three scratch-trained compact baselines, ABMIL, Minimal-ViT, and TransMIL, on seven MedMNIST datasets using 50 samples per class, fixed hyperparameters, and five random seeds. Across the benchmark, ZACH-ViT achieves the best overall mean rank on clean data (1.57) and under common corruptions (1.57), indicating a favorable balance between baseline predictive performance and robustness to realistic image degradation. Under adversarial stress, all models deteriorate substantially; nevertheless, ZACH-ViT remains competitive, ranking first under FGSM (2.00) and second under PGD (2.29), where ABMIL performs best overall. These results extend the original ZACH-ViT narrative: the advantages of compact permutation-invariant transformers are not limited to clean evaluation, but can persist under realistic perturbation stress in low-data medical imaging, while adversarial robustness remains an open challenge for all evaluated models.
- Abstract(参考訳): 最近発表されたZACH-ViT (Zero-token Adaptive Compact Hierarchical Vision Transformer) は、医療画像用のコンパクトな置換不変ビジョントランスを形式化し、空間構造とのアーキテクチャアライメントは、普遍的なベンチマーク優位以上のものになりうると主張した。
その設計は、位置埋め込みと専用クラストークンが、空間的組織が弱情報的、局所的分散的、あるいは生物医学的イメージにまたがる変数である場合の、固定された空間的仮定を符号化する観察によって動機づけられた。
基礎研究は、MedMNIST全体にわたる体制依存のクリーンパフォーマンスプロファイルを確立したが、詳細は調査しなかった。
本研究では,ZACH-ViTの強靭性に焦点をあてた最初の拡張について,その動作を共通画像の劣化と,同じ低データ環境下での逆摂動で評価した。
ABMIL, Minimal-ViT, TransMILの3つのスクラッチトレーニングされたコンパクトベースラインをクラス毎50サンプル, 固定ハイパーパラメータ, 5つのランダムシードを用いて7つのMedMNISTデータセットで比較した。
ベンチマーク全体を通して、ZACH-ViTはクリーンデータ(1.57)と一般的な汚職(1.57)の総合的な平均ランクを達成し、ベースライン予測性能と現実的な画像劣化に対するロバスト性の間の良好なバランスを示す。
ZACH-ViTはFGSM (2.00) とPGD (2.29) の2位にランクされ、AMMILは全体として最高の成績を収めている。
これらの結果は、ZACH-ViTの物語を拡張している: コンパクトな置換不変変換器の利点は、クリーンな評価に限らず、低データ医療画像において現実的な摂動ストレスの下で持続することができる。
関連論文リスト
- Learning to Synergize Semantic and Geometric Priors for Limited-Data Wheat Disease Segmentation [51.06355116973389]
本研究では,小麦病のセグメンテーションを病種特異的な意味認識と疾患境界の局所化の複合的課題として扱う枠組みを提案する。
我々の中核的な洞察は、事前訓練されたDINOv2は、出現シフトを処理するために、堅牢なカテゴリ認識セマンティックスを提供します。
SGPer は,コムギ病と臓器分画のベンチマークにおいて,常に最先端のパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-04-07T04:19:39Z) - Improving Automated Wound Assessment Using Joint Boundary Segmentation and Multi-Class Classification Models [1.1432909951914676]
本研究は, 創境界セグメンテーション (WBS) と創分類 (WC) を同時に行う YOLOv11 に基づく深層学習モデルを提案する。
その結果、複雑な背景に対するモデルの堅牢性とクラス内変動性が高いことが確認できた。
論文 参考訳(メタデータ) (2026-03-28T16:11:31Z) - VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors [49.39553550491549]
VFMReconは, シーンレベルの神経再構成において, スケール一貫性の要求を満たすトランスファー可能なVFMプリエントをブリッジする最初の試みである。
具体的には、まず、マルチビュースケールコヒーレンスを復元する軽量なスケールアライメントステージを導入する。
次に、トレーニング済みのVFM機能を、軽量なタスク固有アダプタを介して、ニューラルボリューム再構築パイプラインに統合する。
論文 参考訳(メタデータ) (2026-03-13T05:00:44Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - ZACH-ViT: Regime-Dependent Inductive Bias in Compact Vision Transformers for Medical Imaging [0.0]
ZACH-ViTはコンパクトなビジョン変換器で、位置埋め込みとトークンの両方を取り除きます。
特に「ゼロトークン」とは、専用の[NIST]アグリゲーショントークンと位置埋め込みを取り除くことを指す。
ZACH-ViTは、サブ秒の推論時間を維持しながら競合性能を達成する。
論文 参考訳(メタデータ) (2026-02-20T01:38:59Z) - VesSAM: Efficient Multi-Prompting for Segmenting Complex Vessel [68.24765319399286]
本稿では,2次元血管セグメンテーションに適した,強力で効率的なフレームワークであるVesSAMを提案する。
VesSAMは、(1)局所的なテクスチャ機能を強化する畳み込みアダプタ、(2)解剖学的プロンプトを融合するマルチプロンプトエンコーダ、(3)ジャグアーティファクトを減らす軽量マスクデコーダを統合する。
VesSAMは、最先端のPEFTベースのSAMを10%以上のDiceと13%のIoUで一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-02T15:47:05Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z) - ZACH-ViT: A Zero-Token Vision Transformer with ShuffleStrides Data Augmentation for Robust Lung Ultrasound Classification [0.7495002546468839]
本稿では,ZACH-ViT (Zero- parameter Adaptive Compact Hierarchical Vision Transformer, 0.25 M-Hierarchical Vision Transformer)を導入する。
ZACH-ViTは、95人の重病患者の380のLUSビデオで、9つの最先端のベースラインに対して評価された。
ROC-AUC (0.80と0.79) は感度のバランス(0.60)と特異性(0.91)で最高評価と試験を達成し、全ての競合するモデルは簡単な分類に崩壊した。
論文 参考訳(メタデータ) (2025-10-20T15:26:38Z) - The 1st Solution for CARE Liver Task Challenge 2025: Contrast-Aware Semi-Supervised Segmentation with Domain Generalization and Test-Time Adaptation [23.156209918252838]
CoSSeg-TTA は nnU-Netv2 上に構築された GED4 (Gd-EOB-DTPA 拡張肝胆道相MRI) のコンパクトセグメンテーションフレームワークである。
ドメイン適応モジュールは、ランダム化されたヒストグラムスタイルの外観伝達関数とトレーニング可能なコントラスト対応ネットワークを組み込んで、ドメインの多様性を強化し、センター間の変動を緩和する。
論文 参考訳(メタデータ) (2025-10-05T15:18:53Z) - Rethinking Semi-Supervised Medical Image Segmentation: A
Variance-Reduction Perspective [51.70661197256033]
医用画像セグメンテーションのための階層化グループ理論を用いた半教師付きコントラスト学習フレームワークARCOを提案する。
まず、分散還元推定の概念を用いてARCOを構築することを提案し、特定の分散還元技術が画素/ボクセルレベルのセグメンテーションタスクにおいて特に有用であることを示す。
5つの2D/3D医療データセットと3つのセマンティックセグメンテーションデータセットのラベル設定が異なる8つのベンチマークで、我々のアプローチを実験的に検証する。
論文 参考訳(メタデータ) (2023-02-03T13:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。