論文の概要: Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
- arxiv url: http://arxiv.org/abs/2607.17693v1
- Date: Mon, 20 Jul 2026 08:41:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.5532
- Title: Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
- Title(参考訳): トレーニング不要なテスト時間医用画像分割のための記憶支援相乗的適応法
- Abstract要約: テスト時間適応(TTA)は、未ラベルのターゲットデータを持つモデルを推論時に適応させることにより、分散シフトを軽減することを目的としている。
医用画像セグメンテーションのための新しいトレーニングフリーTTAフレームワーク, メモリ・サポーブド・シナジスティック・アダプテーション (MSSA) を提案する。
- 参考スコア(独自算出の注目度): 45.4173998742666
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Test-time adaptation (TTA) aims to mitigate distribution shifts by adapting models with unlabeled target data at inference time. While TTA with vision-language models (VLMs) has shown promising results in classification, extending it to medical image segmentation remains challenging. In this setting, the adaptation gains from optimizing on VLM-generated predictions are often outweighed by the degradation to the VLM's strong pretrained features caused by noisy, update-driven learning, resulting in limited and unstable improvements. We therefore propose Memory-Supported Synergistic Adaptation (MSSA), a novel training-free TTA framework for medical image segmentation. Without updating model parameters, MSSA dynamically selects reliable image-text predictions to construct an online memory, uses them as text-guided semantic priors, and couples them with cross-image structural alignment for robust adaptation. Specifically, MSSA consists of (i) a noise-aware memory construction module that filters and stabilizes cross-modal predictions, and (ii) a relevance-driven prototype alignment module that aligns the target sample with structurally consistent memory samples and their reliable predictions to improve adaptation. Extensive experiments on multiple medical segmentation benchmarks demonstrate that MSSA consistently improves VLM-based segmentation models and outperforms existing fine-tuning-based TTA methods by a clear margin, with gains of up to 12.2% DSC and 11.7% mIoU. Project page: https://lingrayy.github.io/MSSA/ .
- Abstract(参考訳): テスト時間適応(TTA)は、未ラベルのターゲットデータを持つモデルを推論時に適応させることにより、分散シフトを軽減することを目的としている。
視覚言語モデル(VLM)を用いたTTAは、分類において有望な結果を示したが、医用画像のセグメンテーションに拡張することは依然として困難である。
この設定では、VLM生成予測の最適化による適応ゲインは、ノイズ、更新駆動学習によるVLMの強い事前学習特徴の劣化により、制限的かつ不安定な改善をもたらすことがしばしばある。
そこで我々は,医用画像セグメンテーションのための新しいトレーニングフリーTTAフレームワークである,メモリ・サポーブド・シナジスティック適応(MSSA)を提案する。
モデルパラメータを更新せずに、MSSAは動的に画像テキスト予測を選択してオンラインメモリを構築する。
特にMSSAは
一 クロスモーダル予測をフィルタリングし、安定化するノイズ対応メモリ構築モジュール
(II) 関連性駆動型プロトタイプアライメントモジュールで, 対象サンプルを構造的に一貫したメモリサンプルに整列させ, 適応性を向上させるための信頼性の高い予測を行う。
複数の医療セグメンテーションベンチマークに関する大規模な実験は、MSSAが常にVLMベースのセグメンテーションモデルを改善し、既存の微調整ベースのTTAメソッドをクリアマージンで上回り、最大12.2%のDSCと11.7%のmIoUが上昇したことを示している。
プロジェクトページ: https://lingrayy.github.io/MSSA/。
関連論文リスト
- MLLM-Guided Semantic Correction for Text-to-Video Generation [66.7723669725808]
マルチモーダルな大規模言語モデルフィードバックを統合した,トレーニングフリーで解釈可能な中間世代補正フレームワークを提案する。
セマンティック・アセスメント・スーパーバイザ (Semantic Assessment Supervisor) とセマンティック・アセスメント・アシスタント (Semantic Modification Assistant) という,セマンティック・アセスメント・スーパーバイザ (Semantic Assessment Supervisor) の2つの重要なモジュールを提案する。
本手法は, モデルパラメータを変更することなく, セマンティックアライメント, 視覚的忠実度, 時間的一貫性を改善する。
論文 参考訳(メタデータ) (2026-08-17T12:54:10Z) - Concept Alignment Contrast and Long-Short Prompt Memory for Test-Time Adaptation of SAM3 in Medical Image Segmentation [14.712933368175008]
テスト時間適応(TTA)は、アノテーションなしでオンザフライでモデルを更新することで、テストパフォーマンスを改善するために不可欠である。
既存の視覚言語TTA法は主に画像レベルの不確実性最小化によって駆動される。
本稿では,SAM3の医用画像に対するConcept Alignment ContrastとLongShort Prompt Memory for Test-Time Adaptation (CM-TTA)を提案する。
論文 参考訳(メタデータ) (2026-06-22T07:43:19Z) - Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation [58.40817037271021]
DiTTA(Distillation-assisted Test-Time Adaptation)は、ISSモデルをアノテーション付きビデオなしで時間的に認識されたVSSモデルに変換する新しいフレームワークである。
完全教師付きVSS法と比較して,DITTAの有効性を示す。
論文 参考訳(メタデータ) (2026-04-13T03:47:08Z) - Dual-Teacher Distillation with Subnetwork Rectification for Black-Box Domain Adaptation [69.7036779439312]
ブラックボックスドメイン適応は、非常に実用的で非常に困難な設定である。
ブラックボックスソースモデルに埋め込まれた特定の知識を活用するサブネットワーク整合モデル(DDSR)を用いた二重蒸留法を提案する。
我々の手法は、ソースデータやモデルの使用を含む、最先端の手法に対する一貫した改善を実証する。
論文 参考訳(メタデータ) (2026-03-24T07:54:19Z) - SPEGC: Continual Test-Time Adaptation via Semantic-Prompt-Enhanced Graph Clustering for Medical Image Segmentation [12.0982298854338]
Continual Test-Time Adaptation (CTTA)は、トレーニング済みのモデルが、ラベルなしドメインの継続的な変更に適応できるようにすることを目的としている。
医用画像セグメンテーションのためのセマンティック・プロンプト拡張グラフクラスタリング(SPEGC)によるCTTAを提案する。
論文 参考訳(メタデータ) (2026-03-12T03:22:43Z) - EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition [3.1649536621597973]
音声言語モデル(ALM)を用いた音声感情認識(SER)は、テスト時の分散シフトに対して脆弱なままである。
クラス条件統計を漸進的に更新する軽量でトレーニング不要な適応フレームワークであるEmo-TTAを提案する。
Emo-TTAは、モデルウェイトを変更することなく、個々のテストサンプルで動作する。
論文 参考訳(メタデータ) (2025-09-29T20:52:01Z) - Domain Adaptive Skin Lesion Classification via Conformal Ensemble of Vision Transformers [3.7305040207339286]
本稿では,コンフォーマル・アンサンブル・オブ・ビジョン・トランスフォーマー(CE-ViT)と呼ばれる新しいフレームワークを提案する。
領域適応とモデルロバスト性を優先し,不確実性を考慮し,画像分類性能の向上を図る。
このフレームワークは、HAM10000モデルと比較して9.95%の改善を示す90.38%という高いカバレッジ率を達成する。
論文 参考訳(メタデータ) (2025-05-21T20:28:43Z) - Test-Time Model Adaptation with Only Forward Passes [68.11784295706995]
テストタイム適応は、トレーニング済みのモデルを、潜在的に分布シフトのある未確認テストサンプルに適応させるのに有効であることが証明されている。
テスト時間フォワード最適化適応法(FOA)を提案する。
FOAは量子化された8ビットのViTで動作し、32ビットのViTで勾配ベースのTENTより優れ、ImageNet-Cで最大24倍のメモリ削減を実現する。
論文 参考訳(メタデータ) (2024-04-02T05:34:33Z) - A Novel Benchmark for Few-Shot Semantic Segmentation in the Era of Foundation Models [7.428199805959228]
Few-shot semantic segmentation (FSS) はコンピュータビジョンにおいて重要な課題である。
一般化的特徴抽出器としての視覚基盤モデル(VFM)の出現に伴い,これらのモデルをFSSに適用することを模索する。
本稿では,このタスクに適した単純で簡単な適応プロセスを備えた,新しい現実的なベンチマークを提案する。
論文 参考訳(メタデータ) (2024-01-20T19:50:51Z) - Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation [67.18144414660681]
オンラインビジョン・アンド・ランゲージナビゲーション(VLN)のためのFSTTA(Fast-Slow Test-Time Adaptation)アプローチを提案する。
提案手法は,4つのベンチマークにおいて顕著な性能向上を実現する。
論文 参考訳(メタデータ) (2023-11-22T07:47:39Z) - Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer [54.32283739486781]
適応学習パラダイムの下で,textbfForgery-aware textbfAdaptive textbfVision textbfTransformer(FA-ViT)を提案する。
FA-ViTは、クロスデータセット評価において、Celeb-DFおよびDFDCデータセット上で93.83%と78.32%のAUCスコアを達成する。
論文 参考訳(メタデータ) (2023-09-20T06:51:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。