論文の概要: Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2608.29923v1
- Date: Sun, 30 Aug 2026 17:39:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.118308
- Title: Towards Continual Test-Time Adaptation of Vision-Language Models in Open-Vocabulary Semantic Segmentation
- Title(参考訳): 開語彙セマンティックセグメンテーションにおける視覚言語モデルの連続的テスト時間適応に向けて
- Authors: Chandler Timm C. Doloriel, Yunbei Zhang, Sarthak Kumar Maharana, Muhammad Salman Siddiqui, Tor Kristian Stevik, Fadi Al Machot, Kristian Hovde Liland, Habib Ullah,
- Abstract要約: Diversify, Anchor, and Filter (DAF) はエントロピーに基づく適応を拡大するフレームワークである。
自然界,自律運転,水中画像,リモートセンシングの5つのデータセットを,その劣化した変種を用いて評価した。
- 参考スコア(独自算出の注目度): 7.440412390819483
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open-vocabulary semantic segmentation (OVSS) relies on vision-language alignment to recognize arbitrary text-defined categories, yet this alignment is fragile under continual test-time distribution shift. Our diagnostic analysis reveals that entropy minimization drives patch-level class collapse, continual updates erode vision-language alignment, and redundant gradients from low-shift samples waste computation. We propose Diversify, Anchor, and Filter (DAF), a stabilization framework that augments entropy-based adaptation with a marginal diversity loss that resists collapse, a cross-modal anchor consistency loss that constrains feature drift relative to a frozen source model, and feature salience filtering that skips low-value backward passes to offset part of the source-anchor overhead. We evaluate on five datasets spanning natural scenes, autonomous driving, underwater imagery, and remote sensing with their corrupted variants. Across the evaluated continual shifts, DAF remains stable where entropy minimization collapses, improving mIoU by over 8 points on Pascal VOC20-C, over 9 points on LoveDA, and over 3 points on Foggy Cityscapes compared to the source model, and is robust to aggressive adaptation and learning rate choices.
- Abstract(参考訳): Open-vocabulary semantic segmentation (OVSS) は任意のテキスト定義カテゴリを認識するために視覚言語アライメントに依存しているが、このアライメントは連続的なテスト時間分布シフトの下で脆弱である。
診断分析の結果,エントロピーの最小化は, パッチレベルのクラス崩壊, 連続的更新による視覚言語アライメント, 低シフトサンプル処理による冗長な勾配を誘導することがわかった。
本研究では, 分散化, アンカー, フィルタ (DAF) を提案し, エントロピーに基づく適応を安定化し, 崩壊に抵抗する限界多様性損失, 凍結したソースモデルに対して特徴のドリフトを制約するクロスモーダルアンカーの一貫性損失, 低値後方をスキップする特徴サリエンスフィルタをソースアンカーオーバーヘッドのオフセット部分に導入する。
自然界,自律運転,水中画像,リモートセンシングの5つのデータセットを,その劣化した変種を用いて評価した。
評価された連続的なシフト全体にわたって、DAFはエントロピーの最小化が崩壊する地点で安定であり、パスカルVOC20-Cでは8ポイント以上、ラブダでは9ポイント以上、フォギー街並みでは3ポイント以上改善され、アグレッシブ適応や学習率の選択に対して堅牢である。
関連論文リスト
- TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs [83.78708832901194]
大規模ビデオ言語モデル(LVLM)は、野生のマルチモーダル感情認識(ER)のようなマルチモーダルタスクにおいて顕著なパフォーマンスを示している。
しかし、現実のデプロイメントは依然として困難であり、テスト時にモダリティが欠落したりうる。
凍結した教師が自己蒸留により適応的な低学級の生徒を指導する手法を提案する。
MELD, DFEW, BAHを0%-50%のモダリティで実験した結果, この統一型適応復元設計はエントロピーベースの適応, RAG, およびパープレキシティベースの生成より一貫して優れていた。
論文 参考訳(メタデータ) (2026-08-18T23:40:28Z) - Local Margin Restoration for Test-Time Adaptation of Vision-Language Models [15.097704252897818]
CLIPのような視覚言語モデル(VLM)は、優れたゼロショット機能を示すが、予期せぬテスト時間分散シフトの下で、その性能は急激に低下する。
テスト時間適応フレームワークであるLocal Margin Restoration (LMR)を提案する。
CIFAR-C、ImageNet-C、ImageNetの変種に関する実験では、LMRが最先端のTTAベースラインを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2026-08-03T13:38:11Z) - Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection [34.23489857539403]
インクリメンタル学習を通して、Focuse、Aligns、Sustainsの勾配フローを統一するフレームワークを提案する。
実験により、FASはロバストな最適化のダイナミクスを復元し、最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-06-13T11:20:16Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation [65.068801413044]
連続的なテスト時間適応は、非定常な未ラベルのターゲットストリームにソース予測モデルを適用する。
ドメインに依存しない構造をドメイン固有のテクスチャから切り離す。
論文 参考訳(メタデータ) (2026-05-18T01:52:12Z) - Dual-Stage Invariant Continual Learning under Extreme Visual Sparsity [8.16821029459195]
背景駆動の勾配は、連続的なドメインシフトの間、機能のバックボーンを不安定にすることを示す。
連成蒸留による二段階不変連続学習フレームワークを提案する。
高分解能空間ベース RSO 検出データセットの実験は、確立された連続物体検出法よりも一貫した改善を示す。
論文 参考訳(メタデータ) (2026-03-27T09:03:49Z) - Preventing Posterior Collapse with Levenshtein Variational Autoencoder [61.30283661804425]
我々は,エビデンス・ロー・バウンド(ELBO)を最適化し,後部崩壊を防止できる新しい目的に置き換えることを提案する。
本稿では,Levenstein VAEが後方崩壊防止のための代替手法よりも,より情報的な潜伏表現を生成することを示す。
論文 参考訳(メタデータ) (2020-04-30T13:27:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。