論文の概要: Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.28145v1
- Date: Fri, 28 Aug 2026 10:05:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.268473
- Title: Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models
- Title(参考訳): 視覚言語モデルのソースフリー適応のためのプロトタイプアンカーキャリブレーションによるデュアルストリームセマンティックガイダンス
- Abstract要約: Source-Fully-Free Domain Adaptation (SFF-DA)は、VLM(Vision-Language Models)をソースデータやタスク固有のソースモデルへのアクセスなしに適応するための戦略的パラダイムとして登場した。
DSSG(Dual-Stream Semantic Guidance)は,微細な塑性とグローバルな安定性を両立するエンドツーエンドのフレームワークである。
- 参考スコア(独自算出の注目度): 7.906602161796845
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Source-Fully-Free Domain Adaptation (SFF-DA) has emerged as a strategic paradigm to adapt Vision-Language Models (VLMs) without any access to source data or task-specific source models. However, we identify a critical Dual Semantic Drift that hinders this process: static drift arising from the rigidity of fixed class embeddings, and dynamic drift stemming from the divergence of generated captions, causing severe semantic misalignment that intensifies the stability-plasticity dilemma. To address this, we propose DSSG (Dual-Stream Semantic Guidance), an end-to-end framework that reconciles fine-grained plasticity with global stability. Our core contribution is the Dual Semantic Guidance (DSG) module, which integrates a caption stream for domain-specific knowledge with a class-anchor stream to anchor global categorical consistency. Furthermore, a Dynamic Cross-Modal Knowledge Distillation (CMKD) module is introduced to leverage the evolving teacher distribution for calibrating teacher-student consistency. Building upon DSSG, we further introduce Prototype Anchor Calibration (PAC), yielding DSSG-PAC, which periodically calibrates prototype anchors and caches them until the next calibration. This design reduces redundant text-side computation while preserving the adaptability of class guidance to the evolving text space. We further establish SFF-DA risk bounds that relate student risk to semantic-teacher quality and teacher--student discrepancy. Extensive experiments demonstrate that DSSG consistently outperforms current state-of-the-art methods across multiple benchmarks, while DSSG-PAC largely preserves its adaptation performance with 18.9% lower total adaptation time. The code is available at https://github.com/mrmenand/DSSG.
- Abstract(参考訳): Source-Fully-Free Domain Adaptation (SFF-DA)は、VLM(Vision-Language Models)をソースデータやタスク固有のソースモデルへのアクセスなしに適応するための戦略的パラダイムとして登場した。
しかし, 固定クラス埋め込みの剛性から生じる静的なドリフトや, 生成されたキャプションのばらつきから生じる動的ドリフトは, 安定性と塑性のジレンマを増大させる深刻なセマンティックなミスアライメントを引き起こす。
DSSG(Dual-Stream Semantic Guidance)は,微細な塑性とグローバルな安定性を両立するエンドツーエンドのフレームワークである。
このモジュールは、ドメイン固有の知識のキャプションストリームとクラスアンカーストリームを統合し、グローバルなカテゴリ整合性を保ちます。
さらに,教師と学生の整合性を校正するために,進化する教師分布を活用するために,動的クロスモーダル知識蒸留(CMKD)モジュールを導入する。
DSSGをベースとして,プロトタイプアンカーを定期的に校正し,次の校正までキャッシュするDSSG-PAC(Prototype Anchor Calibration)を導入する。
この設計は、進化するテキスト空間へのクラスガイダンスの適応性を保ちながら、冗長なテキストサイドの計算を減らす。
さらに,SFF-DAのリスクバウンダリを確立し,学生のリスクとセマンティック・教師の質と教師の相違を関連づける。
大規模な実験では、DSSGは複数のベンチマークで現在の最先端の手法を一貫して上回り、DSSG-PACは総適応時間を18.9%減らして適応性能を保っている。
コードはhttps://github.com/mrmenand/DSSGで公開されている。
関連論文リスト
- PAPT++: Risk-Aware Adversarial Tuning and Generation for Single Domain Generalization [99.33114297216183]
単一ドメインの一般化は、特定対象ドメインに一般化するラベル付きソースドメインからモデルを学習することを目的としている。
本稿では,単一ドメインの一般化のためのリスク認識型逆生成学習フレームワークPAPT++を紹介する。
論文 参考訳(メタデータ) (2026-09-04T07:54:30Z) - Geometry-Aware Contrastive Learning for Few-Shot Automatic Modulation Recognition [5.310289270050359]
Dynamic-Adaptive Contrastive Learning (DyCo-CL)は、Virtual Adrialversa Augmentation(VAA)とセマンティック一貫性の損失を結合した幾何学的フレームワークである。
DyCo-CLは1ショット設定での精度が6.27%向上した。
論文 参考訳(メタデータ) (2026-05-26T06:33:57Z) - MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation [65.068801413044]
連続的なテスト時間適応は、非定常な未ラベルのターゲットストリームにソース予測モデルを適用する。
ドメインに依存しない構造をドメイン固有のテクスチャから切り離す。
論文 参考訳(メタデータ) (2026-05-18T01:52:12Z) - DRIFT: Drift-Resilient Invariant-Feature Transformer for DGA Detection [0.28675177318965045]
ドメイン生成アルゴリズムはボットネット検出を避けるために進化する。
深層学習に基づく検出器は、静的条件下では強い性能を達成するが、時間的ドリフトに直面すると著しく劣化する。
本稿では,ハイブリッドトークン化戦略を通じて不変表現を学習するドリフトレジリエントトランスフォーマーベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-11T12:08:41Z) - DynaPURLS: Dynamic Refinement of Part-aware Representations for Skeleton-based Zero-Shot Action Recognition [51.80782323686666]
textbfDynaPURLSは、堅牢でマルチスケールなビジュアル・セマンティック対応を確立する統一的なフレームワークである。
我々のフレームワークは、グローバルな動きと局所的な身体部分のダイナミクスの両方を含む階層的なテキスト記述を生成するために、大きな言語モデルを活用する。
NTU RGB+D 60/120とPKU-MMDを含む3つの大規模ベンチマークデータセットの実験は、DynaPURLSが先行技術よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-12-12T10:39:10Z) - SCoDA: Self-supervised Continual Domain Adaptation [1.2389885407843222]
Source-Free Domain Adaptation (SFDA)は、ソースドメインのデータにアクセスせずにターゲットドメインにモデルを適用するという課題に対処する。
これらの制約に対処するため、自己監督型連続ドメイン適応(SCoDA)を導入する。
論文 参考訳(メタデータ) (2025-09-12T02:53:03Z) - DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition [59.203152078315235]
Open-Vocabulary Multi-Label Recognition (OV-MLR)は、画像内の複数の見えないオブジェクトカテゴリを識別することを目的としている。
ビジョンランゲージ事前学習モデルは強力なオープン語彙基盤を提供するが、弱い監督下では微粒な局所化に苦慮する。
本稿では,これらの制約を克服するためのDART(Dual Adaptive Refinement Transfer)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-07T17:22:33Z) - Adapting to Fragmented and Evolving Data: A Fisher Information Perspective [0.0]
FADEは動的環境下での堅牢な学習のための軽量フレームワークである。
フィッシャー情報幾何学に固定されたシフトアウェアの正規化機構を採用している。
FADEは固定メモリでオンラインで動作し、ターゲットラベルにアクセスできない。
論文 参考訳(メタデータ) (2025-07-25T06:50:09Z) - Collaborative Static-Dynamic Teaching: A Semi-Supervised Framework for Stripe-Like Space Target Detection [2.9133687889451023]
Stripeのような宇宙ターゲット検出は、宇宙の状況認識に不可欠である。
従来の教師なし手法は、低信号対雑音比と可変ストライプのような空間ターゲットシナリオで失敗することが多い。
我々は,静的および動的教師モデルと学生モデルを含む,革新的な協調静的動的教師(CSDT)SSLフレームワークを導入する。
また,マルチスケールデュアルパス畳み込み(MDPC)ブロックと特徴マップ重み付き注目(FMWA)ブロックを備えた新しいSSTDネットワークであるMSSA-Netを提案する。
論文 参考訳(メタデータ) (2024-08-09T12:33:27Z) - Semi-supervised Domain Adaptive Structure Learning [72.01544419893628]
半教師付きドメイン適応 (SSDA) は,1) アノテーションの低いデータに過度に適合する手法と,2) ドメイン間の分散シフトの両方を克服しなければならない課題である。
SSLとDAの協調を正規化するための適応型構造学習手法を提案する。
論文 参考訳(メタデータ) (2021-12-12T06:11:16Z) - HSVA: Hierarchical Semantic-Visual Adaptation for Zero-Shot Learning [74.76431541169342]
ゼロショット学習(ZSL)は、目に見えないクラス認識の問題に取り組み、目に見えないクラスから目に見えないクラスに意味的な知識を移す。
本稿では,意味領域と視覚領域を協調させる新しい階層型意味視覚適応(HSVA)フレームワークを提案する。
4つのベンチマークデータセットの実験では、HSVAは従来のZSLと一般的なZSLの両方で優れた性能を示す。
論文 参考訳(メタデータ) (2021-09-30T14:27:50Z) - Generalize then Adapt: Source-Free Domain Adaptive Semantic Segmentation [78.38321096371106]
先行技術はラベル付きソースとラベルなしターゲットの両方への同時アクセスを前提としており、ソースフリー適応を必要とするシナリオには適さない。
本研究では、タスクをa)ソースのみのドメイン一般化とb)ソースフリーなターゲット適応の2つに分割することで、ソースフリーのDAを可能にする。
本研究では,空間的不規則性を回避し,擬似ラベル品質を向上する条件付き事前強化オートエンコーダを提案する。
論文 参考訳(メタデータ) (2021-08-25T14:18:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。