論文の概要: A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.03600v1
- Date: Fri, 03 Jul 2026 20:56:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.664576
- Title: A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning
- Title(参考訳): ファインチューニングと強化学習によるロバストな教師なしドメイン適応に向けて
- Abstract要約: 我々は,2段階の堅牢なUDAフレームワークである textbfSFT+RL を提案し,Supervised Fine Tuning と Reinforcement Learning を統合した。
textbfSFT+RLは、清潔な精度で textbf10.2% を平均的に改善し、textbf15.8% を3つのデータセットで比較した。
- 参考スコア(独自算出の注目度): 2.436631469537453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adversarial robustness in Unsupervised Domain Adaptation (UDA) remains a significant challenge due to noisy pseudo labels and inherent distributional shifts between the clean source and adversarially perturbed target domains. Existing approaches often fail to achieve an optimal trade-off between robustness and accuracy, as pseudo-labels generated by domain-adapted models tend to introduce classification errors under adversarial attacks. In this work, we propose \textbf{SFT+RL}, a two-stage robust UDA framework that integrates Supervised Fine Tuning (SFT) and Reinforcement Learning (RL) on top of CLIP's pre-trained visual encoder. In the SFT stage, we adversarially fine-tune a linear classifier using PGD-based perturbations over the labelled source domain while partially unfreezing CLIP's projection layer. It allows adaptation to adversarial noise while preserving CLIP's rich semantic priors. We introduce a confidence-guided pseudo-labeling strategy in the RL stage to annotate unlabeled target samples progressively. Pseudo labels are filtered using a decaying confidence threshold to balance quality and coverage, and the model is trained on a composite dataset formed by combining clean source samples with high-confidence target samples. Adversarial training is applied to mixed batches of clean and adversarial examples to enhance cross-domain robustness. Comprehensive evaluations on three benchmark datasets OfficeHome~\cite{tomm-ude}, PACS~\cite{pacs}, and VisDA~\cite{visda} demonstrate the effectiveness of our approach. Notably, \textbf{SFT+RL} achieves average improvements of \textbf{10.2\%} in clean accuracy and \textbf{15.8\%} in adversarial robustness across all three datasets, outperforming existing state-of-the-art methods.
- Abstract(参考訳): 教師なしドメイン適応(UDA)における逆の堅牢性は、ノイズの多い擬似ラベルと、クリーンソースと逆の摂動対象ドメイン間の固有の分布シフトにより、依然として大きな課題である。
既存のアプローチでは、ドメイン適応モデルによって生成された擬似ラベルは、敵攻撃下での分類誤差を導入する傾向があるため、ロバスト性と精度の最適なトレードオフを達成できないことが多い。
本稿では,CLIPの事前学習されたビジュアルエンコーダ上に,スーパービジョンファインチューニング(SFT)と強化学習(RL)を統合した2段階の堅牢なUDAフレームワークである‘textbf{SFT+RL} を提案する。
SFTの段階では,CLIPのプロジェクション層を部分的に凍結しながら,PGDに基づくラベル付きソースドメイン上の摂動を用いた線形分類器を逆向きに微調整する。
これは、CLIPの豊富なセマンティック先行を保ちながら、敵対的ノイズへの適応を可能にする。
著者らは,RL段階において,信頼誘導型擬似ラベル戦略を導入し,未ラベル対象サンプルを段階的に注釈付けする。
擬似ラベルは、品質とカバレッジのバランスをとるために、劣化する信頼しきい値を用いてフィルタリングされ、そのモデルは、クリーンソースサンプルと高信頼ターゲットサンプルを組み合わせた合成データセット上で訓練される。
クロスドメインロバスト性を高めるために、クリーンなサンプルと逆のサンプルの混合バッチに適用する。
OfficeHome~\cite{tomm-ude}, PACS~\cite{pacs}, VisDA~\cite{visda}の3つのベンチマークデータセットの総合的な評価は、我々のアプローチの有効性を示している。
特に、 \textbf{SFT+RL} は、クリーンな精度で \textbf{10.2\%} と \textbf{15.8\%} を平均的に改善し、既存の最先端手法より優れている。
関連論文リスト
- Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization [64.83565413108789]
サイクル自己学習(CST)は、標準自己学習フレームワークの共有分類器の仮定を破る。
CSTは、ターゲットの擬似ラベルでトレーニングすることで、ラベルなしのターゲットデータを悪用する。
論文 参考訳(メタデータ) (2026-06-30T09:05:30Z) - Unsupervised Domain Adaptive Person Search via Dual Self-Calibration [12.158126976694488]
Unsupervised Domain Adaptive (UDA) パーソンサーチは、ラベル付きソースドメインデータセットでトレーニングされたモデルを、追加のアノテーションなしでターゲットドメインデータセットに採用することに焦点を当てている。
最も効果的なUDA人物探索法は、典型的には、ソースドメインとクラスタリングから派生した擬似ラベルの基底真理を利用する。
ノイズの多い擬似ラベルの干渉を効果的に除去するUDA人物探索のためのDSCA(Dual Self-Calibration)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-21T06:54:00Z) - Adversarial Purification by Consistency-aware Latent Space Optimization on Data Manifolds [48.37843602248313]
ディープニューラルネットワーク(DNN)は、クリーンデータに知覚不能な摂動を加えることで作られた敵のサンプルに対して脆弱であり、誤った危険な予測につながる可能性がある。
本稿では、事前学習された一貫性モデルの潜在空間内のベクトルを最適化し、クリーンなデータを復元するためのサンプルを生成する、一貫性モデルに基づく適応的パーフィケーション(CMAP)を提案する。
CMAPは、高い自然な精度を維持しながら、強力な敵攻撃に対する堅牢性を著しく向上させる。
論文 参考訳(メタデータ) (2024-12-11T14:14:02Z) - Revisiting Domain-Adaptive 3D Object Detection by Reliable, Diverse and
Class-balanced Pseudo-Labeling [38.07637524378327]
ドメイン適応型3Dオブジェクト検出において,疑似ラベリング技術を用いた教師なしドメイン適応(DA)が重要なアプローチとして浮上している。
既存のDAメソッドは、マルチクラスのトレーニング環境に適用した場合、パフォーマンスが大幅に低下する。
本稿では,すべてのクラスを一度に検出する学習に適した新しいReDBフレームワークを提案する。
論文 参考訳(メタデータ) (2023-07-16T04:34:11Z) - Guiding Pseudo-labels with Uncertainty Estimation for Test-Time
Adaptation [27.233704767025174]
Test-Time Adaptation (TTA) は、Unsupervised Domain Adaptation (UDA) の特定のケースであり、モデルがソースデータにアクセスせずにターゲットドメインに適合する。
本稿では,損失再重み付け戦略に基づくTTA設定のための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-03-07T10:04:55Z) - MAPS: A Noise-Robust Progressive Learning Approach for Source-Free
Domain Adaptive Keypoint Detection [76.97324120775475]
クロスドメインキーポイント検出方法は、常に適応中にソースデータにアクセスする必要がある。
本稿では、ターゲット領域に十分に訓練されたソースモデルのみを提供する、ソースフリーなドメイン適応キーポイント検出について考察する。
論文 参考訳(メタデータ) (2023-02-09T12:06:08Z) - AdaTriplet-RA: Domain Matching via Adaptive Triplet and Reinforced
Attention for Unsupervised Domain Adaptation [15.905869933337101]
教師なしドメイン適応(Unsupervised Domain Adaption、UDA)は、ソースドメインのデータとアノテーションが利用できるが、トレーニング中にラベル付けされていないターゲットデータにのみアクセスできるトランスファー学習タスクである。
本稿では、ドメイン間サンプルマッチング方式を用いて、教師なしドメイン適応タスクを改善することを提案する。
ドメイン間サンプルに合わせるために,広く利用され,堅牢なTriplet損失を適用した。
トレーニング中に発生する不正確な擬似ラベルの破滅的効果を低減するため,信頼度の高い擬似ラベルを自動的に選択し,段階的に改良する新しい不確実性測定法を提案する。
論文 参考訳(メタデータ) (2022-11-16T13:04:24Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z) - Low-confidence Samples Matter for Domain Adaptation [47.552605279925736]
ドメイン適応(DA)は、知識をラベルの豊富なソースドメインから関連するがラベルの少ないターゲットドメインに転送することを目的としている。
低信頼度サンプルの処理による新しいコントラスト学習法を提案する。
提案手法を教師なしと半教師付きの両方のDA設定で評価する。
論文 参考訳(メタデータ) (2022-02-06T15:45:45Z) - Semi-supervised Domain Adaptive Structure Learning [72.01544419893628]
半教師付きドメイン適応 (SSDA) は,1) アノテーションの低いデータに過度に適合する手法と,2) ドメイン間の分散シフトの両方を克服しなければならない課題である。
SSLとDAの協調を正規化するための適応型構造学習手法を提案する。
論文 参考訳(メタデータ) (2021-12-12T06:11:16Z) - Unsupervised Robust Domain Adaptation without Source Data [75.85602424699447]
我々は、利用できないターゲットラベルとソースデータのコンテキストにおけるロバストなドメイン適応の問題について研究する。
4つのベンチマークデータセットでテストされたベースラインに対して10%以上の精度で一貫したパフォーマンス改善を示す。
論文 参考訳(メタデータ) (2021-03-26T16:42:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。