論文の概要: Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search
- arxiv url: http://arxiv.org/abs/2604.08598v1
- Date: Tue, 07 Apr 2026 07:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.473752
- Title: Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search
- Title(参考訳): Pretrain-then-Adapt: テキストに基づく人物検索のための不確実性を考慮したテスト時間適応
- Authors: Jiahao Zhang, Shaofei Huang, Yaxiong Wang, Zhedong Zheng,
- Abstract要約: テキストベースの人物検索は、厳格なプライバシー制約と手動アノテーションの高コストによって引き起こされるデータ不足により、固有の制限に直面している。
既存の手法は通常、合成人体カプセルデータに基づいてモデルを事前訓練するPretrain-then-Finetuneパラダイムに依存している。
オフラインテスト時間適応方式により、広範囲なターゲットドメインの監視に依存しない新しいPretrain-then-Adaptパラダイムを提案する。
- 参考スコア(独自算出の注目度): 26.52140212357349
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-based person search faces inherent limitations due to data scarcity, driven by stringent privacy constraints and the high cost of manual annotation. To mitigate this, existing methods usually rely on a Pretrain-then-Finetune paradigm, where models are first pretrained on synthetic person-caption data to establish cross-modal alignment, followed by fine-tuning on labeled real-world datasets. However, this paradigm lacks practicality in real-world deployment scenarios, where large-scale annotated target-domain data is typically inaccessible. In this work, we propose a new Pretrain-then-Adapt paradigm that eliminates reliance on extensive target-domain supervision through an offline test-time adaptation manner, enabling dynamic model adaptation using only unlabeled test data with minimal post-train time cost. To mitigate overconfidence with false positives of previous entropy-based test-time adaptation, we propose an Uncertainty-Aware Test-Time Adaptation (UATTA) framework, which introduces a bidirectional retrieval disagreement mechanism to estimate uncertainty, i.e., low uncertainty is assigned when an image-text pair ranks highly in both image-to-text and text-to-image retrieval, indicating high alignment; otherwise, high uncertainty is detected. This indicator drives offline test-time model recalibration without labels, effectively mitigating domain shift. We validate UATTA on four benchmarks, i.e., CUHK-PEDES, ICFG-PEDES, RSTPReid, and PAB, showing consistent improvements across both CLIP-based (one-stage) and XVLM-based (two-stage) frameworks. Ablation studies confirm that UATTA outperforms existing offline test-time adaptation strategies, establishing a new benchmark for label-efficient, deployable person search systems. Our code is available at https://github.com/nkuzjh/UATTA.
- Abstract(参考訳): テキストベースの人物検索は、厳格なプライバシー制約と手動アノテーションの高コストによって引き起こされるデータ不足により、固有の制限に直面している。
これを緩和するために、既存の手法は通常、Pretrain-then-Finetuneパラダイムに依存しており、モデルが最初に合成人体カプセルデータに基づいて事前訓練され、クロスモーダルアライメントが確立され、次いでラベル付き実世界のデータセットを微調整する。
しかし、このパラダイムは、大規模アノテートされたターゲットドメインデータが通常アクセスできない実世界のデプロイメントシナリオにおいて実用性に欠ける。
本研究では、オフラインテスト時適応方式により、広範囲な対象ドメインの監視を不要にし、未ラベルのテストデータのみを最小限の時間コストで動的モデル適応を可能にする、Pretrain-then-Adaptパラダイムを提案する。
従来のエントロピーベースのテスト時間適応の偽陽性を緩和するため、不確実性を考慮したテスト時間適応(UATTA)フレームワークを提案し、不確実性を推定する双方向検索不一致機構を導入する。
このインジケータは、ラベルなしでオフラインのテストタイムモデルのリカレーションを駆動し、ドメインシフトを効果的に軽減する。
CUHK-PEDES, ICFG-PEDES, RSTPReid, PABの4つのベンチマークでUATTAを検証する。
アブレーション研究では、UATTAが既存のオフラインテストタイム適応戦略より優れており、ラベル効率の高いデプロイ可能な人物検索システムのための新しいベンチマークが確立されている。
私たちのコードはhttps://github.com/nkuzjh/UATTA.comで公開されています。
関連論文リスト
- Test-Time Adaptive Object Detection with Foundation Model [39.96498227103011]
本稿では,最初の基礎モデルを用いたテスト時適応オブジェクト検出手法を提案する。
視覚言語検出駆動テスト時間適応のためのマルチモーダルPromptベースのMean-Teacherフレームワークを設計する。
テストバッチ毎に高品質な擬似ラベルを保証するため、インスタンス動的メモリを維持します。
論文 参考訳(メタデータ) (2025-10-29T05:19:38Z) - Bayesian Test-time Adaptation for Object Recognition and Detection with Vision-language Models [86.53246292425699]
我々は、オブジェクト認識と検出の両方のためのTTAのためのトレーニングフリーフレームワークであるBCA+を提案する。
我々はベイズ推論問題として適応を定式化し、キャッシュベースの予測で初期VLM出力を融合することで最終的な予測を生成する。
BCA+は、認識と検出のベンチマークの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-03T06:27:33Z) - Think Twice before Adaptation: Improving Adaptability of DeepFake Detection via Online Test-Time Adaptation [1.7811840395202345]
ディープフェイク(DF)検出器は、現実世界の環境に展開する際、重大な課題に直面している。
ポストプロセッシング技術はDFサンプルで提示された成果物を不明瞭に生成する可能性があるため、性能が低下する。
本稿では,新しいオンラインテスト時間適応法であるThink Twice before Adaptation (textttT$2$A)を提案する。
論文 参考訳(メタデータ) (2025-05-24T16:58:53Z) - Enhancing Test Time Adaptation with Few-shot Guidance [62.49199492255226]
深層ニューラルネットワークは、トレーニング(ソース)とテスト(ターゲット)データのドメインシフトに直面しながら、大きなパフォーマンス低下に直面することが多い。
TTA(Test Time Adaptation)法は,事前学習したソースモデルを用いて,配信外ストリーミングターゲットデータを処理する手法として提案されている。
本稿では,Few-Shot Test Time Adaptation (FS-TTA) を開発した。
論文 参考訳(メタデータ) (2024-09-02T15:50:48Z) - Uncertainty-Calibrated Test-Time Model Adaptation without Forgetting [65.21599711087538]
テスト時間適応(TTA)は、与えられたモデルw.r.t.を任意のテストサンプルに適用することにより、トレーニングデータとテストデータの間の潜在的な分散シフトに取り組むことを目指している。
事前の手法は各テストサンプルに対してバックプロパゲーションを実行するため、多くのアプリケーションに対して許容できない最適化コストがかかる。
本稿では, 有効サンプル選択基準を策定し, 信頼性および非冗長なサンプルを同定する, 効率的なアンチフォッティングテスト時間適応法を提案する。
論文 参考訳(メタデータ) (2024-03-18T05:49:45Z) - CAFA: Class-Aware Feature Alignment for Test-Time Adaptation [50.26963784271912]
テスト時間適応(TTA)は、テスト時にラベルのないデータにモデルを適応させることによって、この問題に対処することを目的としている。
本稿では,クラス認識特徴アライメント(CAFA, Class-Aware Feature Alignment)と呼ばれる単純な機能アライメント損失を提案する。
論文 参考訳(メタデータ) (2022-06-01T03:02:07Z) - Listen, Adapt, Better WER: Source-free Single-utterance Test-time
Adaptation for Automatic Speech Recognition [65.84978547406753]
Test-time Adaptationは、ソースドメインでトレーニングされたモデルに適応して、テストサンプルの予測を改善することを目的としている。
単一発話テスト時間適応 (SUTA) は音声領域における最初のTTA研究である。
論文 参考訳(メタデータ) (2022-03-27T06:38:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。