論文の概要: Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning
- arxiv url: http://arxiv.org/abs/2606.12258v1
- Date: Wed, 10 Jun 2026 16:01:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-11 16:42:38.547603
- Title: Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning
- Title(参考訳): ブリッジングデイとナイト: 相乗的プロンプトとプロトタイプ学習による教師なしクロスドメイン再同定
- Abstract要約: ドメイン間の昼夜再識別(ReID)は、昼夜のシーンと夜のシーンの間にかなりの視覚的差異があるため、基本的には困難である。
本稿では,素早い学習とプロトタイプに基づく表現学習を組み合わせて,ドメイン間のアイデンティティを関連付ける新しいフレームワークを提案する。
教師なし設定では、我々のフレームワークは最先端の完全教師付き手法に匹敵するランク1の精度を達成できる。
- 参考スコア(独自算出の注目度): 11.126051917472806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cross-domain day-night re-identification (ReID) is fundamentally challenged by the substantial visual appearance discrepancies between daytime and nighttime scenes. Existing fully supervised methods rely heavily on labor-intensive annotations, which are costly and exhibit limited generalization across domains. In this work, we investigate unsupervised day-night ReID and propose a novel framework that synergistically combines prompt learning and prototype-based representation learning to associate identities across domains without requiring manual labels. Our approach follows a progressive two-stage training strategy. In the first stage, we exploit the vision-language model to generate instance-specific textual prompts in an annotation-free manner. We employ an instance-level alignment mechanism to embed visual features and textual prompts into a unified semantic space, aligning unlabeled day/night images with learnable prompts via instance-aware dynamic-bias adaptation. In the second stage, we construct domain-specific prototype memory banks and introduce two complementary modules: i) an intra-domain identity association module to enhance feature discriminability within each domain, and ii) a cross-domain prototype matching module to reliably identify positive and negative prototype pairs, thereby establishing robust identity correspondences across day and night. Extensive experiments on public benchmarks validate the effectiveness of our method. Under the unsupervised setting, our framework attains Rank-1 accuracy comparable to state-of-the-art fully supervised methods.
- Abstract(参考訳): ドメイン間の昼夜再識別(ReID)は、昼夜のシーンと夜のシーンの間にかなりの視覚的差異があるため、基本的には困難である。
既存の完全教師付き手法は、作業集約アノテーションに大きく依存しており、コストがかかり、ドメイン間の限定的な一般化が示される。
本研究では、教師なしの昼夜のReIDを調査し、手動ラベルを必要とせず、ドメイン間のアイデンティティを関連付けるために、素早い学習とプロトタイプベースの表現学習を相乗的に組み合わせた新しいフレームワークを提案する。
私たちのアプローチは、進歩的な2段階のトレーニング戦略に従っています。
第一段階では、視覚言語モデルを用いて、アノテーションのない方法で、インスタンス固有のテキストプロンプトを生成する。
我々は、インスタンスレベルのアライメント機構を用いて、視覚的特徴やテキストによるプロンプトを統一的なセマンティック空間に埋め込む。
第2段階では、ドメイン固有のプロトタイプメモリバンクを構築し、2つの補完モジュールを導入します。
一 ドメイン内の特徴識別性を高めるためのドメイン内同一性関連モジュール及び
二 正負の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正
公開ベンチマークの大規模な実験により,本手法の有効性が検証された。
教師なし設定では、我々のフレームワークは最先端の完全教師付き手法に匹敵するランク1の精度を達成できる。
関連論文リスト
- Bidirectional Learning of Facial Action Units and Expressions via Structured Semantic Mapping across Heterogeneous Datasets [85.74213192818668]
本研究では,異なるデータ領域下での双方向AU-FE学習のための構造化セマンティックマッピング(SSM)フレームワークを提案する。
SSMは、(1)動的AUとFEビデオから統一された顔表現を学習する共有視覚バックボーン、(2)テキストセマンティックプロトタイプ(TSP)モジュールによるセマンティックメディエーション、(3)顔行動符号化システムから派生した事前知識を組み込んだ動的優先マッピング(DPM)モジュールの3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2026-04-12T09:08:32Z) - Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection [25.15191353465313]
Cross-Domain Few-Shot Object Detection (CD-FSOD) は、いくつかのラベル付き例があるだけで、目に見えないターゲットドメインで新しいクラスを検出することを目的としている。
本稿では,LMPと呼ばれるマルチモーダルプロトタイプを目標領域から抽出した視覚的特徴とテキストガイダンスを結合して学習するデュアルブランチ検出器を提案する。
論文 参考訳(メタデータ) (2026-02-21T12:10:48Z) - Divide, Conquer and Unite: Hierarchical Style-Recalibrated Prototype Alignment for Federated Medical Image Segmentation [66.82598255715696]
フェデレートラーニング(Federated Learning)は、複数の医療機関がデータを共有することなく、グローバルなモデルをトレーニングすることを可能にする。
現在のアプローチは主に、重要なマルチレベルキューを見下ろす最終層機能に重点を置いている。
我々は,ドメイン不変のコンテキスト型プロトタイプアライメントを介して特徴表現ギャップをブリッジするFedBCSを提案する。
論文 参考訳(メタデータ) (2025-11-14T04:15:34Z) - Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in Videos [63.94040814459116]
自己教師付き手法は、高レベルの意味論と低レベルの時間対応の学習において顕著な進歩を見せている。
融合した意味特徴と対応地図の上に,意味認識型マスキングスロットアテンションを提案する。
我々は、時間的コヒーレントなオブジェクト中心表現を促進するために、セマンティックおよびインスタンスレベルの時間的一貫性を自己スーパービジョンとして採用する。
論文 参考訳(メタデータ) (2023-08-19T09:12:13Z) - DualCoOp++: Fast and Effective Adaptation to Multi-Label Recognition
with Limited Annotations [79.433122872973]
低ラベル体制における多ラベル画像認識は、大きな課題と実践的重要性の課題である。
我々は、何百万もの補助的な画像テキストペアで事前訓練されたテキストと視覚的特徴の強力なアライメントを活用する。
Evidence-guided Dual Context Optimization (DualCoOp++) という,効率的かつ効果的なフレームワークを導入する。
論文 参考訳(メタデータ) (2023-08-03T17:33:20Z) - Prompting Diffusion Representations for Cross-Domain Semantic
Segmentation [101.04326113360342]
拡散事前学習は、セマンティックセグメンテーションのための並外れた領域一般化結果を達成する。
本研究では,シーンプロンプトとプロンプトランダム化戦略を導入し,セグメンテーションヘッドを訓練する際に,ドメイン不変情報をさらに混乱させる。
論文 参考訳(メタデータ) (2023-07-05T09:28:25Z) - Learning Domain Invariant Prompt for Vision-Language Models [31.581652862478965]
本稿では,メタプロンプト(MetaPrompt)と呼ばれる未確認領域に一般化可能な,固有領域不変プロンプトを直接生成する新しいプロンプト学習パラダイムを提案する。
我々の手法は既存の手法より一貫して大幅に優れています。
論文 参考訳(メタデータ) (2022-12-08T11:23:24Z) - AFAN: Augmented Feature Alignment Network for Cross-Domain Object
Detection [90.18752912204778]
オブジェクト検出のための教師なしドメイン適応は、多くの現実世界のアプリケーションにおいて難しい問題である。
本稿では、中間領域画像生成とドメイン・アドバイザリー・トレーニングを統合した新しい機能アライメント・ネットワーク(AFAN)を提案する。
提案手法は、類似および異種ドメイン適応の双方において、標準ベンチマークにおける最先端の手法よりも大幅に優れている。
論文 参考訳(メタデータ) (2021-06-10T05:01:20Z) - Unsupervised Person Re-identification via Simultaneous Clustering and
Consistency Learning [22.008371113710137]
静止画からの視覚的一貫性とトレーニングプロセス中の時間的一貫性を学習することにより、教師なし再IDのプリテキストタスクを設計します。
2つのエンコードされたビューを同じクラスタにグループ化し、ビュー間の視覚的一貫性を高めることで、モデルを最適化する。
論文 参考訳(メタデータ) (2021-04-01T02:10:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。