論文の概要: Generative Retrieval for Unsupervised Text-Based Person Search
- arxiv url: http://arxiv.org/abs/2609.12965v1
- Date: Fri, 11 Sep 2026 15:25:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.796019
- Title: Generative Retrieval for Unsupervised Text-Based Person Search
- Title(参考訳): 教師なしテキストに基づく人物検索のための生成検索
- Abstract要約: テキストベースの人物検索(TBPS)は,ある自然言語記述に基づいて,大きな画像ギャラリーから対象者の画像を検索することを目的としている。
本稿では,2段階の世代別検索フレームワークであるGTR+を提案する。
また、高品質できめ細かいテキストアノテーションを備えた大規模TBPSデータセットであるLargeFine-Personにもコントリビュートしています。
- 参考スコア(独自算出の注目度): 77.46429603553388
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-based person search (TBPS) aims to retrieve images of a target person from a large image gallery based on a given natural language description. Most existing methods rely on supervised learning with manually annotated image-text pairs. In this paper, we explore unsupervised TBPS, with only unlabeled images. We propose GTR+, a two-stage generation-then-retrieval framework. In the generation stage, we introduce a tiered description generation framework designed to produce fine-grained and stylistically diverse textual descriptions through a three-tier sequential process. The base tier leverages an automated question-and-answer mechanism to generate basic visual attribute descriptions; the intermediate tier enhances fine-grained detail using an inter-sample contrastive mechanism; the advanced tier further enriches textual diversity via a stylized expansion mechanism. In the retrieval stage, to mitigate the impact of noisy pseudo texts, we develop an adaptive confidence-weighted retrieval learning framework. We model image-text pairs as clean or noisy using a Gaussian Mixture Model, calibrated by real-time image-text similarity and static text generation probability from the prior stage, yielding adaptive sample weights during training. Beyond that, we also contribute LargeFine-Person, a large-scale TBPS dataset with high-quality, fine-grained, and diverse textual annotations, enabling a practical and generalizable TBPS pre-training benchmark under unsupervised setting. Experiments on multiple TBPS benchmarks demonstrate the effectiveness and generalization of both GTR+ and LargeFine-Person. Code is available at: https://github.com/Flame-Chasers/GTR.
- Abstract(参考訳): テキストベースの人物検索(TBPS)は,ある自然言語記述に基づいて,大きな画像ギャラリーから対象者の画像を検索することを目的としている。
既存のほとんどの手法は手動の注釈付き画像テキストペアによる教師あり学習に依存している。
本稿では,未ラベル画像のみを用いて,教師なしTBPSを探索する。
本稿では,2段階の世代別検索フレームワークであるGTR+を提案する。
生成段階では、3階層のシーケンシャルプロセスを通じて細粒度でスタイリッシュに多彩なテキスト記述を生成するように設計された階層記述生成フレームワークを導入する。
ベース層は、自動質問・回答機構を利用して、基本的な視覚的属性記述を生成する。中間層は、サンプル間コントラスト機構を使用してきめ細かな詳細性を高める。
検索段階において、ノイズの多い擬似テキストの影響を軽減するために、適応的信頼度重み付き検索学習フレームワークを開発する。
我々はガウス混合モデルを用いて画像テキストペアをクリーンまたはノイズとしてモデル化し、実時間画像テキスト類似度と静的テキスト生成確率を事前から調整し、トレーニング中に適応的なサンプル重量を生成する。
さらに、高品質できめ細かな多彩なテキストアノテーションを備えた大規模TBPSデータセットであるLargeFine-Personも提供しています。
複数のTBPSベンチマークの実験では、GTR+とLargeFine-Personの有効性と一般化が示されている。
コードは、https://github.com/Flame-Chasers/GTRで入手できる。
関連論文リスト
- Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences [23.022496443851235]
画像と生成されたテキストが与えられた場合、テキスト・ツー・イメージ・モデルを用いてテキストを画像空間にマッピングし、元の画像と再構成との類似性を計算する。
サイクル一貫性スコアを用いて候補をランク付けし、866K比較ペアの選好データセットを構築する。
データセットであるCycleRewardでトレーニングされた報酬モデルは、詳細なキャプションに関する最先端のアライメント指標よりも優れています。
論文 参考訳(メタデータ) (2025-06-02T17:42:58Z) - Semi-supervised Text-based Person Search [47.14739994781334]
既存の手法は、完全教師付き学習において十分な性能を達成するために、大量の注釈付き画像テキストデータに依存している。
本稿では,半教師付きTBPSの世代別検索に基づく2段階基本解を提案する。
本稿では,ノイズの多いデータを扱うための検索モデルの能力を高めるためのノイズロバスト検索フレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-28T07:47:52Z) - Leveraging Unpaired Data for Vision-Language Generative Models via Cycle
Consistency [47.3163261953469]
現在の視覚言語生成モデルは、最適な性能と一般化能力を達成するために、ペア画像テキストデータの拡張コーパスに依存している。
サイクル整合性の概念に基づく革新的なトレーニングパラダイムであるITITを導入する。
ITITは、分離された画像とテキストデコーダを備えたジョイントな画像テキストエンコーダで構成され、単一のフレームワークで双方向の画像テキスト生成とテキスト画像生成を可能にする。
論文 参考訳(メタデータ) (2023-10-05T17:55:19Z) - ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations [43.323791505213634]
ASPIRE (Language-guided Data Augmentation for SPurious correlation Removal) は、スプリアスな特徴のない画像でトレーニングデータセットを補完するソリューションである。
トレーニングセットにグループラベルや既存の非スパースイメージを必要とせずに、非スパース画像を生成することができる。
先行手法の最悪のグループ分類精度を1%から38%向上させる。
論文 参考訳(メタデータ) (2023-08-19T20:18:15Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - Text-based Person Search without Parallel Image-Text Data [52.63433741872629]
テキストベースの人物探索(TBPS)は,対象者の画像を与えられた自然言語記述に基づいて大きな画像ギャラリーから検索することを目的としている。
既存の手法は、並列画像テキストペアによるトレーニングモデルによって支配されており、収集には非常にコストがかかる。
本稿では,並列画像テキストデータなしでTBPSを探索する試みについて述べる。
論文 参考訳(メタデータ) (2023-05-22T12:13:08Z) - Variational Distribution Learning for Unsupervised Text-to-Image
Generation [42.3246826401366]
本稿では,訓練中に画像のテキストキャプションが利用できない場合に,ディープニューラルネットワークに基づくテキスト画像生成アルゴリズムを提案する。
画像と対応するテキストの埋め込みを結合空間に適切に整列できる事前訓練されたCLIPモデルを用いる。
画像テキストCLIP埋め込みのペア上での条件付きデータログを最大化することにより、テキスト・画像生成モデルを最適化する。
論文 参考訳(メタデータ) (2023-03-28T16:18:56Z) - SpaText: Spatio-Textual Representation for Controllable Image Generation [61.89548017729586]
SpaTextはオープン語彙シーン制御を用いたテキスト・ツー・イメージ生成の新しい手法である。
シーン全体を記述したグローバルテキストプロンプトに加えて、ユーザはセグメンテーションマップを提供する。
現状拡散モデルである画素ベースと潜在条件ベースでの有効性を示す。
論文 参考訳(メタデータ) (2022-11-25T18:59:10Z) - eDiffi: Text-to-Image Diffusion Models with an Ensemble of Expert
Denoisers [87.52504764677226]
大規模拡散に基づく生成モデルは、テキスト条件の高解像度画像合成においてブレークスルーをもたらした。
異なる段階合成に特化したテキスト・画像拡散モデルのアンサンブルを訓練する。
eDiffiと呼ばれる拡散モデルのアンサンブルは、同じ推論コストを維持しながらテキストアライメントを改善する。
論文 参考訳(メタデータ) (2022-11-02T17:43:04Z) - Re-Imagen: Retrieval-Augmented Text-to-Image Generator [58.60472701831404]
検索用テキスト・ツー・イメージ・ジェネレータ(再画像)
検索用テキスト・ツー・イメージ・ジェネレータ(再画像)
論文 参考訳(メタデータ) (2022-09-29T00:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。