論文の概要: PailitaoGR: Latent Think-with-Images for Generative Image Retrieval
- arxiv url: http://arxiv.org/abs/2608.26658v1
- Date: Thu, 27 Aug 2026 06:12:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.255852
- Title: PailitaoGR: Latent Think-with-Images for Generative Image Retrieval
- Title(参考訳): PailitaoGR: 画像検索のための画像付き潜在シンク
- Authors: Xiaomeng Fan, Yueran Liu, Shengyu Zhou, Chenghan Fu, Wanxian Guan, Feng Li, Chuan Yu, Jian Xu, Bo Zheng,
- Abstract要約: 生成画像検索のためのemphLatent Think-with-Images法である textbfPailitaoGR を提案する。
探索対象の視覚的トークンを識別・拡張するターゲット中心認識機構を設計する。
また,補助的証拠の視覚的トークンを識別・拡張する選択的補助証拠利用機構を設計する。
- 参考スコア(独自算出の注目度): 15.300812966654691
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generative retrieval has demonstrated strong performance by directly generating product semantic identifiers (SIDs). Extending this paradigm to image search, however, is nontrivial because real-world query images contain diverse information, including the search target, useful auxiliary evidence, and irrelevant visual content. This requires the model to identify and focus on the search target while selectively utilizing auxiliary evidence. In this paper, we propose \textbf{PailitaoGR}, a \emph{Latent Think-with-Images} method for generative image retrieval, which internalizes target-focused perception and selective auxiliary-evidence utilization into a the generative retrieval model, enabling \textit{Zooming without Cropping} and \textit{Reading without OCR}. Specifically, we design a target-focused perception mechanism that identifies and enhances visual tokens of the search target, consisting of a target Enhancer and a learning strategy based on on-policy distillation and attention guidance loss, enabling the model to focus on search-target regions. We also design a selective auxiliary-evidence utilization mechanism that identifies and enhances visual tokens of auxiliary evidence, including an auxiliary enhancer and an in-capacity incremental contrastive distillation strategy, enabling the model to exploit auxiliary evidence. We construct training and validation sets sampled from real-world online image-search logs. Experiments show that our method outperforms existing baselines by an average of 13.8\%, validating its effectiveness.
- Abstract(参考訳): 生成的検索は製品セマンティック識別子(SID)を直接生成することで高い性能を示した。
しかし、このパラダイムを画像検索に拡張することは、現実のクエリ画像には、検索対象、有用な補助的証拠、無関係な視覚的内容を含む多様な情報が含まれているため、簡単ではない。
これにより、補助的証拠を選択的に活用しながら、探索対象を特定し、焦点を合わせる必要がある。
本稿では,画像生成モデルに目標中心の認識と選択的補助的エビデンス利用を内包し,OCRを含まない‘textit{Zooming without Cropping} と \textit{Reading without OCR} を可能にする,画像生成のための \emph{Latent Think-with-Images} 法である \textbf{PailitaoGR} を提案する。
具体的には、対象のエンハンサーと、オン・ポリケーションとアテンション誘導損失に基づく学習戦略からなる探索対象の視覚的トークンを特定し、拡張するターゲット中心認識機構を設計し、モデルが探索対象領域に集中できるようにする。
また,補助エビデンスの視覚トークンを識別・拡張する選択的補助エビデンス利用機構を設計し,補助エビデンスを利用して補助エビデンスを活用できるようにする。
実世界のオンライン画像検索ログから抽出したトレーニングセットと検証セットを構築した。
実験の結果,提案手法は既存のベースラインを平均13.8 %上回る性能を示し,その有効性を検証した。
関連論文リスト
- Boosting Robust AIGI Detection with LoRA-based Pairwise Training [55.076681464804636]
現在のAIGI検出器はクリーンなデータセットで良好に動作しますが、その検出性能は"野生"に展開すると低下します。
本稿では,高度歪み下でのAIGIの堅牢な検出を実現するために,Lo-based Pairwise Training (RA) 戦略を提案する。
論文 参考訳(メタデータ) (2026-04-14T05:35:32Z) - DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories [52.57197752244638]
本稿では,画像検索を自律探索タスクとして再構成する新しいエージェントパラダイムであるDeepImageSearchを紹介する。
モデルは、暗黙の文脈的手がかりに基づいてターゲットを特定するために、生の視覚履歴に対して多段階の推論を計画し実行しなければならない。
DisBenchは、相互接続された視覚データ上に構築された、挑戦的なベンチマークである。
論文 参考訳(メタデータ) (2026-02-11T12:51:10Z) - Unbiased Semantic Decoding with Vision Foundation Models for Few-shot Segmentation [36.731980769369834]
我々は,Segment Anything Model(SAM)と統合したunbiased Semantic Decoding(USD)戦略を提案する。
USD戦略は、一貫した予測を行うために、サポートセットとクエリセットの両方からターゲット情報を同時に抽出する。
ターゲット中心のプロンプト埋め込みを生成するために、学習可能なビジュアルテキストターゲットプロンプト生成器を提案する。
論文 参考訳(メタデータ) (2025-11-19T04:41:43Z) - Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation [90.71613903956451]
テキスト・ツー・イメージ検索はマルチメディア処理における基本的な課題である。
本稿では,AVGという自己回帰ボウケン生成手法を提案する。
AVGは有効性と有効性の両方において優れた結果が得られることを示す。
論文 参考訳(メタデータ) (2024-07-24T13:39:51Z) - Enrich the content of the image Using Context-Aware Copy Paste [1.450405446885067]
本稿では,By Latent Information Propagation (BLIP) を組み込んだコンテキスト認識手法を提案する。
抽出したコンテンツ情報とカテゴリ情報とをマッチングすることにより,Segment Anything Model (SAM) と You Only Look Once (YOLO) を用いて対象物の密結合性を確保する。
各種データセットを対象とした実験により,データ多様性の向上と高品質な擬似画像の生成において,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-07-11T03:07:28Z) - Advancements in Content-Based Image Retrieval: A Comprehensive Survey of
Relevance Feedback Techniques [0.0]
コンテントベース画像検索(CBIR)システムはコンピュータビジョンの分野で重要なツールとして登場してきた。
本稿では,対象検出におけるCBIRの役割と,コンテンツ特徴に基づく視覚的に類似した画像の識別と検索の可能性について,包括的に概説する。
低レベルの特徴と高レベルのセマンティック概念の相違から生じるセマンティックギャップについて詳述し、このギャップを橋渡しするためのアプローチを探る。
論文 参考訳(メタデータ) (2023-12-13T11:07:32Z) - CiteTracker: Correlating Image and Text for Visual Tracking [114.48653709286629]
我々は、画像とテキストを接続することで、視覚的トラッキングにおけるターゲットモデリングと推論を強化するCiteTrackerを提案する。
具体的には、ターゲット画像パッチを記述テキストに変換するテキスト生成モジュールを開発する。
次に、注目に基づく相関モジュールを用いて対象記述と検索画像を関連付け、対象状態参照のための相関特徴を生成する。
論文 参考訳(メタデータ) (2023-08-22T09:53:12Z) - IRGen: Generative Modeling for Image Retrieval [82.62022344988993]
本稿では,画像検索を生成モデルの一種として再フレーミングする新しい手法を提案する。
我々は、イメージを意味単位の簡潔なシーケンスに変換するという技術的課題に対処するため、IRGenと呼ばれるモデルを開発した。
本モデルは,広範に使用されている3つの画像検索ベンチマークと200万件のデータセットに対して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-03-17T17:07:36Z) - Revisiting The Evaluation of Class Activation Mapping for
Explainability: A Novel Metric and Experimental Analysis [54.94682858474711]
クラスアクティベーションマッピング(cam)アプローチは、アクティベーションマップの平均を重み付けすることで、効果的な可視化を提供する。
説明マップを定量化するための新しいメトリクスセットを提案し、より効果的な方法を示し、アプローチ間の比較を簡素化します。
論文 参考訳(メタデータ) (2021-04-20T21:34:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。