論文の概要: SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval
- arxiv url: http://arxiv.org/abs/2608.03120v1
- Date: Tue, 04 Aug 2026 04:41:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.037296
- Title: SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval
- Title(参考訳): SeCo-SBIR:ゼロショットスケッチに基づく画像検索のための逐次一貫したプロンプト学習
- Abstract要約: SeCo-SBIRはゼロショットスケッチに基づく画像検索のための意味論的に一貫した学習フレームワークである。
分類、一般化、データセット間の3つの標準ZS-SBIRベンチマークの最先端結果を達成する。
- 参考スコア(独自算出の注目度): 2.018258593552284
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting CLIP for zero-shot sketch-based image retrieval (ZS-SBIR) via prompt learning faces a fundamental tension: the model must bridge the sketch-photo domain gap through task-specific adaptation, yet the added flexibility risks overfitting to seen training categories and eroding CLIP's zero-shot generalization. We present SeCo-SBIR, a semantically consistent prompt learning framework that resolves this tension from both sides. First, a text-guided multi-modal prompting strategy routes learnable prompt vectors through CLIP's text encoder and projects the resulting intermediate representations into the visual encoder at every layer via learnable coupling functions. Because the text encoder has already learned robust, abstract category-level semantics from large-scale language supervision, this mechanism injects transferable semantic knowledge directly into the visual pathway - adapting the model to the sketch-photo domain while inherently favoring generalization to unseen classes. Second, a perturbation-based consistency constraint addresses the residual overfitting risk from the learnable coupling functions by aligning the adapted model with a frozen CLIP reference branch using an asymmetric InfoNCE objective - augmented inputs feed the frozen branch while clean inputs feed the trainable branch - anchoring the learned representations to CLIP's generalizable feature space. Together with lightweight adapters and a multi-objective loss combining triplet, NT-Xent, and classification terms, SeCo-SBIR achieves state-of-the-art results on all three standard ZS-SBIR benchmarks across categorical, generalized, and across-dataset settings.
- Abstract(参考訳): モデルには、タスク固有の適応を通じてスケッチ-フォトドメインギャップをブリッジする必要があるが、トレーニングカテゴリに過度に適合し、CLIPのゼロショット一般化を損なう柔軟性リスクが追加されている。
本稿では,この緊張を両面から解消する意味論的に一貫した学習フレームワークであるSeCo-SBIRを提案する。
第一に、テキスト誘導型マルチモーダルプロンプト戦略は、CLIPのテキストエンコーダを介して学習可能なプロンプトベクターをルートし、学習可能な結合関数を介して各レイヤの視覚エンコーダに中間表現を投影する。
テキストエンコーダは、すでに大規模な言語管理から、堅牢で抽象的なカテゴリレベルのセマンティクスを学習しているため、このメカニズムは、変換可能なセマンティクスの知識を直接視覚経路に注入する。
第二に、摂動ベースの一貫性制約は、非対称InfoNCEオブジェクトを使用して、適応モデルと凍結されたCLIP参照ブランチを整列することにより、学習可能な結合関数からの残留過適合リスクに対処する。
軽量アダプタと、三重項、NT-Xent、分類項を組み合わせた多目的損失と合わせて、SeCo-SBIRは分類、一般化、データセット間設定の3つの標準ZS-SBIRベンチマークの最先端結果を達成する。
関連論文リスト
- DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval [52.15696141238419]
ゼロショット合成画像検索(ZS-CIR)は、参照画像と編集テキストからなるマルチモーダルクエリから対象画像を検索することを目的としている。
提案するDiCE-CIRは,参照画像と編集テキストを直接合成することで,合成されたクエリ表現を予測する直接合成学習手法である。
論文 参考訳(メタデータ) (2026-07-06T04:37:30Z) - Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval [61.75093083322011]
DeCIRは推論複雑性を増大させることなくプロジェクションベースのZS-CIRを一貫して改善することを示す。
CIRR、CIRCO、FashionIQ、GeneCISの実験により、DeCIRは推論複雑性を増大させることなく、射影ベースのZS-CIRを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-08T18:55:41Z) - CLNet: Cross-View Correspondence Makes a Stronger Geo-Localizationer [48.52152634356309]
本稿では,異なるビュー間の意味的および幾何学的ギャップを明示的に橋渡しする,CLNetと呼ばれる通信対応機能改善フレームワークを提案する。
CLNetはビューアライメントプロセスを3つの学習可能な補完モジュールに分解する。
提案するCLNetは、より優れた解釈性と一般化性を提供しながら、最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-16T16:31:41Z) - SETR: A Two-Stage Semantic-Enhanced Framework for Zero-Shot Composed Image Retrieval [4.230223288110963]
Zero-shot Composed Image Retrieval (ZS-CIR)は、トリプルトアノテーションに頼ることなく、参照画像と相対テキストが与えられたターゲット画像を取得することを目的としている。
既存のCLIPベースの手法では、(1)組合ベースの特徴融合は、意図した変更を希釈する無関係な背景の詳細を担いながら、すべての視覚的手がかりを無差別に集約し、(2)CLIP埋め込みからのグローバルなコサイン類似性は、きめ細かいセマンティックな関係を解く能力に欠ける。
論文 参考訳(メタデータ) (2025-09-30T09:41:52Z) - DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition [59.203152078315235]
Open-Vocabulary Multi-Label Recognition (OV-MLR)は、画像内の複数の見えないオブジェクトカテゴリを識別することを目的としている。
ビジョンランゲージ事前学習モデルは強力なオープン語彙基盤を提供するが、弱い監督下では微粒な局所化に苦慮する。
本稿では,これらの制約を克服するためのDART(Dual Adaptive Refinement Transfer)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-07T17:22:33Z) - DiSa: Directional Saliency-Aware Prompt Learning for Generalizable Vision-Language Models [5.027492394254859]
DiSa は Directional Saliency-Aware Prompt Learning フレームワークである。
一般化を強化するために2つの補完正則化戦略を統合する。
さまざまな設定において、最先端のプロンプト学習方法よりも一貫して優れています。
論文 参考訳(メタデータ) (2025-05-26T00:14:52Z) - SketchYourSeg: Mask-Free Subjective Image Segmentation via Freehand Sketches [116.1810651297801]
SketchYourSegは、主観的なイメージセグメンテーションのための強力なクエリモダリティとして、フリーハンドスケッチを確立している。
我々の評価は、様々なベンチマークで既存のアプローチよりも優れた性能を示している。
論文 参考訳(メタデータ) (2025-01-27T13:07:51Z) - Elevating All Zero-Shot Sketch-Based Image Retrieval Through Multimodal Prompt Learning [11.033050922826934]
凍結したCLIPバックボーンで動作するように設計された,新しいマルチモーダル・プロンプト学習方式であるSpLIPを紹介する。
SpLIPは双方向のプロンプト共有戦略を実装し、CLIPのビジュアルエンコーダとテキストエンコーダ間の相互知識交換を可能にする。
埋め込み空間をさらに洗練するための2つの革新的な戦略を提案する。
論文 参考訳(メタデータ) (2024-07-05T01:30:42Z) - No Token Left Behind: Explainability-Aided Image Classification and
Generation [79.4957965474334]
ここでは、CLIPが入力のすべての関連する意味的部分に焦点を当てることを保証するために、損失項を追加する新しい説明可能性に基づくアプローチを提案する。
本手法は, 追加訓練や微調整を伴わずに, 認識率の向上を図っている。
論文 参考訳(メタデータ) (2022-04-11T07:16:39Z) - Semantically Tied Paired Cycle Consistency for Any-Shot Sketch-based
Image Retrieval [55.29233996427243]
ローショットスケッチに基づく画像検索はコンピュータビジョンの新たな課題である。
本稿では,ゼロショットおよび少数ショットのスケッチベース画像検索(SBIR)タスクについて述べる。
これらの課題を解決するために,SEM-PCYC(SEM-PCYC)を提案する。
以上の結果から,Sketchy,TU-Berlin,QuickDrawのデータセットを拡張したバージョンでは,最先端の撮影性能が大幅に向上した。
論文 参考訳(メタデータ) (2020-06-20T22:43:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。