論文の概要: From Transformation to Target State: Rethinking Query Representation for Zero-Shot Composed Image Retrieval
- arxiv url: http://arxiv.org/abs/2610.05993v1
- Date: Mon, 05 Oct 2026 08:47:15 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:52:16.844585
- Title: From Transformation to Target State: Rethinking Query Representation for Zero-Shot Composed Image Retrieval
- Title(参考訳): 変換からターゲット状態へ:ゼロショット合成画像検索のためのクエリ表現再考
- Abstract要約: 合成画像検索(CIR)は、参照画像と修正テキストからなるクエリから所望の目標画像を検索することを目的としている。
修正文は参照状態からの遷移を規定し、検索候補は完了したターゲット状態を表す。
本研究では、このミスマッチを解析し、ゼロショット合成画像検索を目標状態再構成後、検索として再構成する。
- 参考スコア(独自算出の注目度): 33.18258905306188
- License:
- Abstract: Composed image retrieval (CIR) aims to retrieve a desired target image from a query consisting of a reference image and a modification text. This task exhibits an unusual representational asymmetry: the modification text specifies a transition from the reference state, whereas retrieval candidates depict completed target states. This creates a representation mismatch for zero-shot methods that query pretrained vision-language spaces directly with transformation-oriented language. We study this mismatch and reformulate zero-shot composed image retrieval as target-state reconstruction followed by retrieval. We instantiate this formulation with ASAP-CIR, a training-free framework that reconstructs a static target representation using a frozen multimodal large language model (MLLM). The representation combines multiple holistic descriptions with a variable set of importance-weighted atomic semantics, thereby preserving both overall target identity and fine-grained visual constraints. Retrieval then integrates holistic state alignment, atomic constraint grounding, and calibrated target-state evidence aggregation. A controlled text-only diagnostic shows that target-side static query formulations achieve more reliable retrieval than dynamic composed query formulations, particularly when source-state semantics must be suppressed or transformed. Experiments on FashionIQ, CIRR, and CIRCO further characterize the effectiveness and limitations of this representation principle, with the clearest gains on the multi-target CIRCO benchmark. These results show that how composed intent is represented before retrieval is a consequential design choice, distinct from the choice of retrieval backbone itself.
- Abstract(参考訳): 合成画像検索(CIR)は、参照画像と修正テキストからなるクエリから所望の目標画像を検索することを目的としている。
修正文は参照状態からの遷移を規定し、検索候補は完了したターゲット状態を表す。
これにより、事前訓練された視覚言語空間を直接変換指向言語でクエリするゼロショットメソッドの表現ミスマッチが生成される。
本研究では、このミスマッチを解析し、ゼロショット合成画像検索を目標状態再構成後、検索として再構成する。
我々は,この定式化を,凍結マルチモーダル大言語モデル(MLLM)を用いて静的なターゲット表現を再構成するトレーニングフリーフレームワークであるASAP-CIRを用いてインスタンス化する。
この表現は、複数の全体論的な記述と重要度重み付けされた原子意味論の可変セットを組み合わせることで、全体的なターゲットアイデンティティときめ細かい視覚的制約の両方を保存する。
Retrievalはその後、全体的状態アライメント、原子的制約グラウンド、および校正された目標状態証拠アグリゲーションを統合する。
制御されたテキストのみの診断では、ターゲット側の静的クエリの定式化は動的に合成されたクエリの定式化よりも信頼性の高い検索を実現している。
FashionIQ、CIRR、CIRCOの実験は、この表現原理の有効性と限界をさらに特徴づけ、マルチターゲットのCIRCOベンチマークで最も顕著な利得である。
これらの結果から, 合成意図が検索に先立ってどのように表現されるかは, 検索バックボーン自体の選択とは異なる, 連続した設計選択であることが示唆された。
関連論文リスト
- DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval [52.15696141238419]
ゼロショット合成画像検索(ZS-CIR)は、参照画像と編集テキストからなるマルチモーダルクエリから対象画像を検索することを目的としている。
提案するDiCE-CIRは,参照画像と編集テキストを直接合成することで,合成されたクエリ表現を予測する直接合成学習手法である。
論文 参考訳(メタデータ) (2026-07-06T04:37:30Z) - Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism [43.95253902432504]
PEC-CIRは、クエリ構造を多段階推論パイプラインとして構成する、トレーニング不要のフレームワークである。
PEC-CIRは、検索前に候補クエリを明示的に評価することにより、生成エラーの伝播を低減する。
論文 参考訳(メタデータ) (2026-06-30T07:04:05Z) - Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction [0.0]
合成画像検索(CIR)は、コーパスに参照画像と修正方法を記述するテキストを検索する。
本稿では,CIRRの休眠補助アノテーションと対話アノテーションを復活させる,ベンチマークおよび人間検証型ユーザシミュレータであるAmbiCIRを紹介する。
論文 参考訳(メタデータ) (2026-05-23T15:49:16Z) - DQE-CIR: Distinctive Query Embeddings through Learnable Attribute Weights and Target Relative Negative Sampling in Composed Image Retrieval [53.482391830683014]
合成画像検索(CIR)は、参照画像と、意図した変更を特定する修正テキストとを共同で解釈することにより、対象画像を検索するタスクに対処する。
既存のほとんどの手法は、基底の真理像を唯一の正の例として扱い、残りの全ての画像を負の例として扱う対照的な学習フレームワークの上に構築されている。
学習可能な属性重みとターゲットの相対的負サンプリングによるクエリ埋め込みを提案する。
論文 参考訳(メタデータ) (2026-03-04T13:17:44Z) - CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval [54.15776146365823]
Composed Image Retrieval (CIR)では、ユーザーは参照画像と操作テキストの両方を使用してターゲットイメージを検索できる。
CSMCIRは3つの相乗的コンポーネントを通して効率的なクエリターゲットアライメントを実現する統一表現フレームワークである。
論文 参考訳(メタデータ) (2026-01-07T09:21:38Z) - UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries [3.6723140587841656]
Image-Guided Retrieval with Optional Text (IGROT) は、クエリがアンカーイメージで構成され、テキストに付随するか否かに関わらず、意味論的に関連付けられたターゲットイメージを検索する一般的な検索設定である。
本研究では,低データ管理下でIGROTに対処するため,Null-textプロンプトでイメージを融合させる軽量で汎用的なターゲット表現であるUNIONを導入する。
論文 参考訳(メタデータ) (2025-11-27T09:28:28Z) - SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation [58.80001825332851]
Referring Image (RIS) は、自然言語で表現された画像に対象のオブジェクトを分割することを目的としている。
最近の手法は主に「赤い車」や「左少女」のような単純な表現に焦点を当てている
論文 参考訳(メタデータ) (2025-10-11T10:50:58Z) - IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis [46.502962768034166]
Zero-shot Referring Imageは、トレーニングや微調整なしで参照式に最も適したインスタンスマスクを特定する。
従来のCLIPモデルでは、物体の相対的な空間的関係を識別する能力が顕著に低下していた。
IteRPrimEは従来の最先端のゼロショットメソッドよりも優れており、特にドメイン外のシナリオでは優れている。
論文 参考訳(メタデータ) (2025-03-02T15:19:37Z) - Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval [92.13664084464514]
合成画像検索(CIR)の課題は,検索画像とユーザの意図を記述したテキストに基づいて画像を取得することである。
既存の手法は、CIRタスクにおける高度な大規模視覚言語(VL)モデルにおいて大きな進歩を遂げているが、それらは一般的に、モデルトレーニングのためのラベル付き三重項の欠如とリソース制限された環境への展開の困難という2つの大きな問題に悩まされている。
本稿では、VLモデルを利用して合成学習のためのラベルなし画像のみに依存する画像2Sentenceに基づく非対称ゼロショット合成画像検索(ISA)を提案する。
論文 参考訳(メタデータ) (2024-03-03T07:58:03Z) - BOSS: Bottom-up Cross-modal Semantic Composition with Hybrid
Counterfactual Training for Robust Content-based Image Retrieval [61.803481264081036]
CIR(Content-Based Image Retrieval)は,サンプル画像と補完テキストの合成を同時に解釈することで,対象画像の検索を目的とする。
本稿では,新しいアンダーラインtextbfBottom-up crunderlinetextbfOss-modal underlinetextbfSemantic compounderlinetextbfSition (textbfBOSS) とHybrid Counterfactual Training frameworkを用いてこの問題に取り組む。
論文 参考訳(メタデータ) (2022-07-09T07:14:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。