論文の概要: AutoConcept: Training-Free Concept-Guided Reranking for Metadata-Available Composed Image Retrieval
- arxiv url: http://arxiv.org/abs/2609.01456v1
- Date: Tue, 01 Sep 2026 16:00:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.829205
- Title: AutoConcept: Training-Free Concept-Guided Reranking for Metadata-Available Composed Image Retrieval
- Title(参考訳): AutoConcept: メタデータ対応のコンポジション画像検索のためのトレーニング不要なコンセプトガイド
- Authors: Tianyu Wang, Tianjiao Wu,
- Abstract要約: 合成画像検索(CIR)は、基準画像から目標画像とテキスト修正とを検索する。
本稿では,概念証拠を解釈可能なメモリに変換するトレーニング不要のリランカであるAutoConceptを紹介する。
FashionIQでは、AutoConceptはWeiMoCIRよりも大幅に早期に改善され、LinCIR候補プールでは一貫したプラグインゲインが得られる。
- 参考スコア(独自算出の注目度): 6.071234927011628
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Composed image retrieval (CIR) retrieves a target image from a reference image and a text modification. This paper studies metadata-available CIR reranking, where a fixed CIR model first returns a candidate pool and gallery metadata is then used for second-stage concept-guided scoring. We introduce AutoConcept, a training-free reranker that converts concept evidence into an interpretable memory. AutoConcept filters noisy concepts, activates query-relevant positive constraints with an auxiliary negative penalty, and combines base retrieval scores with metadata-based concept-candidate alignment through inference-time calibration. On FashionIQ, AutoConcept yields significant early-rank improvements over WeiMoCIR and consistent plug-in gains on LinCIR candidate pools. Metadata-aware controls show that structured concept memory adds signal beyond direct query-text and extracted-attribute matching, while a query-only variant further supports the effectiveness of concept-level reranking. A supplementary real-human concept-label study indicates that the same memory interface can consume participant-provided evidence. These results position AutoConcept as an interpretable concept-memory reranker for product-style CIR galleries with available metadata.
- Abstract(参考訳): 合成画像検索(CIR)は、基準画像から目標画像とテキスト修正とを検索する。
本稿では,CIRモデルがまず候補プールを返却し,次にギャラリーメタデータを第2段階のコンセプト誘導スコアリングに使用する,メタデータ利用のCIR再分類について検討する。
本稿では,概念証拠を解釈可能なメモリに変換するトレーニング不要のリランカであるAutoConceptを紹介する。
AutoConceptはノイズの多い概念をフィルタし、クエリ関連正の制約を補助的な負のペナルティで活性化し、ベース検索スコアとメタデータベースの概念候補アライメントを推論時キャリブレーションによって組み合わせる。
FashionIQでは、AutoConceptはWeiMoCIRよりも大幅に早期に改善され、LinCIR候補プールでは一貫したプラグインゲインが得られる。
メタデータ対応制御は、構造化されたコンセプトメモリが直接クエリテキストと抽出属性マッチング以外の信号を追加することを示している。
補助的なリアルヒューマンの概念ラベルの研究は、同じメモリインタフェースが参加者が提供する証拠を消費できることを示している。
これらの結果はAutoConceptを、利用可能なメタデータを備えた製品スタイルのCIRギャラリーの解釈可能なコンセプトメモリリランカとして位置づけている。
関連論文リスト
- DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval [52.15696141238419]
ゼロショット合成画像検索(ZS-CIR)は、参照画像と編集テキストからなるマルチモーダルクエリから対象画像を検索することを目的としている。
提案するDiCE-CIRは,参照画像と編集テキストを直接合成することで,合成されたクエリ表現を予測する直接合成学習手法である。
論文 参考訳(メタデータ) (2026-07-06T04:37:30Z) - IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval [25.497247372090758]
Composed Video Retrieval (CVR) は、修正テキストによって修正された参照ビデオと一致するターゲットビデオを取得するように設計されている。
IMAGINEは動的マルチモーダルプロトタイプを通じて暗黙のセマンティクス(決定されたスキーマ画像)を実現する。
IMAGINEは、CVRとComposeed Image Retrieval(CIR)の両方で、広く使用されている3つのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-06T12:46:19Z) - FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval [24.83808020078209]
合成画像検索(CIR)は、テキスト記述によって修正された参照画像を表す対象画像の検索を目的としている。
近年の視覚言語モデル (VLM) は、画像とテキストを共有空間に埋め込んで有望なCIR性能を実現し、検索を行う。
FIRE-CIRは、合成推論と解釈可能性をCIRのファッションにもたらすモデルである。
論文 参考訳(メタデータ) (2026-04-10T08:50:47Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval [64.14282916266998]
Composed Image Retrievalは、参照画像と修正テキストからなるハイブリッドクエリに基づいてターゲット画像を取得することを目的としている。
本稿では,診断・生成・再定義パイプラインに従うモデルに依存しないフレームワークであるReCALLを提案する。
CIRRとFashionIQの実験では、ReCALLは継続的に劣化した機能を再検討し、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-02T04:52:54Z) - CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning [93.05917922306196]
Composed Image Retrieval (CIR) は、参照画像と修正テキストから対象画像を見つけることを目的としている。
CIR-CoTは、明示的なChain-of-Thought (CoT)推論を統合するために設計された最初のエンドツーエンド検索指向MLLMである。
論文 参考訳(メタデータ) (2025-10-09T09:41:45Z) - Can we repurpose multiple-choice question-answering models to rerank retrieved documents? [0.0]
R* は概念実証モデルであり、文書の再ランク付けのための多重選択質問回答(MCQA)モデルを調和させる。
実験的な検証により、R*は検索精度を向上し、フィールドの進歩に寄与することが証明される。
論文 参考訳(メタデータ) (2025-03-06T17:53:24Z) - CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval [13.59418209417664]
Zero-Shot Composed Image Retrieval (ZS-CIR) は、サンプルをトレーニングすることなく、合成クエリから情報を統合してターゲット画像を取得することを目的としている。
我々は,ZS-CIRのためのトレーニングフリーフレームワークであるCoTMRを提案し,新しいChain-of-Thought(CoT)とマルチスケール推論を提案する。
論文 参考訳(メタデータ) (2025-02-28T08:12:23Z) - Explain via Any Concept: Concept Bottleneck Model with Open Vocabulary Concepts [8.028021897214238]
OpenCBMはオープン語彙の概念を持つ最初のCBMである。
ベンチマークデータセットCUB-200-2011の分類精度は,従来のCBMよりも9%向上した。
論文 参考訳(メタデータ) (2024-08-05T06:42:00Z) - Zero-shot Composed Text-Image Retrieval [72.43790281036584]
合成画像検索(CIR)の問題点を考察する。
テキストや画像などのマルチモーダル情報を融合し、クエリにマッチする画像を正確に検索し、ユーザの表現能力を拡張できるモデルをトレーニングすることを目的としている。
論文 参考訳(メタデータ) (2023-06-12T17:56:01Z) - Contextual Similarity Aggregation with Self-attention for Visual
Re-ranking [96.55393026011811]
本稿では,自己注意を伴う文脈的類似性集約による視覚的再ランク付け手法を提案する。
提案手法の汎用性と有効性を示すため,4つのベンチマークデータセットの総合的な実験を行った。
論文 参考訳(メタデータ) (2021-10-26T06:20:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。