論文の概要: CoCo-IR: Contextual Composed Image Retrieval
- arxiv url: http://arxiv.org/abs/2608.05149v1
- Date: Wed, 05 Aug 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.078816
- Title: CoCo-IR: Contextual Composed Image Retrieval
- Title(参考訳): CoCo-IR:コンテキスト構成イメージ検索
- Authors: Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui,
- Abstract要約: Contextual Composed Image Retrieval (CoCo-IR)は、ユーザが対話を通じて検索結果を徐々に洗練させる新しいタスクである。
本稿では,CoCo-IRの文脈認識推論として機能するLarge Multimodal Model(LMM)に基づく新しいモデルを提案する。
我々のモデルは、回転するたびに進化する変換可能な画像埋め込み(TIE)を生成するために、インタラクション履歴全体を解釈する。
- 参考スコア(独自算出の注目度): 53.842921823810364
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Current instruction-based image retrieval systems are powerful but limited to single-turn interactions, failing to capture the iterative nature of complex, real-world visual searches. To overcome this limitation, we introduce Contextual Composed Image Retrieval (CoCo-IR), a novel task that enables users to progressively refine search results through interactions. We address this new task by proposing a new model based on a Large Multimodal Model (LMM) that functions as a context-aware reasoner for CoCo-IR. Our model interprets the entire interaction history to generate Transformable Image Embeddings (TIE) that evolve across turns. To fuel the model training without expensive human annotations, we develop a fully autonomous, scalable data engine that leverages LMMs to generate high-quality contextual retrieval data, and uses model-guided verification to mine challenging hard negatives. Extensive experiments demonstrate that our approach establishes new state-of-the-art performance: We achieve 39.4 mAP@5 on the challenging single-turn benchmark CIRCO; furthermore, on our new CoCo-IR benchmark, our model maintains robust performance with 44.1 R@1 on 4-turn dialogues, dramatically outperforming existing methods (28.2 4-turn R@1) that fail to handle multi-turn context. Project page: https://CoCo-IR.github.io.
- Abstract(参考訳): 現在の命令ベースの画像検索システムは強力だが、シングルターンのインタラクションに限られており、複雑な実世界のビジュアル検索の反復的な性質を捉えていない。
この制限を克服するために、ユーザが対話を通じて検索結果を徐々に洗練させる新しいタスクであるContextual Composed Image Retrieval (CoCo-IR)を導入する。
本稿では,CoCo-IRのコンテキスト対応推論器として機能するLMM(Large Multimodal Model)に基づく新しいモデルを提案する。
我々のモデルは、回転するたびに進化する変換可能な画像埋め込み(TIE)を生成するために、インタラクション履歴全体を解釈する。
高価な人間のアノテーションを使わずにモデルトレーニングを促進するため,LMMを利用して高品質な文脈検索データを生成する完全自律スケーラブルなデータエンジンを開発した。
我々は、挑戦的なシングルターンベンチマークCIRCOで39.4 mAP@5を達成し、さらに、新しいCoCo-IRベンチマークでは、4ターン対話で44.1 R@1で堅牢なパフォーマンスを維持し、マルチターンコンテキストの処理に失敗する既存のメソッド(28.2 4ターンR@1)を劇的に上回ります。
プロジェクトページ: https://CoCo-IR.github.io
関連論文リスト
- FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval [39.372170257570595]
本稿では, 細粒度マルチモーダル・クインタプル・データセット構築パイプラインと, 細粒度マルチモーダル・ファインタニング・ストラテジーを提案する。
提案手法では, 微調整過程を, 1) 微粒なコンテキスト推論指向の微調整, (2) 微粒な検索指向の微調整の2段階に分けている。
論文 参考訳(メタデータ) (2026-07-30T10:06:11Z) - Co-Training Vision Language Models for Remote Sensing Multi-task Learning [68.15604397741753]
視覚言語モデル(VLM)は、RS画像理解、グラウンド化、超高解像度(UHR)画像推論において有望な結果を得た。
本稿では,RSMTLのための簡易かつ柔軟なVLMベースラインであるRSCoVLMを提案する。
本稿では、RS画像に固有の多様な画像スケールに対処する、統一された動的解像度戦略を提案する。
論文 参考訳(メタデータ) (2025-11-26T10:55:07Z) - DAFM: Dynamic Adaptive Fusion for Multi-Model Collaboration in Composed Image Retrieval [2.330678113289435]
合成画像検索(CIR)におけるマルチモデル協調のための動的適応融合(DAFM)を提案する。
提案手法は,CIRR上のRecall@10,CIRR上のRmean84.43,FashionIQ上のRmean67.48を実現し,最近の強いベースラインを最大4.5%超えた。
論文 参考訳(メタデータ) (2025-11-07T06:51:10Z) - CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning [93.05917922306196]
Composed Image Retrieval (CIR) は、参照画像と修正テキストから対象画像を見つけることを目的としている。
CIR-CoTは、明示的なChain-of-Thought (CoT)推論を統合するために設計された最初のエンドツーエンド検索指向MLLMである。
論文 参考訳(メタデータ) (2025-10-09T09:41:45Z) - Generalized Contrastive Learning for Universal Multimodal Retrieval [53.70202081784898]
クロスモーダル検索モデル(例えばCLIP)は、融合した画像テキストのモダリティからなるキーを検索することで、劣化したパフォーマンスを示す。
本稿では,新たなデータセットキュレーションを必要とせずに,マルチモーダル検索性能を向上させる新しい損失定式化である汎用コントラスト学習(GCL)を提案する。
論文 参考訳(メタデータ) (2025-09-30T01:25:04Z) - CoLLM: A Large Language Model for Composed Image Retrieval [76.29725148964368]
Composed Image Retrieval (CIR)は、マルチモーダルクエリに基づいた画像検索を目的とした複雑なタスクである。
本稿では,イメージキャプションペアからトリプレットをオンザフライで生成するワンストップフレームワークであるCoLLMを提案する。
我々はLarge Language Models (LLMs) を利用して参照画像の埋め込みと修正テキストを生成する。
論文 参考訳(メタデータ) (2025-03-25T17:59:50Z) - Zero-shot Composed Text-Image Retrieval [72.43790281036584]
合成画像検索(CIR)の問題点を考察する。
テキストや画像などのマルチモーダル情報を融合し、クエリにマッチする画像を正確に検索し、ユーザの表現能力を拡張できるモデルをトレーニングすることを目的としている。
論文 参考訳(メタデータ) (2023-06-12T17:56:01Z) - Data Roaming and Quality Assessment for Composed Image Retrieval [25.452015862927766]
Composed Image Retrieval (CoIR)は、画像とテキストのモダリティを組み合わせたクエリで、ユーザがより効果的にインテントを表現できるようにする。
我々は,既存のものより10倍大きい新しいCoIRデータセットであるLaSCoデータセットを紹介する。
また、新しいCoIRベースラインであるCASE(Cross-Attention driven Shift)も導入する。
論文 参考訳(メタデータ) (2023-03-16T16:02:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。