Fugu-MT 論文翻訳(概要): Leveraging Large Vision-Language Model as User Intent-aware Encoder for Composed Image Retrieval

論文の概要: Leveraging Large Vision-Language Model as User Intent-aware Encoder for Composed Image Retrieval

arxiv url: http://arxiv.org/abs/2412.11087v1
Date: Sun, 15 Dec 2024 07:09:02 GMT
ステータス: 翻訳完了
システム内更新日: 2024-12-17 15:49:59.999129
Title: Leveraging Large Vision-Language Model as User Intent-aware Encoder for Composed Image Retrieval
Title（参考訳）: 画像検索のためのユーザインテント認識エンコーダとしての大規模視覚言語モデルの活用
Authors: Zelong Sun, Dong Jing, Guoxing Yang, Nanyi Fei, Zhiwu Lu,
Abstract要約: Composed Image Retrieval (CIR) は、ユーザ意図を記述する参照画像と相対キャプションからなるハイブリッドモダリティクエリを用いて、候補セットからターゲット画像を取得することを目的としている。我々は,大規模視覚言語モデル(LVLM)を強力なユーザ意図認識エンコーダとして活用する新しいフレームワークであるCIR-LVLMを提案する。
参考スコア（独自算出の注目度）: 19.87084105344227
License: http://creativecommons.org/publicdomain/zero/1.0/
Abstract: Composed Image Retrieval (CIR) aims to retrieve target images from candidate set using a hybrid-modality query consisting of a reference image and a relative caption that describes the user intent. Recent studies attempt to utilize Vision-Language Pre-training Models (VLPMs) with various fusion strategies for addressing the task.However, these methods typically fail to simultaneously meet two key requirements of CIR: comprehensively extracting visual information and faithfully following the user intent. In this work, we propose CIR-LVLM, a novel framework that leverages the large vision-language model (LVLM) as the powerful user intent-aware encoder to better meet these requirements. Our motivation is to explore the advanced reasoning and instruction-following capabilities of LVLM for accurately understanding and responding the user intent. Furthermore, we design a novel hybrid intent instruction module to provide explicit intent guidance at two levels: (1) The task prompt clarifies the task requirement and assists the model in discerning user intent at the task level. (2) The instance-specific soft prompt, which is adaptively selected from the learnable prompt pool, enables the model to better comprehend the user intent at the instance level compared to a universal prompt for all instances. CIR-LVLM achieves state-of-the-art performance across three prominent benchmarks with acceptable inference efficiency. We believe this study provides fundamental insights into CIR-related fields.
Abstract（参考訳）: Composed Image Retrieval (CIR) は、ユーザ意図を記述する参照画像と相対キャプションからなるハイブリッドモダリティクエリを用いて、候補セットからターゲット画像を取得することを目的としている。近年の研究では、視覚言語事前学習モデル(VLPM)をタスクに対処するための様々な融合戦略で活用しようとしているが、これらの手法は通常、視覚情報を包括的に抽出し、ユーザの意図を忠実に追従するCIRの2つの重要な要件を同時に満たさない。本研究では,CIR-LVLMを提案する。CIR-LVLMは大規模視覚言語モデル(LVLM)を強力なユーザ意図認識エンコーダとして活用し,これらの要求を満たす。我々のモチベーションは、ユーザ意図を正確に理解し、応答するためのLVLMの高度な推論と指示追従能力を探ることである。さらに,(1)タスクプロンプトがタスク要求を明確にし,タスクレベルでユーザインテントを識別するモデルを支援する,という2つのレベルで明示的なインテントガイダンスを提供するための,新しいハイブリッドインテント命令モジュールを設計する。 2) 学習可能なプロンプトプールから適応的に選択されたインスタンス固有のソフトプロンプトは,すべてのインスタンスに対して普遍的なプロンプトよりも,インスタンスレベルでのユーザ意図をよりよく理解することができる。 CIR-LVLMは、推論効率が許容できる3つの主要なベンチマークで最先端のパフォーマンスを達成する。我々は,本研究がCIR関連分野の基本的な洞察を与えると考えている。

関連論文リスト

MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval [50.062817677022586]
Zero-Shot Image Retrieval (ZS-CIR) メソッドは通常、参照イメージを擬似テキストトークンに変換するアダプタを訓練する。 MLLM-Guided VLM Fine-Tuning with Joint Inference (MVFT-JI) を提案する。
論文参考訳（メタデータ） (2025-05-26T08:56:59Z)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding [53.69841526266547]
トレーニング済みのVision-Language Modelを新しいデータセットで微調整することは、ビジョンエンコーダの最適化に不足することが多い。視覚エンコーダにクエリの埋め込みを統合する,新しい,合理化されたアーキテクチャ保存アプローチであるQIDを導入する。
論文参考訳（メタデータ） (2025-04-03T18:47:16Z)
Referencing Where to Focus: Improving VisualGrounding with Referential Query [30.33315985826623]
本稿ではRefFormerと呼ばれる新しい視覚的接地手法を提案する。これはクエリ適応モジュールで構成されており、CLIPにシームレスに統合できる。提案するクエリ適応モジュールはアダプタとしても機能し,バックボーンネットワークのパラメータをチューニングすることなく,CLIP内の豊富な知識を保存できる。
論文参考訳（メタデータ） (2024-12-26T10:19:20Z)
Ranking-aware adapter for text-driven image ordering with CLIP [76.80965830448781]
本稿では,CLIPモデルを学習からランクへのタスクに再構成する,効率的かつ効率的な手法を提案する。我々のアプローチは、ランキングの目的のために新しい指示に適応するための学習可能なプロンプトを取り入れている。私たちのランキングアウェアアダプタは、様々なタスクにおいて微調整されたCLIPよりも一貫して優れています。
論文参考訳（メタデータ） (2024-12-09T18:51:05Z)
Compositional Image Retrieval via Instruction-Aware Contrastive Learning [40.54022628032561]
Composed Image Retrieval (CIR)は、テキストとペアリングした画像の合成クエリに基づいてターゲットイメージを検索する。実際には、下流タスクにおけるアノテートデータの不足のため、ゼロショットCIR(ZS-CIR)が望ましい。命令調整型マルチモーダルLLM(MLLM)を用いて合成表現を生成する新しい埋め込み手法を提案する。
論文参考訳（メタデータ） (2024-12-07T22:46:52Z)
Large Vision-Language Models as Emotion Recognizers in Context Awareness [14.85890824622433]
文脈対応感情認識(CAER)は、様々な文脈から感情を知覚する必要がある複雑で重要なタスクである。以前のアプローチは主に、イメージから感情的な手がかりを抽出する洗練されたアーキテクチャを設計することに焦点を当てていた。本稿では,LVLM(Large Vision-Language Models)を活用したCAERタスクの実現の可能性について,体系的に検討する。
論文参考訳（メタデータ） (2024-07-16T01:28:06Z)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval [50.72924579220149]
Composed Image Retrieval (CIR)は、提供されるテキスト修正に基づいて、クエリに似たイメージを取得するタスクである。現在の技術は、基準画像、テキスト、ターゲット画像のラベル付き三重項を用いたCIRモデルの教師あり学習に依存している。本稿では,参照とその関連対象画像を補助データとして検索する半教師付きCIR手法を提案する。
論文参考訳（メタデータ） (2024-04-23T21:00:22Z)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models [81.71651422951074]
CoS(Chain-of-Spot)法は,注目領域に着目して特徴抽出を強化する手法である。この技術により、LVLMは元の画像解像度を変更することなく、より詳細な視覚情報にアクセスすることができる。実験の結果,LVLMの視覚的内容の理解と推論能力は著しく改善した。
論文参考訳（メタデータ） (2024-03-19T17:59:52Z)
Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval [92.13664084464514]
合成画像検索(CIR)の課題は,検索画像とユーザの意図を記述したテキストに基づいて画像を取得することである。既存の手法は、CIRタスクにおける高度な大規模視覚言語(VL)モデルにおいて大きな進歩を遂げているが、それらは一般的に、モデルトレーニングのためのラベル付き三重項の欠如とリソース制限された環境への展開の困難という2つの大きな問題に悩まされている。本稿では、VLモデルを利用して合成学習のためのラベルなし画像のみに依存する画像2Sentenceに基づく非対称ゼロショット合成画像検索(ISA)を提案する。
論文参考訳（メタデータ） (2024-03-03T07:58:03Z)
Vision-by-Language for Training-Free Compositional Image Retrieval [78.60509831598745]
合成画像検索(CIR)は、データベース内の関連する対象画像を検索することを目的としている。大規模視覚言語モデル(VLM)を用いた最近の研究動向我々は、CIReVL(Vision-by-Language)による学習自由なCIRへの取り組みを提案する。
論文参考訳（メタデータ） (2023-10-13T17:59:38Z)
Analyzing the Efficacy of an LLM-Only Approach for Image-based Document Question Answering [12.064056743478865]
文書質問応答タスクにおける視覚エンコーダと言語モデルの相対的寄与について検討する。我々の包括的分析は6つの多様なベンチマークデータセットを含み、様々なスケールのLCMを利用している。以上の結果から, LLMにのみ依存する戦略が, 最先端の成果と同等か, 近づいた結果をもたらすことが明らかとなった。
論文参考訳（メタデータ） (2023-09-25T07:01:16Z)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions [126.3136109870403]
汎用的で軽量なVisual Prompt Generator Complete Module (VPG-C)を導入する。 VPG-Cは、実証的な指示を解釈するために欠落した詳細を推測し、完成する。私たちは、実証的な命令理解のための包括的なベンチマークであるDEMONを構築します。
論文参考訳（メタデータ） (2023-08-08T09:32:43Z)
MaPLe: Multi-modal Prompt Learning [54.96069171726668]
本稿では,視覚と言語分岐の両方を対象としたマルチモーダル・プロンプト・ラーニング(MaPLe)を提案し,視覚と言語表現の整合性を改善する。最先端のCo-CoOpと比較すると、MaPLeは優れた性能を示し、新規クラスでは3.45%の絶対的な向上を達成している。
論文参考訳（メタデータ） (2022-10-06T17:59:56Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。