論文の概要: Diverse-Intent Multi-Turn Fashion Image Retrieval
- arxiv url: http://arxiv.org/abs/2607.20291v1
- Date: Wed, 22 Jul 2026 15:38:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.135364
- Title: Diverse-Intent Multi-Turn Fashion Image Retrieval
- Title(参考訳): 広帯域マルチターンファッション画像検索
- Abstract要約: 現実世界のファッション検索には、複数のターンをまたいだインタラクティブな検索が含まれる。
13のファッション検索データセットから構築した26KのマルチターンセッションのベンチマークであるDIM-Fashionを紹介する。
また、会話クエリをファッション指向のギャラリー埋め込み空間と整合させるフレームワークであるFashionAMを提案する。
- 参考スコア(独自算出の注目度): 42.88623710886849
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world fashion search involves interactive retrieval across multiple turns. However, existing multi-turn retrieval methods are built on a restrictive assumption that every interaction follows the same attribute-editing paradigm, leaving heterogeneous intent transitions unexplored. Moreover, existing approaches often rely on textification to bridge multimodal queries and visual retrieval, which may lose fine-grained visual cues. To address these gaps, we introduce DIM-Fashion, a benchmark of 26K multi-turn sessions constructed from 13 fashion retrieval datasets across 7 tasks, featuring diverse intent transitions and rollback behaviors. We further propose FashionAM, an MLLM-VLP framework that directly aligns multimodal conversational queries with a fashion-oriented gallery embedding space, avoiding intermediate textification. Extensive experiments demonstrate the effectiveness of FashionAM over existing approaches. The dataset and code will be made publicly available upon acceptance.
- Abstract(参考訳): 現実世界のファッション検索には、複数のターンをまたいだインタラクティブな検索が含まれる。
しかし、既存のマルチターン検索手法は、全ての相互作用が同一の属性編集パラダイムに従うという制限的な仮定に基づいて構築されており、不均一な意図遷移は未探索のままである。
さらに、既存のアプローチでは、マルチモーダルクエリとビジュアル検索をブリッジするために、しばしばテキスト化に依存している。
DIM-Fashionは、7つのタスクにまたがる13のファッション検索データセットから構築された26Kのマルチターンセッションのベンチマークである。
さらに,MLLM-VLPフレームワークであるFashionAMを提案する。
大規模な実験は、既存のアプローチに対するFashionAMの有効性を実証している。
データセットとコードは、受理時に公開される。
関連論文リスト
- Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition [17.99064406157974]
我々はFashion130kという新しいeコマースデータセットを提案する。
我々は、テキストと視覚的プロンプトを協調して生成モデルに組み込むために、統一マルチモーダル条件(UMC)を用いたフレームワークを設計する。
実世界のアプリケーションとベンチマークの実験は、視覚的一貫性におけるUTCの有効性を実証している。
論文 参考訳(メタデータ) (2026-05-11T07:40:03Z) - MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query [91.01970848241075]
MERITは、インターリーブされたマルチ条件セマンティック検索のための最初の多言語データセットである。
本稿では,多条件セマンティック検索のための最初の多言語データセットであるMERITを紹介する。
論文 参考訳(メタデータ) (2025-06-03T17:59:14Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - Multi-Turn Multi-Modal Question Clarification for Enhanced Conversational Understanding [11.004677535859342]
本稿では,Multi-turn Multi-modal Clarifying Questions (MMCQ)タスクを紹介する。
MMCQはテキストと視覚のモダリティを組み合わせて、マルチターン会話でユーザクエリを洗練させる。
マルチターンマルチモーダルの明確化はユニモーダルとシングルターンのアプローチよりも優れ、MRRを12.88%向上させることを示した。
論文 参考訳(メタデータ) (2025-02-17T04:58:14Z) - MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval [26.585985828583304]
我々は、アライメント中にテキストの特徴を融合させることなく、モダリティインタラクションを実現する検索フレームワークMIReを紹介する。
提案手法では,テキスト駆動型信号を視覚表現に戻すことなく,テキストクエリを視覚埋め込みに対応させることができる。
実験により,我々の事前学習戦略はマルチモーダルクエリの理解を著しく向上させることが示された。
論文 参考訳(メタデータ) (2024-11-13T04:32:58Z) - MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs [78.5013630951288]
本稿では,マルチモーダル大言語モデル(MLLM)を用いた情報検索手法を提案する。
まず,16個の検索タスクを持つ10個のデータセットに対して,MLLMをバイエンコーダレトリバーとして微調整する。
我々のモデルMM-Embedはマルチモーダル検索ベンチマークM-BEIR上で最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-11-04T20:06:34Z) - MMTryon: Multi-Modal Multi-Reference Control for High-Quality Fashion Generation [70.83668869857665]
MMTryonはマルチモーダルなマルチ参照VIrtual Try-ONフレームワークである。
テキスト命令と複数の衣料品画像を入力として、高品質な合成試行結果を生成することができる。
論文 参考訳(メタデータ) (2024-05-01T11:04:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。