論文の概要: VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits
- arxiv url: http://arxiv.org/abs/2606.13427v1
- Date: Thu, 11 Jun 2026 14:54:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.861256
- Title: VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits
- Title(参考訳): VietFashion: 文化的利益のためのスケッチテキスト合成画像検索のベンチマーク
- Authors: Hoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le,
- Abstract要約: VietFashionは、ベトナムの伝統的な衣服であるAo Daiを中心としたスケッチテキストによる画像検索のための新しいベンチマークだ。
データセットは650のスケッチと生成モデルを使用して拡張され、アライメントされたキャプションで21,000以上の画像を生成する。
その結果, 微粒な文化意味論とマルチモーダル構成のモデル化において, 顕著な性能差が示された。
- 参考スコア(独自算出の注目度): 11.049002814814045
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Cultural garments pose a unique challenge for visual retrieval systems, as their identity often depends on subtle structural and symbolic details that are poorly captured by standard AI models. We introduce VietFashion, a new benchmark for sketch-text composed image retrieval centered on the Ao Dai, a traditional Vietnamese garment. VietFashion enables designers and researchers to retrieve culturally meaningful outfits using a combination of hand-drawn sketches, which convey garment structure, and textual descriptions, which encode cultural semantics. The dataset is initialized with 650 sketches and expanded using generative models to produce over 21,000 photorealistic images with aligned captions. Textual prompts that describe detailed outfit attributes, which are extracted from fashion magazines to ensure authenticity and diversity. To better reflect the inherent ambiguity of design intent, VietFashion adopts a multi-target retrieval setting, where a single query may correspond to multiple valid results. We establish standardized evaluation protocols and benchmark state-of-the-art composed image retrieval methods. Experimental results reveal significant performance gaps in modeling fine-grained cultural semantics and multi-modal composition, positioning VietFashion as a challenging benchmark for fine-grained fashion retrieval. The dataset is publicly available at: https://hng0303.github.io/VietFashion.
- Abstract(参考訳): 文化的な衣服は、視覚的検索システムにとってユニークな課題であり、そのアイデンティティは、しばしば標準的なAIモデルで不十分な微妙な構造と象徴的な詳細に依存している。
ベトナムの伝統的な衣服であるAo Daiを中心にしたスケッチテキスト合成画像検索のための新しいベンチマークであるVietFashionを紹介した。
VietFashionは、デザイナーと研究者が、手描きのスケッチと、文化的意味論をエンコードするテキスト記述を組み合わせて、文化的に意味のある服を検索することを可能にする。
データセットは、650のスケッチで初期化され、生成モデルを使用して拡張され、アライメントされたキャプションを持つ21,000以上のフォトリアリスティックなイメージを生成する。
テクストプロンプトは、ファッション雑誌から抽出された詳細な衣服の属性を記述し、信頼性と多様性を保証する。
VietFashionは、設計意図のあいまいさをよりよく反映するため、マルチターゲット検索設定を採用しており、単一のクエリが複数の有効な結果に対応できる。
我々は、標準化された評価プロトコルと、最先端の合成画像検索手法のベンチマークを確立する。
実験結果から, 微粒な文化意味論とマルチモーダルな構成をモデル化する上で, 重要なパフォーマンスギャップが明らかとなった。
データセットは、https://hng0303.github.io/VietFashion.comで公開されている。
関連論文リスト
- Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinement [2.089922606370409]
反復的プロンプトリファインメント(Culture-TRIP)を用いた文化的テキスト・画像生成手法を提案する。
提案手法は, カルチャー名詞に関連する文化的文脈と視覚的詳細を抽出する。
一連の文化的基準と大きな言語モデルに基づいて、反復的にプロンプトを洗練・評価する。
論文 参考訳(メタデータ) (2025-02-24T06:56:56Z) - An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevance [53.974497865647336]
われわれは、画像の翻訳を文化的に意味のあるものにするための第一歩を踏み出した。
タスクを行うために、最先端の生成モデルからなる3つのパイプラインを構築します。
我々は,翻訳画像の人間による評価を行い,文化的意義と保存の意味を評価する。
論文 参考訳(メタデータ) (2024-04-01T17:08:50Z) - CIC: A Framework for Culturally-Aware Image Captioning [2.565964707090901]
本稿では,文化を表すイメージの視覚的要素から抽出された文化要素をキャプションとして表現し,表現する新しい枠組みであるCICを提案する。
視覚的モダリティとLarge Language Models(LLM)を組み合わせた手法に着想を得て,画像から文化カテゴリーに基づく質問を生成する。
4つの異なる文化集団から45人の被験者を対象に行った人的評価から,提案する枠組みがより文化的に記述的なキャプションを生成することが示唆された。
論文 参考訳(メタデータ) (2024-02-08T03:12:25Z) - JourneyDB: A Benchmark for Generative Image Understanding [89.02046606392382]
生成画像の領域に適合する包括的データセットであるJourneyDBを導入する。
精巧にキュレートされたデータセットは、400万の異なる高品質な画像で構成されています。
本データセットでは,生成した画像の理解性能を評価するための4つのベンチマークを考案した。
論文 参考訳(メタデータ) (2023-07-03T02:39:08Z) - FaD-VLP: Fashion Vision-and-Language Pre-training towards Unified
Retrieval and Captioning [66.38951790650887]
ファッション分野におけるマルチモーダルタスクは、eコマースにとって大きな可能性を秘めている。
本稿では,ファッションとテクストのペアから構築した弱教師付き三つ組に基づく,ファッション特有の事前学習フレームワークを提案する。
3重項に基づくタスクは、標準的なマルチモーダル事前学習タスクに有効な追加であることを示す。
論文 参考訳(メタデータ) (2022-10-26T21:01:19Z) - From Culture to Clothing: Discovering the World Events Behind A Century
of Fashion Images [100.20851232528925]
本稿では,着る衣服に影響を及ぼす特定の文化的要因を特定するための,データ駆動型アプローチを提案する。
私たちの仕事は、計算的、スケーラブルで、簡単にリフレッシュ可能なアプローチによる、カルチャーと衣服のリンクに向けた第一歩です。
論文 参考訳(メタデータ) (2021-02-02T18:58:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。