論文の概要: FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
- arxiv url: http://arxiv.org/abs/2605.22552v1
- Date: Thu, 21 May 2026 14:34:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 20:14:18.584465
- Title: FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
- Title(参考訳): FashionLens:タスク適応学習によるVersatile Fashion Image Retrievalを目指して
- Authors: Haokun Wen, Xuemeng Song, Xinghao Xie, Xiaolin Chen, Xiangyu Zhao, Weili Guan,
- Abstract要約: FashionLensは、多様なクエリフォーマットと検索インテントをサポートする統合フレームワークである。
FashionLensは、さまざまな検索シナリオで最先端のパフォーマンスを実現し、目に見えないタスクに堅牢に一般化する。
U-FIREの実験では、FashionLensは様々な検索シナリオで最先端のパフォーマンスを達成し、目に見えないタスクにしっかりと一般化している。
- 参考スコア(独自算出の注目度): 44.93273606180741
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fashion image retrieval is a cornerstone of modern e-commerce systems. A unified framework that supports diverse query formats and search intentions is highly desired in practice. However, existing approaches focus on narrow retrieval tasks and do not fully capture such diversity. Therefore, in this work, we aim to develop a unified framework capable of handling diverse realistic fashion retrieval scenarios, achieving truly versatile fashion image retrieval. To establish a data foundation, we first introduce U-FIRE, a comprehensive benchmark that consolidates fragmented fashion datasets into a unified collection, supplemented by two manually curated datasets for testing generalization. Building upon this, we propose FashionLens, a unified framework based on Multimodal Large Language Models. To handle divergent matching objectives, we design a Proposal-Guided Spherical Query Calibrator that dynamically shifts query representations into task-aligned metric spaces via adaptive spherical linear interpolation. Additionally, to mitigate the optimization imbalance caused by varying task complexities and data scales, we develop a Gradient-Guided Adaptive Sampling strategy that automatically re-weights tasks based on realtime learning difficulty and the data scale prior. Experiments on U-FIRE show that FashionLens achieves state-of-the-art performance across diverse retrieval scenarios and generalizes robustly to unseen tasks. The data and code are publicly released at https://github.com/haokunwen/FashionLens.
- Abstract(参考訳): ファッション画像検索は、現代のeコマースシステムの基盤となっている。
多様なクエリフォーマットと検索意図をサポートする統一されたフレームワークが実際に非常に望まれている。
しかし,従来の手法は狭い検索作業に重点を置いており,その多様性を完全に把握するものではない。
そこで本研究では,多様な現実的なファッション検索シナリオを処理し,真に汎用的なファッション画像検索を実現する統一的なフレームワークを開発することを目的とする。
データ基盤を確立するために、私たちはまず、断片化されたファッションデータセットを統一したコレクションに統合する包括的なベンチマークであるU-FIREを紹介します。
これに基づいて,マルチモーダル大規模言語モデルに基づく統合フレームワークであるFashionLensを提案する。
本研究では, 適応球面線形補間により, 問合せ表現をタスク整合距離空間に動的にシフトする提案型球面クエリキャリブレータを設計する。
さらに,タスクの複雑度やデータスケールの変化による最適化の不均衡を軽減するため,リアルタイム学習難易度とデータスケールの事前処理に基づいて,タスクを自動的に重み付けするグラディエントガイド適応サンプリング戦略を開発した。
U-FIREの実験では、FashionLensは様々な検索シナリオで最先端のパフォーマンスを達成し、目に見えないタスクにしっかりと一般化している。
データとコードはhttps://github.com/haokunwen/FashionLens.comで公開されている。
関連論文リスト
- SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility [71.76390626651254]
本研究では,学習の進捗を把握し,多目的報酬重み付けとデータ重要度を動的に調整し,自己完結型カリキュラムを構築するフレームワークであるSPARDを提案する。
複数のベンチマークにわたる大規模な実験により、SPARDはすべてのドメインにわたるモデル機能を大幅に強化することが示された。
論文 参考訳(メタデータ) (2026-04-09T05:37:22Z) - Fine-tuning MLLMs Without Forgetting Is Easier Than You Think [72.59321247529975]
分布内および分布外画像およびテキスト入力のモデル性能を評価するための2x2実験フレームワークを設計する。
その結果、トレーニング可能なパラメータの数を制限したり、低学習率を採用するなど、適切な正規化が、アウト・オブ・ディストリビューション・イメージを扱う際の忘れを効果的に防止できることが示唆された。
我々は、このことをタスク固有のオーバーフィッティングとみなし、データハイブリッドトレーニング戦略を導入することでこの問題に対処する。
論文 参考訳(メタデータ) (2026-03-15T17:16:19Z) - CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval [22.01591564940522]
モデル一般化能力を高めるために,クロスモーダル適応メタラーニング(CAMeL)に基づくドメインに依存しない事前学習フレームワークを提案する。
特に,現実シナリオの多様性と複雑さを反映した一連のタスクを開発する。
提案手法は,実世界のベンチマークにおける既存手法を超越するだけでなく,ロバスト性やスケーラビリティも示す。
論文 参考訳(メタデータ) (2025-04-26T03:26:30Z) - Adapting to Non-Stationary Environments: Multi-Armed Bandit Enhanced Retrieval-Augmented Generation on Knowledge Graphs [23.357843519762483]
近年の研究では、検索-拡張生成フレームワークと知識グラフを組み合わせることで、大規模言語モデルの推論能力を強力に向上することが示されている。
我々は多目的帯域拡張RAGフレームワークを導入し、多様な機能を持つ複数の検索手法をサポートする。
本手法は,定常環境下での最先端性能を達成しつつ,非定常環境でのベースライン手法を著しく向上させる。
論文 参考訳(メタデータ) (2024-12-10T15:56:03Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - ALP: Action-Aware Embodied Learning for Perception [60.64801970249279]
認知のための行動認識型身体学習(ALP)について紹介する。
ALPは、強化学習ポリシーと逆ダイナミクス予測目標を最適化することにより、行動情報を表現学習に組み込む。
ALPは、複数の下流認識タスクにおいて、既存のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-16T21:51:04Z) - Progressive Learning for Image Retrieval with Hybrid-Modality Queries [48.79599320198615]
ハイブリッドモダリティクエリによる画像検索(CTI-IR)
我々は、CTI-IRタスクを3段階の学習問題に分解し、ハイブリッドモダリティクエリを用いて画像検索のための複雑な知識を段階的に学習する。
提案モデルは,Fashion-IQおよびShoesベンチマークデータセットにおいて,Recall@K平均の最先端手法を24.9%,9.5%向上させる。
論文 参考訳(メタデータ) (2022-04-24T08:10:06Z) - Salient Objects in Clutter [130.63976772770368]
本稿では,既存の正当性オブジェクト検出(SOD)データセットの重大な設計バイアスを特定し,対処する。
この設計バイアスは、既存のデータセットで評価した場合、最先端のSODモデルのパフォーマンスの飽和につながった。
我々は,新しい高品質データセットを提案し,前回のsaliencyベンチマークを更新する。
論文 参考訳(メタデータ) (2021-05-07T03:49:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。