論文の概要: Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation
- arxiv url: http://arxiv.org/abs/2607.17499v1
- Date: Mon, 20 Jul 2026 03:06:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.487573
- Title: Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation
- Title(参考訳): Pailitao-MMSearch: ネイティブEコマースマルチモーダル検索基盤の構築
- Abstract要約: 本稿では、このギャップを埋めるために設計された、ネイティブなeコマースマルチモーダル検索基盤モデルであるPailitao-MMSearchを紹介する。
提案手法では,(1)HybSID(Hybrid Semantic ID),(2)2段階連続事前学習戦略,(3)ハイブリッド推論後学習パイプラインの3つの重要なイノベーションを紹介する。
Qwenをベースとして、Taobaoのマルチモーダル検索プラットフォームであるPailitao-MMSearch上にデプロイされたPailitao-MMSearchは、オンラインA/Bテストにおいて大幅に改善されている。
- 参考スコア(独自算出の注目度): 22.28986818203049
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The evolution of e-commerce has fundamentally transformed how users search for products, shifting from simple text-based keyword queries to complex multimodal interactions that seamlessly combine product images, natural language descriptions, and mixed-intent instructions. However, existing approaches face a critical dilemma: single-modal specialist models, deployed independently for text retrieval, visual search, and voice recognition, operate in isolation and cannot handle cross-modal queries, while general-purpose vision-language models lack the domain-specific knowledge necessary for fine-grained product understanding, user behavior modeling, and commercial intent reasoning. In this work, we present Pailitao-MMSearch, one native e-commerce multimodal search foundation model designed to bridge this gap. Our approach introduces three key innovations: (1)HybSID (Hybrid Semantic ID);(2)a two-stage continual pre-training strategy; and (3)a hybrid reasoning post-training pipeline. Built upon Qwen and deployed on Taobao's Pailitao multimodal search platform, Pailitao-MMSearch achieves substantial improvements in online A/B testing, including up to +13.61\% in Gross Merchandise Volume (GMV) and +8.21\% in transaction volume compared to traditional multi-modal search pipeline, demonstrating the effectiveness of our native e-commerce multimodal search large language models.
- Abstract(参考訳): eコマースの進化は、ユーザーが商品を検索する方法を根本的に変え、単純なテキストベースのキーワードクエリから、製品イメージ、自然言語記述、混合インテリジェント命令をシームレスに組み合わせた複雑なマルチモーダルインタラクションへと移行した。
しかし、既存のアプローチでは、テキスト検索、ビジュアル検索、音声認識のために独立してデプロイされる単一モーダルスペシャリストモデルは、単独で動作し、相互モーダルクエリを処理できない一方、汎用視覚言語モデルは、きめ細かい製品理解、ユーザ行動モデリング、商業意図推論に必要なドメイン固有の知識を欠いている。
本研究では,このギャップを埋めるために設計された,ネイティブなeコマースマルチモーダル検索基盤モデルであるPailitao-MMSearchを紹介する。
提案手法では,(1)HybSID(Hybrid Semantic ID),(2)2段階連続事前学習戦略,(3)ハイブリッド推論後学習パイプラインの3つの重要なイノベーションを紹介した。
Qwen上に構築され、Taobaoのマルチモーダル検索プラットフォーム上にデプロイされたPailitao-MMSearchは、Gross Merchandise Volume (GMV)における+13.61\%と、従来のマルチモーダル検索パイプラインと比較して+8.21\%のトランザクション量を含む、オンラインA/Bテストにおいて大幅に改善されている。
関連論文リスト
- SAM-D2Q: Aligning Multimodal Doc2Query with Search Demand and Conversion for E-commerce [11.766307104320726]
電子商取引検索は、しばしばユーザクエリと商人が所有する製品タイトルの語彙ミスマッチに悩まされる。
従来の手法はテキストのみであり、eコマースビジネスの目的に最適化されていない。
本稿では,ビジネス対応のマルチモーダル文書拡張フレームワークであるE-Commerce Multimodal Doc2Query (SAM-D2Q)を提案する。
論文 参考訳(メタデータ) (2026-09-04T10:09:04Z) - VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning [22.27364585438247]
VSearcherは、マルチモーダル検索エージェントで、現実世界のWeb環境での長時間のマルチターンツールの使用を可能にする。
大規模で複雑なマルチモーダルQA質問を生成するために、反復射出データ合成パイプラインを導入する。
次に、SFT-then-RLトレーニングパイプラインを用いて、ベースマルチモーダルモデルを現実世界のWeb環境におけるマルチターンツール呼び出しが可能なエージェントに変換する。
論文 参考訳(メタデータ) (2026-03-03T09:33:22Z) - MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model [57.89395815934156]
Multi-Turn Contrastive Learning (MuCo)は、このプロセスを再考する対話にインスパイアされたフレームワークである。
新たな5Mマルチモーダルマルチターンデータセット(M3T)による MuCo の表示実験
論文 参考訳(メタデータ) (2026-02-06T05:18:33Z) - DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search [61.77858432092777]
DeepMMSearch-R1は,オンデマンドでマルチターンWeb検索が可能な,最初のマルチモーダルな大規模言語モデルである。
DeepMMSearch-R1は、画像検索をより効果的にするために、入力画像の関連する作物に基づいてWeb検索を開始することができる。
我々は、アプローチの優位性を実証するために、知識集約型ベンチマークを幅広く実施する。
論文 参考訳(メタデータ) (2025-10-14T17:59:58Z) - Test-Time Scaling Strategies for Generative Retrieval in Multimodal Conversational Recommendations [70.94563079082751]
電子商取引は、複雑なマルチターンユーザーインタラクションを管理する上で、伝統的な製品検索システムの限界を明らかにしている。
本稿では,対話型マルチモーダル製品検索にテスト時間スケーリングを導入する新しいフレームワークを提案する。
提案手法は生成型レトリバー上に構築され,さらに検索精度の向上と,対話を通してユーザ意図の進化と結果の整合性を向上するテストタイムリグレード機構が組み込まれている。
論文 参考訳(メタデータ) (2025-08-25T15:38:56Z) - MMSearch-R1: Incentivizing LMMs to Search [49.889749277236376]
MMSearch-R1は,実世界のインターネット環境において,オンデマンドでマルチターン検索が可能な,初のエンドツーエンド強化学習フレームワークである。
本フレームワークは画像検索とテキスト検索の両方を統合し,検索ペナルティによる結果に基づく報酬によって,モデルがいつ,どのように呼び出すかの判断を可能にする。
論文 参考訳(メタデータ) (2025-06-25T17:59:42Z) - Multimodal semantic retrieval for product search [6.185573921868495]
商品の純粋テキスト表現とは対照的に,eコマース検索における商品項目のマルチモーダル表現を構築した。
商品のマルチモーダル表現スキームは,セマンティック検索における購入リコールや関連精度の向上を示すことができることを示す。
論文 参考訳(メタデータ) (2025-01-13T14:34:26Z) - Fine-tuning Multimodal Large Language Models for Product Bundling [53.01642741096356]
Bundle-MLLMは,大規模言語モデル(LLM)をハイブリットアイテムトークン化アプローチにより微調整する新しいフレームワークである。
具体的には、テキスト、メディア、およびリレーショナルデータを統一トークン化に統合し、テキストトークンと非テキストトークンを区別するソフトな分離トークンを導入する。
1)バンドルパターンを学習し,2)製品バンドル固有のマルチモーダルセマンティック理解の強化を行う。
論文 参考訳(メタデータ) (2024-07-16T13:30:14Z) - CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling [53.97609687516371]
クロスモーダル検索は、異なるモーダルデータの相互作用を通じて、クエリと意味的に関連するインスタンスを検索することを目的としている。
従来のソリューションでは、クエリと候補の間のスコアを明示的に計算するために、シングルトウワーまたはデュアルトウワーのフレームワークを使用している。
粗大なセマンティックモデリングに基づく生成的クロスモーダル検索フレームワーク(CART)を提案する。
論文 参考訳(メタデータ) (2024-06-25T12:47:04Z) - Leveraging Large Language Models for Multimodal Search [0.6249768559720121]
本稿では,Fashion200Kデータセット上での新たなパフォーマンスマイルストーンを実現する,新しいマルチモーダル検索モデルを提案する。
また,Large Language Models (LLM) を統合した新たな検索インタフェースを提案する。
論文 参考訳(メタデータ) (2024-04-24T10:30:42Z) - DialCLIP: Empowering CLIP as Multi-Modal Dialog Retriever [83.33209603041013]
マルチモーダルダイアログ検索のためのパラメータ効率の高いプロンプトチューニング手法であるDialCLIPを提案する。
提案手法では,事前学習された視覚言語モデルCLIP内のプロンプトに抽出された文脈特徴を学習するためのマルチモーダルコンテキスト生成手法を提案する。
様々なタイプの検索を容易にするために,CLIP出力からマルチモーダル表現空間へのマッピングを学習するために,複数の専門家を設計する。
論文 参考訳(メタデータ) (2024-01-02T07:40:12Z) - Align before Search: Aligning Ads Image to Text for Accurate Cross-Modal
Sponsored Search [27.42717207107]
クロスモーダルスポンサー検索は、消費者が検索エンジンで自然言語クエリーによって望ましい商品を探す際に、マルチモーダル広告(ads)を表示する。
画像とテキストの両方で広告特有の情報を調整できることは、正確で柔軟なスポンサー付き検索に不可欠だ。
広告画像の細粒度部分を対応するテキストに明示的にマッピングする単純なアライメントネットワークを提案する。
論文 参考訳(メタデータ) (2023-09-28T03:43:57Z) - InterBERT: Vision-and-Language Interaction for Multi-modal Pretraining [76.32065400614162]
我々は,本シリーズのマルチモーダル事前学習手法M6の最初のモデルであるInterBERT(BERT for Interaction)を提案する。
モデルは、異なるモダリティの情報フロー間の相互作用をモデル化する強力な能力を持っている。
中国語におけるマルチモーダル事前学習のための大規模データセットを提案し,中国初のマルチモーダル事前学習モデルである中国語InterBERTを開発した。
論文 参考訳(メタデータ) (2020-03-30T03:13:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。