論文の概要: CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
- arxiv url: http://arxiv.org/abs/2608.30255v1
- Date: Mon, 31 Aug 2026 05:05:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.240065
- Title: CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
- Title(参考訳): CAMIE: スナップダイナミック製品広告検索のためのマルチモーダルなマルチモーダルな埋め込み
- Abstract要約: CAMIEは、Snap DPA検索のためのマルチモーダルアイテム埋め込みフレームワークである。
オフラインでは、CAMIEはRecall@10上で最強の商用マルチモーダル埋め込みモデルを上回っている。
オンラインでは、CAMIEは2つのデプロイされたコンテンツベースのI2Iエンコーダの代替となる。
- 参考スコア(独自算出の注目度): 19.32720430172867
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Item-to-item (I2I) retrieval is a core primitive in large-scale recommendation and advertising systems. In production Snap Dynamic Product Ads (DPA), I2I retrieval faces two challenges: separate visual, textual, and multimodal encoders fragment the retrieval stack, and content-only training does not align embeddings with the co-engagement behavior that drives downstream conversions. We present CAMIE, a co-engagement-aware multimodal item embedding framework for Snap DPA retrieval. CAMIE builds on LLM/MLLM backbones, using their native multimodal interfaces to represent item images and metadata in a shared embedding space. It then fine-tunes the backbone on co-engaged item pairs mined from user journeys with a symmetric in-batch InfoNCE objective. Offline, CAMIE outperforms the strongest commercial multimodal embedding model on Recall@10 and serves text-only retrieval from the same checkpoint with minimal quality loss. Online, CAMIE serves as a drop-in replacement for two deployed content-based I2I encoders, delivering +0.390% CTR / +10.832% CVR over the multimodal control, +18.958% CTR / +13.12% CVR over the text control, and +0.211% CTR / +1.911% CVR on overall DPA traffic. CAMIE is deployed in production.
- Abstract(参考訳): アイテム・ツー・イテム(I2I)検索は、大規模レコメンデーションおよび広告システムにおいて中核となるプリミティブである。
Snap Dynamic Product Ads (DPA)では、I2I検索は2つの課題に直面している: 視覚的、テキスト的、マルチモーダルエンコーダは、検索スタックを断片化する。
CAMIEは、Snap DPA検索のためのマルチモーダルアイテム埋め込みフレームワークである。
CAMIE は LLM/MLLM のバックボーン上に構築されており、そのネイティブなマルチモーダルインターフェースを使用して、アイテムイメージとメタデータを共有埋め込み空間で表現している。
次に、ユーザジャーニーから抽出された、共入力されたアイテムペアのバックボーンを、対称な in-batch InfoNCE の目的で微調整する。
オフラインでは、CAMIEはRecall@10上で最強の商用マルチモーダル埋め込みモデルより優れており、最小品質の損失で同じチェックポイントからテキストのみの検索を提供する。
オンライン上では、CAMIEは2つのコンテンツベースのI2Iエンコーダの代替として機能し、マルチモーダル制御で+0.390% CTR / +10.832% CVR、テキスト制御で+18.958% CTR / +13.12% CVR、DPA全体のトラフィックで+0.211% CTR / +1.911% CVRを提供する。
CAMIEは本番環境にデプロイされる。
関連論文リスト
- AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning [51.50063777258973]
CVR(Cross-Video Reasoning)は、マルチモーダルインテリジェンスにおいて重要なフロンティアとして登場した。
本稿では,CVRを積極的なエビデンス獲得タスクとして扱うマルチエージェントフレームワークであるAgentCVRを提案する。
論文 参考訳(メタデータ) (2026-05-28T09:09:41Z) - Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation [51.52908699287466]
Text-Guided Q-Formerはテキストガイドによる視覚表現学習フレームワークである。
メタデータと探索的なビジュアルストリームを分離し、軽量で信頼性に配慮したデュアルゲートベクトル変調モジュールを導入する。
フルプール検索による大規模な実世界のeコマースデータセットの実験では、TGQ-Formerは強いコネクタベースラインとエンドツーエンドMLLMを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-17T10:20:23Z) - Recurrence Meets Transformers for Universal Multimodal Retrieval [59.92546492752452]
ReT-2は画像とテキストの両方からなるマルチモーダルクエリをサポートする統合検索モデルである。
検索構成の異なるM2KRとM-BEIRのベンチマークでReT-2を評価する。
検索強化された生成パイプラインに統合されると、ReT-2はEncyclopedic-VQAとInfoSeekデータセットのダウンストリームのパフォーマンスも向上する。
論文 参考訳(メタデータ) (2025-09-10T18:00:29Z) - MAGMaR Shared Task System Description: Video Retrieval with OmniEmbed [55.526939500742]
我々はTevatron 2.0ツールキットの強力なマルチモーダル埋め込みモデルであるOmniEmbedを使用して、テキスト、画像、オーディオ、ビデオの統一埋め込みを生成する。
2025年5月20日時点の公募では、MAGMaRのタスクリーダーボードの最高スコアを達成しました。
論文 参考訳(メタデータ) (2025-06-11T05:40:26Z) - CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval [70.9990850395981]
CLaMRは、ビデオフレーム、書き起こされた音声、画面上のテキスト、メタデータの4つのモダリティを共同でインデックスするマルチモーダルな遅延相互作用レトリバーである。
CLaMRは2つの重要な革新を通じて動的モダリティ選択を強化するために訓練されている。
論文 参考訳(メタデータ) (2025-06-06T15:02:30Z) - Integrating Extra Modality Helps Segmentor Find Camouflaged Objects Well [23.460400679372714]
MultiCOSは、セグメンテーション性能を改善するために、多様なデータモダリティを効果的に活用する新しいフレームワークである。
BFSerは、実データと擬似データの両方で既存のマルチモーダルベースラインを上回っている。
論文 参考訳(メタデータ) (2025-02-20T11:49:50Z) - A Simple Baseline with Single-encoder for Referring Image Segmentation [14.461024566536478]
本稿では,単一エンコーダ(BEiT-3)を用いたRIS法を提案する。
単一エンコーダによる単純なベースラインは、RISベンチマークデータセット上で優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-08-28T04:14:01Z) - adSformers: Personalization from Short-Term Sequences and Diversity of
Representations in Etsy Ads [0.12647816797166164]
本稿では,動的ユーザ表現を学習するadSformer diversibility Personalization Module (ADPM)を紹介する。
CTR(Click-Through Rate)モデルとPCCVR(Post-Click Conversion Rate)モデルをパーソナライズすることで,モジュールの有効性と柔軟性を説明する。
論文 参考訳(メタデータ) (2023-02-02T17:39:10Z) - Multi-queue Momentum Contrast for Microvideo-Product Retrieval [57.527227171945796]
マルチモーダルインスタンスとマルチモーダルインスタンス間の検索を探索する最初の試みであるマイクロビデオ製品検索タスクを定式化する。
双方向検索のためのMulti-Queue Momentum Contrast(MQMC)ネットワークという新しい手法を提案する。
マルチキューを用いた識別的選択戦略は、カテゴリによって異なる負の重要性を区別するために用いられる。
論文 参考訳(メタデータ) (2022-12-22T03:47:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。