論文の概要: VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions
- arxiv url: http://arxiv.org/abs/2606.19627v1
- Date: Wed, 17 Jun 2026 22:08:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.558867
- Title: VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions
- Title(参考訳): VCG:極低温条件下でのEコマースビデオフィードのマルチモーダル検索フレームワーク
- Authors: Katya Mirylenka, Egor Malykh, Mahdyar Ravanbakhsh, Michael Gygli, Marco-Andrea Buchmann, Andrew Dzhoha, Svitlana Borzenko, Francesca Catino, Mohamed Gaafar, Maarten Versteegh, Thomas Kober, Dario d'Andrea, Ellie Langhans,
- Abstract要約: 新しいショートフォームビデオは、協調フィルタリングに必要な密接な相互作用履歴を欠いている。
没入フィードは、標準的なエンゲージメントシグナルを歪ませる強い位置と持続バイアスをもたらす。
大規模なeコマース環境でこれらの課題を解決するために設計されたスケーラブルなマルチモーダル検索エンジンを実演する。
- 参考スコア(独自算出の注目度): 2.5997680822076688
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The digital commerce landscape is shifting from static, search-driven catalogs to dynamic, immersive video feeds. This transition introduces an ``extreme cold-start'' problem: unlike traditional items, new short-form videos lack the dense interaction history required for collaborative filtering. Furthermore, immersive feeds introduce strong position and duration biases that distort standard engagement signals. In this paper, we demonstrate the Video Candidate Generation (VCG) system, a scalable multimodal retrieval engine designed to solve these challenges in a large-scale e-commerce environment. By leveraging a domain-adapted vision-language model (based on CLIP), we map users and videos into a shared semantic space, enabling zero-shot retrieval based on visual content rather than behavioral history. We detail the system's architecture and present a rigorous evaluation comparing generative (LLM) vs. discriminative (CLIP) embeddings. Our results show that while generative models excel at attribute prediction, they suffer from embedding space collapse in retrieval tasks. Online A/B testing demonstrates that VCG effectively mitigates engagement biases, yielding a 50\% uplift in deep video completion. To showcase the system's capabilities, we present an interactive demonstration featuring three bi-directional retrieval scenarios: Product-to-Video, Video-to-Product, and Zero-Shot Semantic Search.
- Abstract(参考訳): デジタルコマースの世界は、静的で検索駆動のカタログから、ダイナミックで没入的なビデオフィードへと変化しつつある。
従来のアイテムとは異なり、新しいショートフォームビデオは協調フィルタリングに必要な密接な相互作用履歴を欠いている。
さらに、没入フィードは、標準エンゲージメント信号を歪ませる強い位置と持続バイアスをもたらす。
本稿では,大規模なeコマース環境においてこれらの課題を解決するために設計された,スケーラブルなマルチモーダル検索エンジンであるビデオ候補生成(VCG)システムを実証する。
ドメイン適応型視覚言語モデル(CLIPをベースとした)を活用することで、ユーザとビデオを共有意味空間にマッピングし、行動履歴ではなく、視覚コンテンツに基づいたゼロショット検索を可能にする。
本稿では,システムアーキテクチャを詳述し,生成性 (LLM) と差別性 (CLIP) の埋め込みとの比較を厳密に評価する。
その結果, 生成モデルは属性予測に優れるが, 検索タスクに空間崩壊を埋め込むことに悩まされていることがわかった。
オンラインA/Bテストは、VCGがエンゲージメントバイアスを効果的に軽減し、ディープビデオの完成度が50%アップすることを示している。
本稿では,製品間ビデオ,ビデオ間ビデオ,ゼロショットセマンティック検索という3つの双方向検索シナリオを特徴とする対話型デモを紹介する。
関連論文リスト
- Act2See: Emergent Active Visual Perception for Video Reasoning [70.52373240573856]
VLM(Vision-Language Models)は通常、ビデオの推論に静的な初期フレームに依存している。
本稿では,アクト・ツー・シー(Act2See)という,アクティブな視覚知覚を実現する新しいフレームワークを紹介する。
論文 参考訳(メタデータ) (2026-05-03T00:52:51Z) - MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation [2.819801450768979]
我々は,AIO_Trinhが開発したビデオ検索フレームワークMADTempoを紹介した。
我々の時間探索機構は、連続したビデオセグメント間で類似度スコアを集約することにより、事象レベルの連続性をキャプチャする。
Googleイメージ検索ベースのフォールバックモジュールは、外部のWebイメージでクエリ表現を拡張する。
論文 参考訳(メタデータ) (2025-12-15T02:25:46Z) - LMVC: An End-to-End Learned Multiview Video Coding Framework [13.78537496324905]
マルチビュービデオはボリュームビデオの重要なデータソースであり、没入型3Dシーンの再構築を可能にする。
ディープラーニングベースのエンドツーエンドビデオコーディングは、大きな成功を収めていますが、ほとんどの場合、シングルビューやステレオビデオに重点を置いています。
本稿では,ランダムアクセスと後方互換性を保証する,エンドツーエンドのマルチビュービデオ符号化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-04T06:15:41Z) - Live Video Captioning [0.6291443816903801]
オンラインで動画ストリームにキャプションを生成しなければならないLive Video Captioning (LVC) という,画期的なパラダイムを紹介した。
我々は,LVCの新たな課題を正式に定義し,このオンラインシナリオに特化して設計された革新的な評価指標を提案する。
本稿では,変形可能な変換器と時間的フィルタリングを組み合わせた新しいモデルを提案する。
論文 参考訳(メタデータ) (2024-06-20T11:25:16Z) - DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries [60.09774333024783]
動的アンカークエリ(DAQ)を導入し、アンカーとターゲットクエリ間の遷移ギャップを短くする。
また,クエリレベルのオブジェクトEmergence and Disappearance Simulation(EDS)戦略を導入する。
実験により、DVIS-DAQは5つの主流ビデオセグメンテーションベンチマーク上で、新しい最先端(SOTA)性能を達成することが示された。
論文 参考訳(メタデータ) (2024-03-29T17:58:50Z) - VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。
データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。
機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文 参考訳(メタデータ) (2023-12-04T19:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。