論文の概要: Multimedia Asset Personalization via Multimodal Embeddings at Netflix
- arxiv url: http://arxiv.org/abs/2608.18322v1
- Date: Tue, 18 Aug 2026 21:15:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.209242
- Title: Multimedia Asset Personalization via Multimodal Embeddings at Netflix
- Title(参考訳): Netflixにおけるマルチモーダル埋め込みによるマルチメディアアセットパーソナライズ
- Abstract要約: マルチモーダルな埋め込みが、Netflixのプロダクションシステムをどう変えたかを説明する。
予め訓練された画像埋め込みが、クロスタイトル、クロスキャンバスの知識伝達を解き放つ方法を示す。
当社の社内トリモーダル・ファンデーションモデルであるMediaFMについて説明する。
- 参考スコア(独自算出の注目度): 2.4399698742885767
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personalized promotional assets, namely artwork images and video preview clips, are critical to content discovery on Netflix. Traditional models for asset selection rely on ID-based interaction history, leaving them blind to asset content and unable to serve newly launched titles and assets. We describe how multimodal embeddings reshaped production systems at Netflix and report transferable lessons for practitioners adopting foundation-model embeddings into recommender systems. First, pretrained image embeddings unlock cross-title, cross-canvas knowledge transfer. Augmenting a two-tower model with CLIP image embeddings lets a single model serve all five Netflix artwork canvas types, replacing five separately trained per-canvas models and substantially improving cold-start performance. A lightweight extension reuses CLIP's joint text-image space to make artwork personalization query-aware in search. Second, multimodality decisively beats any single modality for video preview personalization. We describe MediaFM, our in-house tri-modal foundation model trained on a large-scale corpus of shots from the Netflix show catalog, fusing visual (SeqCLIP), audio (wav2vec 2.0), and timed-text signals; adopted for video preview personalization, it outperforms strong visual-only baselines both offline and in online A/B tests. Third, a simple offline proxy task whose performance correlates with online outcomes can accelerate the experimentation and productization cycle. Predicting the popularity-based winner from embeddings alone ranks embedding models and versions, pruning the choice space before any end-to-end integration or A/B test; it now gates every new MediaFM checkpoint. We also share the production engineering decisions (shared embedding infrastructure, low-latency serving, cheap screening) that made these deployments viable, along with the design tradeoffs and failure modes we encountered.
- Abstract(参考訳): パーソナライズされたプロモーションアセット、すなわちアートワークイメージとビデオプレビュークリップは、Netflixのコンテンツ発見に不可欠である。
従来のアセットセレクションのモデルは、IDベースのインタラクション履歴に依存しており、アセットコンテンツに盲目であり、新たに立ち上げられたタイトルやアセットには提供できない。
マルチモーダルな埋め込みがNetflixのプロダクションシステムを再形成し、ファウンデーションモデル埋め込みをレコメンデーションシステムに導入する実践者に対して、トランスファー可能な教訓を報告した。
まず、事前訓練された画像埋め込みは、クロスタイトル、クロスキャンバスの知識伝達をアンロックする。
CLIPイメージ埋め込みによる2towerモデルの拡張により、単一のモデルがNetflixの5つのアートキャンバスタイプすべてに対応し、個別にトレーニングされた5つのキャンバスモデルを置き換えるとともに、コールドスタートのパフォーマンスを大幅に向上する。
軽量な拡張は、CLIPのジョイントテキストイメージスペースを再利用し、検索においてアートワークのパーソナライズクエリを認識させる。
第二に、マルチモダリティは、ビデオプレビューのパーソナライズのために、あらゆる単一のモダリティを決定的に上回っている。
ビデオプレビューのパーソナライゼーションに採用されたMediaFMは、オフラインとオンラインのA/Bテストの両方において、強力なビジュアルのみのベースラインよりも優れています。
第3に、オンライン成果とパフォーマンスが相関する単純なオフラインプロキシタスクは、実験と製品化サイクルを加速することができる。
埋め込みモデルとバージョンをランク付けし、エンドツーエンドの統合やA/Bテストの前に選択スペースを刈り取る。
また、設計上のトレードオフや障害モードとともに、運用エンジニアリングの判断(共有組み込みインフラストラクチャ、低レイテンシサービス、安価なスクリーニング)も共有しています。
関連論文リスト
- DuoGen: Towards General Purpose Interleaved Multimodal Generation [65.13479486098419]
DuoGenは汎用的なインターリーブ生成フレームワークで、データキュレーション、アーキテクチャ設計、評価に対処する。
我々は、キュレートされた生のWebサイトから書き直されたマルチモーダルな会話を組み合わせることで、大規模で高品質な命令チューニングデータセットを構築する。
2段階の切り離し戦略はまずMLLMをインストラクションチューニングし、次にインターリーブされた画像テキストシーケンスを使用してDiTをアライメントする。
論文 参考訳(メタデータ) (2026-01-31T04:35:15Z) - RzenEmbed: Towards Comprehensive Multimodal Retrieval [11.540508319550087]
RzenEmbedは、様々なモダリティの組込みを学ぶための統一されたフレームワークである。
差別表現を学習するために、新しい2段階の訓練戦略を採用する。
RzenEmbedはMMEBベンチマークで新しい最先端を設定できる。
論文 参考訳(メタデータ) (2025-10-31T10:34:51Z) - VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents [105.43882565434444]
VLM2Vec-V2は、様々な視覚形態にまたがる埋め込みを学習するための統一的なフレームワークである。
まず、MMEBを5つの新しいタスクタイプで拡張する包括的なベンチマークであるMMEB-V2を紹介する。
次に、テキスト、画像、ビデオ、ビジュアルドキュメント入力をサポートする汎用埋め込みモデルであるVLM2Vec-V2を訓練する。
論文 参考訳(メタデータ) (2025-07-07T00:51:57Z) - VINCIE: Unlocking In-context Image Editing from Video [62.88977098700917]
本研究では,ビデオからテキスト内画像編集モデルを直接学習できるかどうかを考察する。
このデータから効果的に学習するために、3つのプロキシタスクに基づいて訓練されたブロック因果拡散変換器を設計する。
本モデルでは,2つのマルチターン画像編集ベンチマークにおいて,コンテクスト内画像編集能力が強く,最先端の結果が得られている。
論文 参考訳(メタデータ) (2025-06-12T17:46:54Z) - Multi-subject Open-set Personalization in Video Generation [110.02124633005516]
我々は、マルチオブジェクトでオープンなパーソナライズ機能を備えたビデオモデルとして、Video Alchemist $-$を提示する。
本モデルは,各条件付き参照画像と対応する主観レベルテキストプロンプトを融合するDiffusion Transformerモジュール上に構築されている。
本手法は,定量評価と定性評価の両方において,既存のパーソナライズ手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-01-10T18:59:54Z) - VIMI: Grounding Video Generation through Multi-modal Instruction [89.90065445082442]
既存のテキスト間拡散モデルは、事前訓練のためにテキストのみのエンコーダにのみ依存する。
検索手法を用いて大規模マルチモーダル・プロンプト・データセットを構築し,テキスト・プロンプトとテキスト・プロンプトのペア化を行う。
マルチモーダル命令を組み込んだ3つのビデオ生成タスクにおいて,第1ステージからモデルを微調整する。
論文 参考訳(メタデータ) (2024-07-08T18:12:49Z) - A strong baseline for image and video quality assessment [4.73466728067544]
画像と映像の知覚的品質評価のための,シンプルで効果的な統合モデルを提案する。
本モデルでは,バックボーンネットワークから派生したグローバルな特徴を1つだけ適用することで,同等の性能を実現する。
提案したアーキテクチャに基づいて、3つの一般的な実世界のシナリオに対して十分に訓練されたモデルをリリースする。
論文 参考訳(メタデータ) (2021-11-13T12:24:08Z) - Self-Supervised MultiModal Versatile Networks [76.19886740072808]
我々は、ビデオに自然に存在する3つのモダリティ(ビジュアル、オーディオ、言語ストリーム)を活用することで、自己スーパービジョンを用いて表現を学習する。
ビデオ, ビデオテキスト, 画像, 音声タスクに対して, ビデオデータの大規模な収集を訓練したネットワークを, どのように適用できるかを実証する。
論文 参考訳(メタデータ) (2020-06-29T17:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。