論文の概要: What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight Retrieval
- arxiv url: http://arxiv.org/abs/2607.12882v1
- Date: Tue, 14 Jul 2026 15:30:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.193136
- Title: What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight Retrieval
- Title(参考訳): パーソナライズドビデオのサムネイル生成とハイライト検索
- Authors: Zhiyu He, Zecheng Zhao, Tong Chen, Zi Huang, Yiqun Liu, Min Zhang,
- Abstract要約: ユーザ固有の好みに合わせてサムネイルを作成するための新しいタスクである、パーソナライズされたビデオサムネイル生成を紹介する。
本稿では、好み認識検索と制御可能な生成とを密に結合する2段階のフレームワークを提案する。
2つの公開データセットを用いた実験により,検索ベースおよび生成ベースラインと比較して最先端のパフォーマンスが得られた。
- 参考スコア(独自算出の注目度): 42.25948839538674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video thumbnails are a key factor for attracting user clicks on video platforms, and are increasingly supported by automation. However, existing thumbnail generation methods typically produce generic results shared across users, overlooking the diversity of individual preferences. We therefore introduce personalized video thumbnail generation, a novel task that aims to create thumbnails tailored to user-specific preferences. It is challenging in two aspects: (i) identifying visual anchors (i.e., key frames) from each video to guide the generation, which requires a balance between personalization and informativeness that existing highlight detection methods fail to achieve; and (ii) generating personalized thumbnails that are both visually coherent and faithful to the original video. As a response, we propose a two-stage framework that tightly couples preference-aware retrieval with controllable generation. In the first stage, a personalized highlight retriever captures fine-grained user-video interactions and incorporates video semantics through summarization, enabling the selection of diverse visual anchors aligned with both user preferences and video contexts. In the second stage, a VLM-guided diffusion pipeline transforms these anchors into thumbnails by extracting and injecting semantically grounded visual cues, improving personalization while preserving visual coherence and fidelity. Experiments on two public datasets show our method delivers state-of-the-art performance compared with both retrieval-based and generative baselines. A user study further demonstrates improved click preference, highlighting its effectiveness in enhancing user engagement. The code is available at https://github.com/hezy18/PVTG.
- Abstract(参考訳): ビデオサムネイルは、ビデオプラットフォーム上でユーザークリックを惹きつける重要な要素であり、自動化によってますます支持されている。
しかし、既存のサムネイル生成手法は一般的に、個々の好みの多様性を見越して、ユーザ間で共有される一般的な結果を生成する。
そこで我々は,ユーザの好みに合わせてサムネイルを作成する新しいタスクである,パーソナライズされたビデオサムネイル生成を導入する。
それは2つの側面において挑戦的だ。
一 既存のハイライト検出方法が達成できないパーソナライズと情報性のバランスを必要とする各映像から視覚的アンカー(キーフレーム)を識別すること。
(二)オリジナルビデオに忠実で忠実なパーソナライズされたサムネイルを生成すること。
そこで本研究では、優先認識検索と制御可能な生成とを密に結合する2段階のフレームワークを提案する。
最初の段階では、パーソナライズされたハイライトレトリバーが、きめ細かいユーザとビデオのインタラクションをキャプチャし、要約を通じてビデオセマンティクスを組み込むことで、ユーザの好みとビデオコンテキストの両方に合わせた多様な視覚的アンカーの選択を可能にする。
第2段階では、VLM誘導拡散パイプラインは、視覚的コヒーレンスと忠実さを保ちながらパーソナライズを改善し、意味的に接地された視覚的手がかりを抽出し注入することにより、これらのアンカーをサムネイルに変換する。
2つの公開データセットを用いた実験により,検索ベースと生成ベースラインの両方と比較して最先端の性能が得られた。
さらにユーザ調査では、クリック嗜好の改善が示され、ユーザのエンゲージメントを高める効果が強調されている。
コードはhttps://github.com/hezy18/PVTGで公開されている。
関連論文リスト
- EdgeVidSum: Real-Time Personalized Video Summarization at the Edge [3.102586911584193]
EdgeVidSumは、エッジデバイス上で、ロングフォームビデオのパーソナライズされた高速な要約を生成する方法である。
このフレームワークは階層的な分析手法を用いており、軽量な2D CNNモデルによりサムネイルからユーザの好むコンテンツを識別する。
インタラクティブなデモでは、個々のユーザの好みに基づいて、映画、スポーツイベント、テレビ番組などのロングフォームビデオ用に調整されたビデオ要約を作成する能力を強調しています。
論文 参考訳(メタデータ) (2025-05-28T18:59:41Z) - Multi-subject Open-set Personalization in Video Generation [110.02124633005516]
我々は、マルチオブジェクトでオープンなパーソナライズ機能を備えたビデオモデルとして、Video Alchemist $-$を提示する。
本モデルは,各条件付き参照画像と対応する主観レベルテキストプロンプトを融合するDiffusion Transformerモジュール上に構築されている。
本手法は,定量評価と定性評価の両方において,既存のパーソナライズ手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-01-10T18:59:54Z) - Show Me What I Like: Detecting User-Specific Video Highlights Using Content-Based Multi-Head Attention [52.84233165201391]
そこで本稿では,従来視聴したビデオに表示されていたハイライトクリップに基づいて,対象ビデオの個別化ハイライトを検出する手法を提案する。
本手法は,対象物と人的活動の事前学習機能を用いて,好むクリップの内容と対象ビデオの両方を明示的に活用する。
論文 参考訳(メタデータ) (2022-07-18T02:32:48Z) - Towards Micro-video Thumbnail Selection via a Multi-label
Visual-semantic Embedding Model [0.0]
サムネイルは、マイクロビデオの初見として、ユーザーがクリックして視聴する際の重要な役割を担っている。
本稿では,各フレーム間の類似度と,ユーザが興味を持っている話題との類似度を推定するために,マルチラベルのビジュアル・セマンティック・埋め込みモデルを提案する。
我々は、各フレームの視覚的表現スコアと人気スコアを融合させ、与えられたマイクロビデオの魅力的なサムネイルを選択する。
論文 参考訳(メタデータ) (2022-02-07T04:15:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。