論文の概要: ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
- arxiv url: http://arxiv.org/abs/2605.29302v1
- Date: Thu, 28 May 2026 03:33:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.635805
- Title: ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
- Title(参考訳): ViASNet:ダイナミックなサイレンシとビューアのエンゲージメントを予測するビデオ広告サイレンシネットワーク
- Authors: Jianping Ye, Michel Wedel,
- Abstract要約: 本研究は,ショートフォームビデオ広告におけるディープサリエンシ予測に焦点をあてる。
ディープ・サリエンシ・モデルは、人間の目の固定パターンの予測に使われてきた。
我々は、ViASNetと呼ばれる新しいディープ・ダイナミック・サリエンシ・予測モデルを開発し、テストする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The digital media landscape has seen a pervasive shift toward short-form video advertising on TV, social media and e-commerce platforms. The present study focuses on deep saliency prediction for short-form video advertising. Deep saliency models have been used to generate predictions of human eye fixation patterns with the purpose of enhancing user interaction with digital technology and optimizing its design. For video ads, dynamic saliency maps capture where and when viewers are looking, revealing why video ads are effective, and how their content should be optimized. We develop and test a new deep dynamic saliency prediction model called ViASNet (Video Ad Saliency Network), which has an architecture founded on the 3D U-Net, and accommodates the influence of audio and the semantic meaning of scenes. We assess the model's performance on 151 video ads, each seen by about 20 viewers wile their eye movements were tracked, and explore the critical factors influencing model performance through ablation experiments. We calculate the entropy of the predicted saliency maps frame-by-frame as a diagnostic tool to identify ads and scenes that fail to engage viewers, and illustrate its use on test data of 15 unseen ads. Our study reveals that ad design and testing can be sped up considerably through automated systems built on deep saliency models such as ViASNet.
- Abstract(参考訳): デジタルメディアの世界は、テレビ、ソーシャルメディア、およびEコマースプラットフォーム上のショートフォームビデオ広告へと広範にシフトしてきた。
本研究では,ショートフォームビデオ広告におけるディープサリエンシ予測に焦点を当てた。
デジタル技術とのユーザインタラクションを強化し,その設計を最適化することを目的として,人間の眼球固定パターンの予測に深度モデルを用いている。
ビデオ広告の場合、ダイナミックなサリエンシマップは視聴者が見ている場所と場所を捉え、なぜビデオ広告が効果的であるか、どのようにコンテンツを最適化すべきかを明らかにする。
ViASNet(Video Ad Saliency Network)と呼ばれる,3D U-Net上に構築されたアーキテクチャで,映像の音響的意味や意味的意味に影響を及ぼすような,新たなダイナミック・サリエンシ予測モデルを開発し,検証する。
約20人の視聴者が追跡した151本の動画広告において、モデルの性能を評価し、アブレーション実験によりモデル性能に影響を及ぼす重要な要因について検討した。
予測されたサリエンシマップのエントロピーをフレーム単位で計算し、視聴者をエンゲージできない広告やシーンを識別し、15の未確認広告のテストデータにその使用法を例証する。
我々の研究は、ViASNetのようなディープ・サリエンシ・モデルに基づいて構築された自動化システムによって、広告デザインとテストが大幅に高速化できることを明らかにした。
関連論文リスト
- Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads [9.34170961508317]
ソーシャルメディアプラットフォームはユーザーデータを活用して広告配信を最適化し、エンゲージメントを高める。
重要なが未調査の側面は、視聴者の注意を捉え、エンゲージメントのメトリクスに影響を与える最初の3秒である'フック期間'である。
本研究では,トランスフォーマーをベースとしたマルチモーダル言語モデル(MLLM)を用いて,ビデオ広告のホッキング期間を解析するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-25T18:24:06Z) - Monitoring Viewer Attention During Online Ads [0.5499796332553706]
大手ブランドは、新しい広告の好みと購入意図を測り、オンラインで募集された視聴者の顔の反応を分析して、自宅や職場から広告を見る。
不注意な参加者は、広告テストのプロセスを盗むのを避けるために、フラグを立てて排除するべきです。
オンライン広告中の視聴者の注意をモニタリングするアーキテクチャを導入する。
論文 参考訳(メタデータ) (2025-04-08T17:34:02Z) - ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising [2.330164376631038]
コンテキスト広告は、ユーザーが見ているコンテンツに沿った広告を提供する。
共同マルチモーダルトレーニングに基づく現在のテキスト・ビデオ検索モデルでは,大規模なデータセットと計算資源が要求される。
本研究では,コンテキスト広告に特化して設計されたマルチモーダル専門家によるビデオ検索システムであるContextIQを紹介する。
論文 参考訳(メタデータ) (2024-10-29T17:01:05Z) - Predicting Long-horizon Futures by Conditioning on Geometry and Time [49.86180975196375]
我々は,過去を前提とした将来のセンサ観測の課題を探求する。
マルチモーダリティを扱える画像拡散モデルの大規模事前学習を活用する。
我々は、屋内と屋外のシーンにまたがる多様なビデオのセットについて、ビデオ予測のためのベンチマークを作成する。
論文 参考訳(メタデータ) (2024-04-17T16:56:31Z) - Let's Think Frame by Frame with VIP: A Video Infilling and Prediction
Dataset for Evaluating Video Chain-of-Thought [62.619076257298204]
我々は、少数のビデオ推論のシーケンシャルな理解として、フレーミングビデオ推論を動機付けている。
VIPは、ビデオチェーンオブ思考を通してモデルの推論能力を調べるために設計された、推論時の課題データセットである。
我々は、VIP上でGPT-4、GPT-3、VICUNAをベンチマークし、複雑なビデオ推論タスクのパフォーマンスギャップを実証し、今後の作業を促進する。
論文 参考訳(メタデータ) (2023-05-23T10:26:42Z) - A Multimodal Framework for Video Ads Understanding [64.70769354696019]
広告ビデオコンテンツの構造化分析能力を向上させるためのマルチモーダルシステムの開発を行う。
2021年のTAAC最終リーダーボードでは, 位置推定と予測精度を考慮した0.2470のスコアを得た。
論文 参考訳(メタデータ) (2021-08-29T16:06:00Z) - Learning to Predict Salient Faces: A Novel Visual-Audio Saliency Model [96.24038430433885]
本稿では,視覚,音声,顔の3つの分枝からなるマルチモーダルビデオサリエンシーモデルを提案する。
実験結果から,提案手法は,11の最先端サリエンシ予測作業より優れていた。
論文 参考訳(メタデータ) (2021-03-29T09:09:39Z) - Predicting Online Video Advertising Effects with Multimodal Deep
Learning [33.20913249848369]
ビデオ広告のクリックスルー率(CTR)を予測し,CTRを決定する要因を解析する手法を提案する。
本稿では,オンラインビデオ広告のマルチモーダル性を生かして,効果を正確に予測するための最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2020-12-22T06:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。