論文の概要: A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement
- arxiv url: http://arxiv.org/abs/2604.19995v1
- Date: Tue, 21 Apr 2026 21:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:10.846829
- Title: A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement
- Title(参考訳): 感覚と行動エンゲージメントを予測するショートビデオマルチモーダル特徴量におけるメッセージ知覚値の計算モデル
- Authors: Haoning Xue, Jingwen Zhang, Xiaohui Wang, Diane Dagyong Kim, Yunya Song,
- Abstract要約: 本研究では,MSV(Message Sensation Value)の計算モデルを開発し,検証する。
感覚と行動のエンゲージメントを予測するこのモデルは、3つの短いビデオプラットフォームから見つからない2つのデータセットで検証された。
本研究は,ショートビデオのエンゲージメントに関する理論的理解を深め,ショートビデオ研究のための堅牢な計算ツールを導入する。
- 参考スコア(独自算出の注目度): 11.110676835294463
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The contemporary media landscape is characterized by sensational short videos. While prior research examines the effects of individual multimodal features, the collective impact of multimodal features on viewer engagement with short videos remains unknown. Grounded in the theoretical framework of Message Sensation Value (MSV), this study develops and tests a computational model of MSV with multimodal feature analysis and human evaluation of 1,200 short videos. This model that predicts sensory and behavioral engagement was further validated across two unseen datasets from three short video platforms (combined N = 14,492). While MSV is positively associated with sensory engagement, it shows an inverted U-shaped relationship with behavioral engagement: Higher MSV elicits stronger sensory stimulation, but moderate MSV optimizes behavioral engagement. This research advances the theoretical understanding of short video engagement and introduces a robust computational tool for short video research.
- Abstract(参考訳): 現代メディアの風景はセンセーショナルなショートビデオによって特徴づけられる。
先行研究では、個々のマルチモーダル特徴が視聴者エンゲージメントに与える影響について検討する一方で、マルチモーダル特徴がショートビデオに対する視聴者エンゲージメントに与える影響は分かっていない。
本研究は,MSV(Message Sensation Value)の理論的枠組みに基づいて,マルチモーダル特徴解析と1200本のショートビデオの人間による評価によるMSVの計算モデルの開発と検証を行う。
感覚と行動のエンゲージメントを予測するこのモデルは、3つの短いビデオプラットフォーム(N = 14492)から得られた2つの見えないデータセットでさらに検証された。
高いMSVは強い感覚刺激を与えるが、中程度のMSVは行動刺激を最適化する。
本研究は,ショートビデオのエンゲージメントに関する理論的理解を深め,ショートビデオ研究のための堅牢な計算ツールを導入する。
関連論文リスト
- Rodent-Bench [14.876393544574688]
我々は,マルチモーダル大言語モデル(MLLM)のアノテート行動映像のアノテート能力を評価するための新しいベンチマークであるRodent-Benchを提案する。
我々は,Gemini-2.5-Pro,Gemini-2.5-Flash,Qwen-VL-Maxなどの最先端MLLMをこのベンチマークを用いて評価し,これらのモデルのいずれも,このタスクのアシスタントとして使用するのに十分な性能を発揮できないことを発見した。
論文 参考訳(メタデータ) (2026-02-20T15:14:38Z) - Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation [8.15791379444665]
VideoScore-2は、特定のオーディオヴィジュアル属性が実際の観客のエンゲージメントに与える影響を捉えていない。
本稿では、視覚言語モデル(VLM)を用いて教師なしの視覚的特徴を抽出するデータ駆動評価フレームワークを提案する。
我々のアプローチは、堅牢で説明可能なビデオ理解へと進む。
論文 参考訳(メタデータ) (2025-12-24T19:43:59Z) - eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos [15.533003031406551]
ショートフォームビデオ(SV)は、情報を取得し共有するためのオンラインルーチンの重要な部分になっています。
SVの感情データの可用性が制限されていることから,本研究では,27,996本のビデオからなる大規模データセットであるeMotionsを紹介する。
AV-CANetは,ビデオトランスフォーマを利用して意味的に関連する表現をキャプチャする,エンドツーエンドの音声-視覚融合ネットワークである。
論文 参考訳(メタデータ) (2025-08-09T09:27:45Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - MC-ViViT: Multi-branch Classifier-ViViT to detect Mild Cognitive
Impairment in older adults using facial videos [44.72781467904852]
本稿では, 顔の特徴を解析することによって, 正常な認知能力を持つ者との区別を目的とした, マルチブランチ・ビデオ・ビジョン・トランスフォーマ (MCViViT) モデルを提案する。
このデータは、頻繁なビデオチャットを提供することで認知機能を改善することを目的とした行動介入試験であるI-CONECTから得られたものだ。
I-CONECTデータセットの実験結果は、MC-ViViTがMCIを90.63%の精度で予測する大きな可能性を示している。
論文 参考訳(メタデータ) (2023-04-11T15:42:20Z) - Muti-view Mouse Social Behaviour Recognition with Deep Graphical Model [124.26611454540813]
マウスの社会的行動分析は神経変性疾患の治療効果を評価する貴重なツールである。
マウスの社会行動の豊かな記述を創出する可能性から、ネズミの観察にマルチビュービデオ記録を使用することは、ますます注目を集めている。
本稿では,ビュー固有のサブ構造とビュー共有サブ構造を協調的に学習する,新しい多視点潜在意識・動的識別モデルを提案する。
論文 参考訳(メタデータ) (2020-11-04T18:09:58Z) - Long Short-Term Relation Networks for Video Action Detection [155.13392337831166]
本稿では,Long Short-Term Relation Networks (LSTR)について述べる。
LSTRは、ビデオアクション検出のための拡張機能と関連して集約し、伝播する。
4つのベンチマークデータセットで大規模な実験を行う。
論文 参考訳(メタデータ) (2020-03-31T10:02:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。