論文の概要: Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos
- arxiv url: http://arxiv.org/abs/2608.04939v1
- Date: Wed, 05 Aug 2026 15:06:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.96812
- Title: Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos
- Title(参考訳): フレーム間の読書:ソーシャルメディアビデオにおける暗黙的・非リテラル的意味の解釈
- Authors: Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin,
- Abstract要約: ソーシャルメディアビデオの暗黙的・非線形的・修辞的な意味をモデルが推測できるかどうかを評価する。
DrivelHub+は、ソーシャルメディアから収集された1000本のビデオから成り、それぞれに人間が書いた暗黙の物語の説明が付加されている。
- 参考スコア(独自算出の注目度): 24.604118147581886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Social media videos often communicate meanings that go beyond their visible actions, captions, or speech. A mundane clip may become humorous, ironic, or satire only through the interaction of multimodal cues and cultural context, making such content a difficult test case for video-language models. In this paper, we introduce \textit{DrivelHub+}, a benchmark for evaluating whether models can infer the implicit, non-linear, and rhetorically layered meanings of social media videos that appear nonsensical on the surface but convey deliberate pragmatic meanings. DrivelHub+ consists of 1,000 videos collected from social media, each annotated with a human-written implicit narrative explanation. Unlike conventional video understanding tasks focused on recognition or description, we present a benchmark that targets contextual multimodal reasoning. We evaluate current video-language models from two perspectives: explanation, where models must explain the pragmatic comprehension of a video in natural language; and representation, where we adapt reasoning-as-retrieval to test whether model representations align videos with their corresponding implicit narratives in both video-to-text and text-to-video retrieval. Our benchmark provides a diagnostic setting for measuring the gap between multimodal perception and pragmatic comprehension, asking whether current models can move beyond describing what is shown to inferring what is meant.
- Abstract(参考訳): ソーシャルメディアビデオは、目に見える行動、キャプション、スピーチを超えて意味を伝えることが多い。
平凡なクリップは、マルチモーダルなキューと文化的なコンテキストの相互作用によってのみユーモラス、皮肉、風刺となり、このようなコンテンツはビデオ言語モデルにとって難しいテストケースとなる。
本稿では,非感覚的に見えるが故意に実用的意味を伝達するソーシャルメディアビデオの暗黙的・非線形的・修辞的意味をモデルが推論できるかどうかを評価するためのベンチマークである「textit{DrivelHub+}」を紹介する。
DrivelHub+は、ソーシャルメディアから収集された1000本のビデオから成り、それぞれに人間が書いた暗黙の物語の説明が付加されている。
認識や記述に焦点を当てた従来のビデオ理解タスクとは異なり、文脈的マルチモーダル推論をターゲットとしたベンチマークを提示する。
提案手法では,モデル表現がビデオと対応する暗黙的物語をビデオテキスト検索とテキスト・トゥ・ビデオ検索の両方で一致させるかどうかを検証するために,推論・アズ・レトリーバルを適応させる。
本ベンチマークでは,マルチモーダル認識と実用的理解のギャップを計測し,現在のモデルが意味を推測するために示されるものを記述できるかどうかを判断する。
関連論文リスト
- ViMU: Benchmarking Video Metaphorical Understanding [58.432996881401415]
ViMUはビデオのフロンティアモデルのサブテキスト理解能力を評価するために設計されたベンチマークである。
暗黙的な意味を推測するために、ビデオ理解モデルがリテラル認識を超えることができるかどうかを評価する。
すべての質問はヒントのないように設計されており、答える前に重要な証拠がモデルに開示されることが保証されている。
論文 参考訳(メタデータ) (2026-05-14T09:23:59Z) - SPOT! Revisiting Video-Language Models for Event Understanding [31.49859545456809]
本稿では,既存のビデオ言語モデルのイベントレベルの相違点を識別する能力のベンチマークを行うSPOT Proberを紹介する。
これらの正負のキャプションで既存のビデオ言語モデルを評価した結果、操作されたイベントのほとんどを区別できないことがわかった。
そこで本研究では,これらの操作したイベントキャプションをハードネガティブなサンプルとしてプラグインし,イベント理解モデルの改善に有効であることを示す。
論文 参考訳(メタデータ) (2023-11-21T18:43:07Z) - Video as Conditional Graph Hierarchy for Multi-Granular Question
Answering [80.94367625007352]
ビデオはフレームシーケンスで表現されるが、視覚要素はシーケンシャルではなく、セマンティック空間において階層的である。
本稿では,異なる粒度の視覚的事実をレベルワイドに織り込む条件付きグラフ階層として,動画をモデル化することを提案する。
論文 参考訳(メタデータ) (2021-12-12T10:35:19Z) - Cross-Modal Graph with Meta Concepts for Video Captioning [101.97397967958722]
ビデオキャプションのためのメタ概念を用いたクロスモーダルグラフ(CMG)を提案する。
ビデオキャプションで有用な意味概念を網羅するために、テキスト記述のための対応する視覚領域を弱く学習する。
我々は、予測された述語を用いて、全体的ビデオレベルおよび局所的フレームレベルのビデオグラフを構築し、ビデオシーケンス構造をモデル化する。
論文 参考訳(メタデータ) (2021-08-14T04:00:42Z) - Video SemNet: Memory-Augmented Video Semantic Network [14.64546899992196]
本稿では,低レベルデータ表現と視覚媒体の意味的側面のギャップを埋めることで,映画の物語要素を捉える機械学習手法を提案する。
本稿では、意味記述子をエンコードし、ビデオの埋め込みを学ぶために、ビデオセマンティックネットワーク(Video SemNet)というメモリ拡張ビデオセマンティックネットワークを提案する。
重み付きF-1スコアは0.72, IMDB評価は0.63である。
論文 参考訳(メタデータ) (2020-11-22T01:36:37Z) - Watch and Learn: Mapping Language and Noisy Real-world Videos with
Self-supervision [54.73758942064708]
我々は、明示的なアノテーションを使わずに、文章と騒々しいビデオスニペットのマッピングを学習することで、視覚と自然言語を理解するように機械に教える。
トレーニングと評価のために、多数のオンラインビデオとサブタイトルを含む新しいデータセットApartmenTourをコントリビュートする。
論文 参考訳(メタデータ) (2020-11-19T03:43:56Z) - Neuro-Symbolic Representations for Video Captioning: A Case for
Leveraging Inductive Biases for Vision and Language [148.0843278195794]
ビデオキャプションのためのマルチモーダルなニューラルシンボリック表現を学習するための新しいモデルアーキテクチャを提案する。
本手法では,ビデオ間の関係を学習する辞書学習手法と,そのペアによるテキスト記述を用いる。
論文 参考訳(メタデータ) (2020-11-18T20:21:19Z) - VIOLIN: A Large-Scale Dataset for Video-and-Language Inference [103.7457132841367]
ビデオとテキストのマルチモーダル理解のための新しいタスク, Video-and-Language Inferenceを導入する。
サブタイトルを前提としたビデオクリップと、そのビデオコンテンツに基づいて自然言語仮説とをペアリングすると、モデルは、その仮説が所定のビデオクリップに関連付けられているか、矛盾しているかを推測する必要がある。
このタスクには、Violin(VIdeO-and-Language Inference)という名の新しい大規模データセットが導入された。
論文 参考訳(メタデータ) (2020-03-25T20:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。