論文の概要: USV: Towards Understanding the User-generated Short-form Videos
- arxiv url: http://arxiv.org/abs/2605.20838v1
- Date: Wed, 20 May 2026 07:27:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.554634
- Title: USV: Towards Understanding the User-generated Short-form Videos
- Title(参考訳): USV: ユーザ生成ショートフォームビデオの理解に向けて
- Authors: Haoyue Cheng, Su Xu, Liwei Jin, Wayne Wu, Chen Qian, Limin Wang,
- Abstract要約: 本稿では,高レベルのセマンティックビデオ理解のためのユーザ生成ショートフォームビデオデータセットUSVについて述べる。
データセットには,手作業による検証やトリミングを必要とせずに,クエリをラベル付けすることで,プラットフォームから収集された約224Kのビデオが含まれている。
- 参考スコア(独自算出の注目度): 36.991933865213355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Several large-scale video datasets have been published these years and have advanced the area of video understanding. However, the newly emerged user-generated short-form videos have rarely been studied. This paper presents USV, the User-generated Short-form Video dataset for high-level semantic video understanding. The dataset contains around 224K videos collected from UGC platforms by label queries without extra manual verification and trimming. Although video understanding has achieved plausible improvement these years, most works focus on instance-level recognition, which is not sufficient for learning the representation of the high-level semantic information of videos. Therefore, we further establish two tasks: topic recognition and video-text retrieval on USV. We propose two unified and effective baseline methods Multi-Modality Fusion Network (MMF-Net) and Video-Text Contrastive Learning (VTCL), to tackle the topic recognition task and video-text retrieval respectively, and carry out comprehensive benchmarks to facilitate future research. Our project page is https://usvdataset.github.io.
- Abstract(参考訳): 近年、いくつかの大規模なビデオデータセットが公開され、ビデオ理解の領域が進歩している。
しかし、新たに登場したユーザ生成のショートフォームビデオはめったに研究されていない。
本稿では,高レベルのセマンティックビデオ理解のためのユーザ生成ショートフォームビデオデータセットUSVについて述べる。
データセットには、UGCプラットフォームから収集された約224Kのビデオが含まれている。
近年,ビデオ理解は改善されつつあるが,ほとんどの研究は,ビデオの高レベルな意味情報の表現を学習するには不十分な,インスタンスレベルの認識に重点を置いている。
そこで我々はさらに,USVにおける話題認識とビデオテキスト検索という2つの課題を確立する。
本稿では,Multi-Modality Fusion Network (MMF-Net) と Video-Text Contrastive Learning (VTCL) の2つの統合的・効果的なベースライン手法を提案する。
私たちのプロジェクトページはhttps://usvdataset.github.ioです。
関連論文リスト
- ViLL-E: Video LLM Embeddings for Retrieval [55.66444095205989]
ViLL-E (Video-LLM-Embed) は、新しい埋め込み生成機構を備えた統合ビデオLLMアーキテクチャである。
我々は、生成学習とコントラスト学習を組み合わせた3段階の学習手法を用いて、このモデルを訓練する。
我々のモデルは、時間的ローカライゼーション(他のビデオLLMよりも7%)とビデオ検索(デュアルエンコーダモデルより最大4%)を大幅に改善する。
論文 参考訳(メタデータ) (2026-04-13T23:54:58Z) - Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval [53.54695034420311]
実際には、ビデオは通常、より複雑な背景コンテンツによって、長い時間で切り離される。
本稿では,大規模視覚言語事前学習モデルから一般化知識を抽出する新しい枠組みを提案する。
実験により,本モデルがTVR,ActivityNet,Charades-STAデータセット上での最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-10-14T08:38:20Z) - InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding
and Generation [90.71796406228265]
InternVidは大規模なビデオ中心のマルチモーダルデータセットで、強力で転送可能なビデオテキスト表現の学習を可能にする。
InternVidデータセットは700万本以上のビデオが760万時間近く持続し、合計4.1Bワードの詳細な記述を伴う234万本のビデオクリップが生成される。
論文 参考訳(メタデータ) (2023-07-13T17:58:32Z) - Deep Learning for Video-Text Retrieval: a Review [13.341694455581363]
Video-Text Retrieval (VTR) は、ある文のセマンティクスに関連する最も関連性の高いビデオを探すことを目的としている。
本稿では,VTRに関する100以上の研究論文をレビューし,要約する。
論文 参考訳(メタデータ) (2023-02-24T10:14:35Z) - TL;DW? Summarizing Instructional Videos with Task Relevance &
Cross-Modal Saliency [133.75876535332003]
我々は,ビデオ要約の未探索領域である指導ビデオの要約に焦点をあてる。
既存のビデオ要約データセットは、手動のフレームレベルのアノテーションに依存している。
本稿では,文脈対応の時間的ビデオエンコーダとセグメントスコアリング変換器を組み合わせた指導ビデオ要約ネットワークを提案する。
論文 参考訳(メタデータ) (2022-08-14T04:07:40Z) - Reading-strategy Inspired Visual Representation Learning for
Text-to-Video Retrieval [41.420760047617506]
クロスモーダル表現学習は、ビデオと文の両方を、意味的類似性のための共通空間に計画する。
人間の読み方から着想を得た映像表現学習(RIVRL)を提案する。
我々のモデル RIVRL は TGIF と VATEX の新たな最先端を実現する。
論文 参考訳(メタデータ) (2022-01-23T03:38:37Z) - VALUE: A Multi-Task Benchmark for Video-and-Language Understanding
Evaluation [124.02278735049235]
VALUEベンチマークは、幅広いビデオジャンル、ビデオの長さ、データボリューム、タスクの難易度をカバーすることを目的としている。
大規模なVidL事前学習による各種ベースライン法の評価を行った。
我々の最高のモデルと人間のパフォーマンスの間の大きなギャップは、先進的なVidLモデルの将来の研究を要求する。
論文 参考訳(メタデータ) (2021-06-08T18:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。