論文の概要: LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
- arxiv url: http://arxiv.org/abs/2608.24845v1
- Date: Tue, 25 Aug 2026 17:34:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:35.113865
- Title: LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
- Title(参考訳): LAION-BVD:マルチモーダルプレトレーニングのための10ミリ時間オープンビデオデータセット
- Abstract要約: マルチモーダル学習のための大規模オープンビデオデータセットであるLAION-BVDを提案する。
CommonCrawlから収集された1.3Bプラットフォーム固有のビデオURLを含んでいる。
総視聴時間は1000万時間で、8000万のビデオをダウンロードします。
- 参考スコア(独自算出の注目度): 71.18006624888662
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present LAION-BVD, a large-scale open video dataset for multimodal learning, which contains 1.3B platform-specific video URLs collected from CommonCrawl. From these, we download 80M videos with a total duration of 10 million hours. The dataset is designed for multimodal pre-training across the video, audio, and image modalities. Using content-aware scene detection, we extract clips for which we synthetically generate video and audio captions. Models trained on these data achieve competitive performance on standard video-text and audio-text benchmarks, with consistent improvements as training or model scale increases. Additionally, we explore video frames as an alternative source of image-text data by extracting scene-changing frames. These frames exhibit a visual distribution distinct from standard web image corpora, and models trained on this dataset achieve strong image-text retrieval performance. We release LAION-BVD to the research community. It significantly expands open access to multimodal videos at an unprecedented scale.
- Abstract(参考訳): 我々は,CommonCrawlから収集した1.3Bプラットフォーム固有のビデオURLを含む,マルチモーダル学習のための大規模オープンビデオデータセットであるLAION-BVDを提案する。
ここから8千万本のビデオをダウンロードし、総視聴時間は1000万時間です。
データセットは、ビデオ、オーディオ、画像モダリティを横断するマルチモーダル事前トレーニング用に設計されている。
コンテンツ認識シーン検出を用いて,映像キャプションと音声キャプションを合成的に生成するクリップを抽出する。
これらのデータに基づいてトレーニングされたモデルは、標準的なビデオテキストとオーディオテキストのベンチマークで競合性能を達成し、トレーニングやモデルスケールの増加とともに一貫した改善がなされる。
さらに、シーン変化フレームを抽出することにより、画像テキストデータの代替源としてビデオフレームを探索する。
これらのフレームは、標準的なWeb画像コーパスとは異なる視覚分布を示し、このデータセットでトレーニングされたモデルは、強力な画像テキスト検索性能を実現する。
LAION-BVDを研究コミュニティにリリースする。
マルチモーダルビデオへのオープンアクセスを前例のない規模で大幅に拡大する。
関連論文リスト
- ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access [16.89068730775312]
ViMix-14Mは、約1400万対のマルチソースビデオテキストデータセットである。
ViMix-14Mは、様々なオープンビデオソースをマージして構築され、その後にデ複製と品質フィルタリングが統合されている。
マルチモーダル検索,テキスト・ツー・ビデオ生成,ビデオ質問応答タスクによるデータセットの評価を行った。
論文 参考訳(メタデータ) (2025-11-23T10:19:56Z) - TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models [52.590072198551944]
近年の多モーダル言語モデル(LLM)の進歩は,多モーダルな内容を理解する上で大きな成功を収めている。
ビデオ理解タスクでは、高品質でキュレートされたビデオテキストペアリングデータの不足により、トレーニングベースのビデオLLMの構築が困難である。
本研究では,トレーニングフリーのビデオ LLM 構築における既存の圧縮戦略の限界について検討する。
論文 参考訳(メタデータ) (2024-11-17T13:08:29Z) - Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization [52.63845811751936]
ダイナミックスビデオのモデリングのため、ビデオ事前トレーニングは難しい。
本稿では,ビデオ事前学習におけるこのような制限を,効率的なビデオ分解によって解決する。
筆者らのフレームワークは,13のマルチモーダルベンチマークにおいて,画像と映像のコンテントの理解と生成が可能であることを実証した。
論文 参考訳(メタデータ) (2024-02-05T16:30:49Z) - Text-to-feature diffusion for audio-visual few-shot learning [59.45164042078649]
ビデオデータから学ぶことは難しいし、あまり研究されていないが、もっと安いセットアップだ。
3つのデータセットに対して,音声・視覚的数ショット映像分類ベンチマークを導入する。
AV-DIFFは,提案した音声・視覚的少数ショット学習のベンチマークにおいて,最先端の性能が得られることを示す。
論文 参考訳(メタデータ) (2023-09-07T17:30:36Z) - InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding
and Generation [90.71796406228265]
InternVidは大規模なビデオ中心のマルチモーダルデータセットで、強力で転送可能なビデオテキスト表現の学習を可能にする。
InternVidデータセットは700万本以上のビデオが760万時間近く持続し、合計4.1Bワードの詳細な記述を伴う234万本のビデオクリップが生成される。
論文 参考訳(メタデータ) (2023-07-13T17:58:32Z) - Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval [80.7397409377659]
大規模画像と映像キャプションの両方のデータセットを利用した,エンドツーエンドのトレーニング可能なモデルを提案する。
私たちのモデルは柔軟で、画像とビデオの両方のテキストデータセットで、独立に、または同時にトレーニングできます。
この手法は,標準ダウンストリームビデオリトライバルベンチマークにおいて最先端の結果が得られることを示す。
論文 参考訳(メタデータ) (2021-04-01T17:48:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。