論文の概要: Searching a Raw Video Database using Natural Language Queries
- arxiv url: http://arxiv.org/abs/2012.15565v1
- Date: Thu, 31 Dec 2020 11:43:04 GMT
- ステータス: 処理完了
- システム内更新日: 2021-04-17 17:22:54.029930
- Title: Searching a Raw Video Database using Natural Language Queries
- Title(参考訳): 自然言語クエリを用いた生ビデオデータベースの検索
- Authors: Sriram Krishna, Siddarth Vinay, Srinivas K S
- Abstract要約: この作業は、エンドユーザからの音声クエリでビデオデータベースを検索するためのエンドツーエンドパイプラインを提供することを目的とする。
このパイプラインは、Convolutional Neural Networksと組み合わせてRecurrent Neural Networksを利用して、データベースに存在するビデオクリップのキャプションを生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The number of videos being produced and consequently stored in databases for
video streaming platforms has been increasing exponentially over time. This
vast database should be easily index-able to find the requisite clip or video
to match the given search specification, preferably in the form of a textual
query. This work aims to provide an end-to-end pipeline to search a video
database with a voice query from the end user. The pipeline makes use of
Recurrent Neural Networks in combination with Convolutional Neural Networks to
generate captions of the video clips present in the database.
- Abstract(参考訳): ビデオストリーミングプラットフォームのデータベースに保存されるビデオの数は、時間とともに指数関数的に増えている。
この巨大なデータベースは、所定の検索仕様に適合する必要なクリップやビデオを見つけるのに簡単にインデックス化でき、好ましくはテキストクエリの形で検索できる。
この作業は、エンドユーザから音声クエリでビデオデータベースを検索するためのエンドツーエンドパイプラインを提供することを目的としている。
このパイプラインでは、リカレントニューラルネットワークと畳み込みニューラルネットワークを組み合わせて、データベースに存在するビデオクリップのキャプションを生成する。
関連論文リスト
- Hierarchical Video-Moment Retrieval and Step-Captioning [68.4859260853096]
HiRESTは、インストラクショナルビデオデータセットから3.4Kのテキストビデオペアで構成されている。
我々の階層的ベンチマークは、ビデオ検索、モーメント検索、2つの新しいモーメントセグメンテーション、ステップキャプションタスクからなる。
論文 参考訳(メタデータ) (2023-03-29T02:33:54Z) - Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval? [131.300931102986]
現実のシナリオでは、オンラインビデオにはタイトルやタグ、サブタイトルなど、関連するテキスト情報が添付されることが多い。
そこで本研究では,ゼロショットビデオキャプションを用いて動画から関連キャプションを直接生成する手法を提案する。
我々は,我々のアプローチの有効性を実証する包括的アブレーション研究を行っている。
論文 参考訳(メタデータ) (2022-12-31T11:50:32Z) - VPN: Video Provenance Network for Robust Content Attribution [72.12494245048504]
VPN - オンラインで共有されているビデオから出典情報を復元するコンテンツ属性手法を提案する。
完全長あるいは切り離されたビデオクエリを用いて,このようなビデオのマッチングに頑健な検索埋め込みを学習する。
一度ビデオクリップの信頼できるデータベースにマッチすると、そのクリップの出所に関する関連情報がユーザに提示される。
論文 参考訳(メタデータ) (2021-09-21T09:07:05Z) - QuerYD: A video dataset with high-quality text and audio narrations [85.6468286746623]
ビデオの検索とイベントのローカライゼーションのための大規模データセットQuerYDを紹介する。
データセットのユニークな特徴は、ビデオ毎に2つのオーディオトラック(オリジナルオーディオと高品質な音声記述)が利用可能であることです。
YouDescribeは、既存のYouTubeビデオに音声ナレーションを付加することで視覚障害者を支援するボランティアプロジェクトだ。
論文 参考訳(メタデータ) (2020-11-22T17:33:44Z) - VLG-Net: Video-Language Graph Matching Network for Video Grounding [57.6661145190528]
ビデオにおける言語クエリのグラウンディングは、言語クエリに関連する時間間隔(またはモーメント)を特定することを目的としている。
我々はこの問題をアルゴリズム的なグラフマッチング問題に再キャストする。
広範に使用されている3つのデータセットに対して,最先端の接地手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2020-11-19T22:32:03Z) - A Hierarchical Multi-Modal Encoder for Moment Localization in Video
Corpus [31.387948069111893]
テキストクエリにセマンティックにマッチする長いビデオにおいて、短いセグメントを識別する方法を示す。
この問題に対処するために、粗いクリップレベルと微調整フレームレベルの両方でビデオをエンコードするHierArchical Multi-Modal EncodeR (HAMMER)を提案する。
我々は、ActivityNet CaptionsとTVRデータセット上のビデオコーパスにおけるモーメントローカライゼーションのモデルを評価するために、広範囲にわたる実験を行った。
論文 参考訳(メタデータ) (2020-11-18T02:42:36Z) - Tree-Augmented Cross-Modal Encoding for Complex-Query Video Retrieval [98.62404433761432]
インターネット上のユーザ生成ビデオの急速な増加により、テキストベースのビデオ検索システムの必要性が高まっている。
従来の手法は主に単純なクエリによる検索における概念に基づくパラダイムを好んでいる。
木を増設したクロスモーダルを提案する。
クエリの言語構造とビデオの時間表現を共同で学習する手法。
論文 参考訳(メタデータ) (2020-07-06T02:50:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。