論文の概要: AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization
- arxiv url: http://arxiv.org/abs/2607.00726v1
- Date: Wed, 01 Jul 2026 10:12:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.844704
- Title: AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization
- Title(参考訳): AV-SyncBench:テンポラル・セマンティック・オーディオ・ビジュアル・シンクロナイゼーションの非結合ベンチマーク
- Abstract要約: 音声・視覚同期のための時間的・意味的評価を分離する最初のベンチマークであるAV-SyncBenchを提案する。
このビデオは、Voice、Music、Soundの10のシナリオと5つの課題にまたがっている。
ベンチマークには3,269本の動画と38,390本のサンプルが含まれており、アライメントおよび下流タスクの特徴的品質を定量化するための5つの代表的なモデルを評価する。
- 参考スコア(独自算出の注目度): 21.773304314522345
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-visual feature extraction is a fundamental component of multimodal understanding and generation tasks. However, existing evaluation protocols for feature extraction models exhibit dimensional bias, typically focusing on either semantic matching or temporal offset detection. Moreover, their data construction remains coupled, preventing independent assessment of temporal and semantic consistency. We propose AV-SyncBench, the first benchmark to fully separate temporal and semantic evaluation for audio-visual synchronization. Built from in-the-wild videos, it spans Voice, Music, and Sound across 10 scenarios and 5 challenge tasks. Data are automatically filtered and manually verified to ensure on-screen sound sources. The benchmark contains 3,269 videos and 38,390 samples, and we evaluate five representative models to quantify feature quality for alignment and downstream tasks. The code and dataset are available at: https://fgt7t6g.github.io/AV-SyncBench.
- Abstract(参考訳): 音声-視覚的特徴抽出はマルチモーダル理解および生成タスクの基本的な構成要素である。
しかし、既存の特徴抽出モデルの評価プロトコルは、通常、意味的マッチングと時間的オフセット検出の両方に焦点を当てた次元バイアスを示す。
さらに、それらのデータ構築は依然として結合されており、時間的および意味的一貫性の独立的な評価を妨げている。
AV-SyncBenchは、音声・視覚同期のための時間的・意味的な評価を完全に分離する最初のベンチマークである。
このビデオは、Voice、Music、Soundの10のシナリオと5つの課題にまたがっている。
データは自動的にフィルタリングされ、画面上の音源を確実にするために手動で検証される。
ベンチマークには3,269本の動画と38,390本のサンプルが含まれており、アライメントおよび下流タスクの特徴的品質を定量化するための5つの代表的なモデルを評価する。
コードとデータセットは、 https://fgt7t6g.github.io/AV-SyncBench.orgで公開されている。
関連論文リスト
- PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation [23.127789678422698]
テキスト・トゥ・オーディオ・ビデオ(T2AV)の生成は急速に進んでいるが、その評価は依然としてオーディオのモダリティを過小評価している。
PRISM-Benchは、T2AV生成のための最初のオーディオ中心診断ベンチマークである。
論文 参考訳(メタデータ) (2026-09-04T08:27:10Z) - Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation [58.79612575170589]
既存の手法では、重なり合う音響イベントと視覚的インスタンスをマッチングし、音声視覚力学を扱うのに苦労している。
本稿では,2つのメカニズムを用いて,これらの課題に対処するH2Sを提案する。
論文が受け入れられたら、コードはオープンソースになる。
論文 参考訳(メタデータ) (2026-08-04T07:35:57Z) - VABench: A Comprehensive Benchmark for Audio-Video Generation [22.00633729850902]
VABenchは、同期オーディオビデオ生成の機能を評価するために設計されたベンチマークフレームワークである。
タスクタイプは、text-to-audio-video (T2AV)、 Image-to-audio-video (I2AV)、ステレオオーディオビデオ生成の3種類である。
VABenchは、動物、人間の音、音楽、環境音、同期物理音、複雑なシーン、バーチャルワールドの7つの主要なコンテンツカテゴリをカバーしている。
論文 参考訳(メタデータ) (2025-12-10T03:57:29Z) - JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization [94.82127738291749]
JavisDiTは、オープンエンドのユーザープロンプトから高品質なオーディオとビデオコンテンツを同時に生成することができる。
新しいベンチマークであるJavisBenchは、さまざまなシーンと複雑な現実世界のシナリオにまたがる、10,140の高品質なテキストキャプション付きサウンドビデオで構成されている。
論文 参考訳(メタデータ) (2025-03-30T09:40:42Z) - Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising [114.39028517171236]
そこで我々は,ゼロショット音声映像編集を導入し,新たなモデルトレーニングを必要とせず,特定のテキストプロンプトに合わせるために,オリジナル音声映像コンテンツを変換する新しいタスクを提案する。
この課題を評価するために、ゼロショットオーディオビデオ編集用に明示的に設計されたベンチマークデータセットAvED-Benchをキュレートする。
AvEDは、AvED-Benchと最近のOAVEデータセットの両方で優れた結果を示し、その一般化能力を検証する。
論文 参考訳(メタデータ) (2025-03-26T17:59:04Z) - FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds [14.636030346325578]
我々は,ビデオと同期する高品質な音響効果の自動生成であるNeural Foleyについて検討し,没入型音声視覚体験を実現する。
本稿では,高品質な音声生成を実現するために,事前学習されたテキスト・音声モデルを活用する新しいフレームワークであるFoleyCrafterを提案する。
FoleyCrafterの特筆すべき利点は、テキストプロンプトとの互換性である。
論文 参考訳(メタデータ) (2024-07-01T17:35:56Z) - Synchformer: Efficient Synchronization from Sparse Cues [100.89656994681934]
コントリビューションには、新しい音声-視覚同期モデル、同期モデルからの抽出を分離するトレーニングが含まれる。
このアプローチは、濃密な設定とスパース設定の両方において最先端の性能を実現する。
また,100万スケールの 'in-the-wild' データセットに同期モデルのトレーニングを拡張し,解釈可能性に対するエビデンス属性技術を調査し,同期モデルの新たな機能であるオーディオ-視覚同期性について検討する。
論文 参考訳(メタデータ) (2024-01-29T18:59:55Z) - On the Audio-visual Synchronization for Lip-to-Speech Synthesis [22.407313748927393]
GRID, TCD-TIMIT, Lip2Wav などの一般的な音声視覚データセットは, データの非同期性に問題があることを示す。
このようなデータセットでリップ・トゥ・スペルのトレーニングを行うと、モデル非同期問題(つまり、生成された音声と入力ビデオの同期が切れている)がさらに引き起こされる可能性がある。
論文 参考訳(メタデータ) (2023-03-01T13:35:35Z) - Sparse in Space and Time: Audio-visual Synchronisation with Trainable
Selectors [103.21152156339484]
本研究の目的は,一般映像の「野生」音声・視覚同期である。
我々は4つのコントリビューションを行う: (i) スパース同期信号に必要な長時間の時間的シーケンスを処理するために、'セレクタ'を利用するマルチモーダルトランスモデルを設計する。
音声やビデオに使用される圧縮コーデックから生じるアーティファクトを識別し、トレーニングにおいてオーディオ視覚モデルを用いて、同期タスクを人工的に解くことができる。
論文 参考訳(メタデータ) (2022-10-13T14:25:37Z) - Rethinking Audio-visual Synchronization for Active Speaker Detection [62.95962896690992]
アクティブ話者検出(ASD)に関する既存の研究は、アクティブ話者の定義に一致しない。
本稿では,アテンションモジュールに位置符号化を適用し,教師付きASDモデルに適用し,同期キューを活用することを提案する。
実験結果から,既存モデルの制限に対処して,非同期音声を発話しないものとして検出できることが示唆された。
論文 参考訳(メタデータ) (2022-06-21T14:19:06Z) - Audio-Visual Synchronisation in the wild [149.84890978170174]
我々は,VGG-Sound Syncという,高い音声・視覚相関を持つテストセットを同定し,キュレートする。
任意の長さの音響信号と視覚信号のモデル化に特化して設計された,トランスフォーマーに基づく多数のアーキテクチャ変種を比較した。
我々は,新しいVGG-Sound Syncビデオデータセットにおいて,160以上の多様なクラスと一般的な音声-視覚同期のための最初のベンチマークを設定した。
論文 参考訳(メタデータ) (2021-12-08T17:50:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。