論文の概要: PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
- arxiv url: http://arxiv.org/abs/2609.04867v2
- Date: Wed, 09 Sep 2026 03:05:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 15:10:00.990206
- Title: PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
- Title(参考訳): PRISM-Bench:テキスト対オーディオビデオ生成のためのオーディオ中心診断ベンチマーク
- Authors: Yuchen Sun, Qian Yang, Jun Wang, Detai Xin, Guoqiao Yu, Guanglu Wan, Qi Jia,
- Abstract要約: テキスト・トゥ・オーディオ・ビデオ(T2AV)の生成は急速に進んでいるが、その評価は依然としてオーディオのモダリティを過小評価している。
PRISM-Benchは、T2AV生成のための最初のオーディオ中心診断ベンチマークである。
- 参考スコア(独自算出の注目度): 23.127789678422698
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Text-to-audio-video (T2AV) generation has advanced rapidly, but its evaluation still underestimates the audio modality. Existing benchmarks either treat audio as an auxiliary component of video quality or assess it in isolation from audiovisual grounding, making it difficult to diagnose where current systems truly succeed or fail in audio generation. We present PRISM-Bench, the first audio-centric diagnostic benchmark for T2AV generation. Built from a rigorously curated dataset of 900 human-verified samples, PRISM-Bench factorizes audio evaluation along two orthogonal axes: audio type (Speech, Music, and Sound) and sound-source visibility (On-screen vs. Off-screen). It evaluates generated content across four perceptual dimensions (Audio-Visual Coherence, Audio Quality, Audio Expressiveness, and Prompt Following) with 35 fine-grained criteria. To ensure reliable assessment, we adopt an enhanced MLLM-as-a-Judge protocol based on blind, side-by-side comparison against ground-truth references, demonstrating strong alignment (over 70% mean agreement) with human raters. Our evaluation of recent T2AV systems highlights a significant performance gap between frontier and open-source models. Furthermore, we demonstrate that current generation paradigms overfit to perceptual fidelity while struggling with complex grounding and control tasks, particularly in generating music and synchronized On-screen audio.
- Abstract(参考訳): テキスト・トゥ・オーディオ・ビデオ(T2AV)の生成は急速に進んでいるが、その評価は依然としてオーディオのモダリティを過小評価している。
既存のベンチマークでは、オーディオをビデオ品質の補助的要素として扱うか、オーディオ視覚的グラウンドティングから分離して評価する。
PRISM-Benchは、T2AV生成のための最初のオーディオ中心診断ベンチマークである。
PRISM-Benchは、900の人間認証サンプルの厳格にキュレートされたデータセットから作られ、オーディオタイプ(Speech、Music、Sound)とサウンドソースの可視性(On-screen vs. Off-screen)の2つの直交軸に沿ってオーディオ評価を分解する。
視覚的コヒーレンス(Audio-Visual Coherence, Audio Quality, Audio Expressiveness, Prompt following)の4次元で生成したコンテンツを,35のきめ細かい基準で評価する。
信頼性の高い評価を実現するため, ブラインド・バイ・サイド・サイド比較に基づくMLLM-as-a-Judgeプロトコルを導入し, 高いアライメント(平均約70%以上)を示す。
近年のT2AVシステムの評価では,フロンティアモデルとオープンソースモデルとの大幅な性能差が浮き彫りになっている。
さらに、複雑な接地や制御タスク、特に音楽の生成やオンスクリーン音声の同期に苦労しながら、現在の世代パラダイムが知覚の忠実さに過度に適合していることを示す。
関連論文リスト
- VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories [47.95995227527911]
VidAudio-Benchは、4つの重要な特徴を持つV2A評価のためのマルチタスクベンチマークである。
1,634組のビデオテキストペアと、11の最先端世代モデルをベンチマークする。
主観的な研究を通じてすべての指標を検証し、人間の嗜好と強い一貫性を示す。
論文 参考訳(メタデータ) (2026-04-12T09:11:55Z) - AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation [42.157453071865056]
AVGen-Benchは、T2AV生成のためのタスク駆動ベンチマークである。
軽量スペシャリストモデルとマルチモーダル大言語モデル(MLLM)を組み合わせた多言語評価フレームワークを提案する。
評価の結果,テキストレンダリングの持続的失敗,音声のコヒーレンス,物理的推論,音声ピッチ制御の普遍的破壊など,強い視覚的美学と弱い意味的信頼性のギャップが明らかとなった。
論文 参考訳(メタデータ) (2026-04-09T17:59:39Z) - T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation [41.03487954415606]
Text-to-Audio-Video (T2AV) は、自然言語から時間的コヒーレントなビデオと意味的に同期された音声を合成することを目的としている。
本稿では,T2AVシステムの総合評価のための統合ベンチマークであるT2AV-を提案する。
最強のモデルでさえ、人間レベルのリアリズムとクロスモーダルな一貫性にかなり劣っている。
論文 参考訳(メタデータ) (2025-12-24T10:30:35Z) - VABench: A Comprehensive Benchmark for Audio-Video Generation [22.00633729850902]
VABenchは、同期オーディオビデオ生成の機能を評価するために設計されたベンチマークフレームワークである。
タスクタイプは、text-to-audio-video (T2AV)、 Image-to-audio-video (I2AV)、ステレオオーディオビデオ生成の3種類である。
VABenchは、動物、人間の音、音楽、環境音、同期物理音、複雑なシーン、バーチャルワールドの7つの主要なコンテンツカテゴリをカバーしている。
論文 参考訳(メタデータ) (2025-12-10T03:57:29Z) - Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching [51.70360630470263]
Video-to-audio (V2A) は、サイレントビデオからコンテンツマッチング音声を合成することを目的としている。
本稿では,修正フローマッチングに基づくV2AモデルであるFrierenを提案する。
実験により、フリーレンは世代品質と時間的アライメントの両方で最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2024-06-01T06:40:22Z) - AdVerb: Visually Guided Audio Dereverberation [49.958724234969445]
本稿では,新しいオーディオ・ビジュアル・デバーベレーション・フレームワークであるAdVerbを紹介する。
残響音に加えて視覚的手がかりを用いてクリーンオーディオを推定する。
論文 参考訳(メタデータ) (2023-08-23T18:20:59Z) - NAViDAd: A No-Reference Audio-Visual Quality Metric Based on a Deep
Autoencoder [0.0]
ディープオートエンコーダ(NAViDAd)に基づく非参照音声品質指標を提案する。
このモデルは、ディープオートエンコーダ層と分類層を含む2層フレームワークによって構成される。
このモデルは、UnB-AVとLiveNetflix-IIデータベースでテストするとうまく動作した。
論文 参考訳(メタデータ) (2020-01-30T15:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。