論文の概要: StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation
- arxiv url: http://arxiv.org/abs/2608.26336v1
- Date: Wed, 26 Aug 2026 19:16:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.162042
- Title: StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation
- Title(参考訳): StreamAV-Bench: オーディオビデオ生成の総合ベンチマーク
- Abstract要約: StreamAV-Benchは、ストリーミングオーディオビデオ生成用に調整された最初の包括的なベンチマークである。
解析の結果,現在のモデルでは,対話制御時の進行的生成と応答性のボトルネックが時間的変動に悩まされていることが明らかとなった。
包括的故障解析に基づいて、ネイティブな共同音声-ビデオストリーミングモデルの開発を進めるための洞察を共有する。
- 参考スコア(独自算出の注目度): 48.448082116311156
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advancements in generative models are pushing video generation toward unbounded streaming audio-video generation for real-time interactive worlds. However, existing benchmarks primarily evaluate completed sequences and struggle to capture streaming properties. To bridge this gap, we introduce StreamAV-Bench, the first comprehensive benchmark tailored for streaming audio-video generation. StreamAV-Bench establishes a unified evaluation framework, including the progressive track for instruction adherence and long-horizon stability, and the interactive track for interactive response and state retention and reuse. With expert-verified evaluation cases across 32 fine-grained dimensions, we conduct an extensive evaluation of 13 representative systems. Our analysis reveals that current models suffer from temporal drift in progressive generation and responsiveness bottlenecks during interactive control. Based on a comprehensive failure analysis, we share insights to advance the development of native joint audio-video streaming models.
- Abstract(参考訳): 映像生成モデルの最近の進歩は、リアルタイムインタラクティブな世界に向けて、無制限のストリーミングオーディオビデオ生成に向けて、ビデオ生成を推し進めている。
しかし、既存のベンチマークは主に完了シーケンスを評価し、ストリーミング特性のキャプチャに苦労している。
このギャップを埋めるために、ストリーミングオーディオビデオ生成に適した最初の包括的なベンチマークであるStreamAV-Benchを紹介します。
StreamAV-Benchは、命令順守のためのプログレッシブトラックと長距離安定のためのプログレッシブトラック、対話的な応答と状態保持と再利用のためのインタラクティブトラックを含む、統一された評価フレームワークを確立する。
専門家による32次元の細粒度評価では,13の代表的なシステムについて広範囲に評価を行う。
解析の結果,現在のモデルでは,対話制御時の進行的生成と応答性のボトルネックが時間的変動に悩まされていることが明らかとなった。
包括的故障解析に基づいて、ネイティブな共同音声-ビデオストリーミングモデルの開発を進めるための洞察を共有する。
関連論文リスト
- DiVA: Enabling Interactive Digital Life Simulation via Video Models [107.640138694388]
DiVAは、長期的かつオープンなインタラクティブ体験のための新しいパラダイムを開拓した、インタラクティブなデジタルライフシミュレータである。
長期的な視覚的品質とリアリズムを維持し、持続的でインタラクティブなシミュレーションとしての有効性を検証する。
論文 参考訳(メタデータ) (2026-09-12T09:33:15Z) - MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation [88.7702943548674]
マルチショットオーディオビデオ生成のための,初の総合的なベンチマークと適応型ハイブリッド評価フレームワークであるMSAVBenchを紹介する。
私たちのベンチマークでは、ビデオ、オーディオ、ショット、参照の4つの重要な領域にまたがっており、多様なタスク設定、最大15のショット数、非現実的なシナリオに挑戦しています。
MSAVBenchは人間の判断と高度に一致し、スピアマンのランク相関は91.5%に達する。
論文 参考訳(メタデータ) (2026-05-19T17:59:33Z) - Stream-T1: Test-Time Scaling for Streaming Video Generation [30.575612184373025]
Stream-T1は、ストリーミングビデオ生成専用の総合的なテスト時間スケーリングフレームワークである。
5sと30sの総合的なビデオベンチマークで評価すると、Stream-T1は大きな優位性を示している。
論文 参考訳(メタデータ) (2026-05-06T03:40:05Z) - AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation [42.157453071865056]
AVGen-Benchは、T2AV生成のためのタスク駆動ベンチマークである。
軽量スペシャリストモデルとマルチモーダル大言語モデル(MLLM)を組み合わせた多言語評価フレームワークを提案する。
評価の結果,テキストレンダリングの持続的失敗,音声のコヒーレンス,物理的推論,音声ピッチ制御の普遍的破壊など,強い視覚的美学と弱い意味的信頼性のギャップが明らかとなった。
論文 参考訳(メタデータ) (2026-04-09T17:59:39Z) - STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding [77.20037111885226]
現実のデプロイメントでは、ストリーミングの認識とプロアクティブなインタラクションがますます必要になります。
本研究では、構造化シーケンスモデリング問題として、ストリーミングビデオのアクティブなアクティベーションを再考する。
本稿では,アクティベーションインタフェースに軽量なマスク付き拡散モジュールを用いて,アクティベーション信号を共同で予測し,段階的に洗練するSTRIDEを提案する。
論文 参考訳(メタデータ) (2026-03-29T09:23:45Z) - VIPER: Process-aware Evaluation for Generative Video Reasoning [64.86465792516658]
我々は、時間的、構造的、象徴的、空間的、物理的、計画的推論にまたがる16のタスクにまたがる包括的なベンチマークVIPERを紹介する。
実験の結果,現状の映像モデルでは約20%のPOC@1.0しか達成できず,良好な結果が得られた。
論文 参考訳(メタデータ) (2025-12-31T16:31:59Z) - StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios [33.70462645363648]
StreamEQAは、エンボディされたシナリオにおけるビデオ質問応答の最初のベンチマークである。
156個の独立した長編ビデオの上に構築され、正確なタイムスタンプで約21Kの質問応答ペアを生成する。
StreamEQAは、エンボディされたアプリケーションのためのストリーミングビデオ理解の研究を触媒することを期待しています。
論文 参考訳(メタデータ) (2025-12-04T04:48:16Z) - SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding [56.78088668917983]
SVBenchは時間的マルチターン質問応答チェーンを用いた先駆的ベンチマークである。
半自動アノテーションパイプラインを設計し、49,979対のQA(QA)と1,353本のストリーミングビデオを取得する。
対話とストリーミング評価の14モデルから得られた実験結果から, クローズドソースのGPT-4oは他より優れているが, 大部分のオープンソースLVLMは, 長文のストリーミングビデオ理解に苦慮していることがわかった。
論文 参考訳(メタデータ) (2025-02-15T14:29:44Z) - Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams [78.72965584414368]
人間の記憶機構をシミュレートしたビデオ言語モデルFlash-VStreamを提案する。
既存のモデルと比較して、Flash-VStreamは遅延推論とVRAM消費の大幅な削減を実現している。
本稿では,オンライン動画ストリーミング理解に特化して設計された質問応答ベンチマークであるVStream-QAを提案する。
論文 参考訳(メタデータ) (2024-06-12T11:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。