論文の概要: LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.01086v1
- Date: Wed, 01 Jul 2026 15:40:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.970098
- Title: LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models
- Title(参考訳): LongVQubench:視覚言語モデルの長期ビデオ品質理解のベンチマーク
- Authors: Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin,
- Abstract要約: LongVQUBenchは、長期的なビデオ品質理解のための総合的なベンチマークである。
映画、ドキュメンタリー、監視映像、エゴセントリックな録音、アニメーションコンテンツなど、1200以上の多様なビデオが収録されている。
テストでは、ビデオの長さと推論の深さが増大し、性能が著しく低下する。
- 参考スコア(独自算出の注目度): 55.09980634684327
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The evaluation of long-term video quality understanding remains an open challenge for large vision-language models (LVLMs). Existing video quality benchmarks predominantly focus on short clips and isolated distortions, overlooking the temporal continuity, cumulative degradation, and reasoning complexity inherent in long-duration content. To address these limitations, we present LongVQUBench, a comprehensive benchmark for long-term video quality understanding. LongVQUBench contains over 1200 diverse videos spanning movies, documentaries, surveillance footage, egocentric recordings, and animated content, accompanied by 1500 multiple-choice and open-ended questions for validation and testing. To assess perceptual reasoning across different temporal scopes, we introduce three progressively complex evaluation levels: (i) local event quality understanding (LQU) for analyzing localized distortions; (ii) cross-event quality reasoning (CQR) for integrating multiple degraded events; and (iii) global quality understanding (GQU) for holistic perceptual evaluation over extended durations. Furthermore, a needle distortion question-answering (NDQA) paradigm is embedded across all three levels, where spatial or temporal artifacts are sparsely inserted to probe fine-grained detection and reasoning capabilities. Extensive experiments on 14 state-of-the-art LVLMs reveal significant performance degradation with increasing video length and reasoning depth, highlighting their limited capacity for long-range temporal integration and perceptual attribution. We envision LongVQUBench as a foundational step toward the systematic, hierarchical, and explainable evaluation of LVLMs' long-term video quality understanding.
- Abstract(参考訳): ビデオ品質の長期的理解の評価は、大規模視覚言語モデル(LVLM)のオープンな課題であり続けている。
既存のビデオ品質ベンチマークは、主に短いクリップと孤立した歪みに注目し、時間的連続性、累積劣化、長期コンテンツに固有の推論の複雑さを見下ろしている。
これらの制約に対処するため、LongVQUBenchという長期ビデオ品質理解のための総合的なベンチマークを提示する。
LongVQUBenchには、映画、ドキュメンタリー、監視映像、エゴセントリックな録音、アニメーションコンテンツを含む1200以上の多様なビデオがあり、1500の多重選択と、検証とテストのためのオープンな質問が付属している。
異なる時間領域における知覚的推論を評価するために,3つの段階的に複雑な評価レベルを導入する。
(i)局所的な歪みを分析するための局所事象品質理解(LQU)
(二)複数の劣化イベントを統合するためのクロスイベント品質推論(CQR)
3) 長期にわたる包括的知覚評価のためのグローバル品質理解(GQU)。
さらに、針歪み質問答え(NDQA)パラダイムは、空間的または時間的アーティファクトをわずかに挿入して、きめ細かい検出と推論能力を調査する3つのレベルすべてに埋め込まれている。
14種類のLVLMの広汎な実験により、ビデオ長と推論深度が増大し、長期の時間的統合と知覚的帰属能力の限界が強調された。
我々はLongVQubenchをLVLMの長期ビデオ品質理解の体系的、階層的、説明可能な評価に向けた基礎的なステップとして想定する。
関連論文リスト
- VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding [27.284730260765883]
VideoOdysseyは、ウルトラロングコンテキストとオムニモードのビデオ理解のためのベンチマークである。
11のドメインと54のサブカテゴリにまたがっており、平均ビデオ時間は109分である。
さまざまなコンテキストの長さと認知的負荷のモデルを評価するための総合的な診断ツールを提供する。
論文 参考訳(メタデータ) (2026-05-21T18:00:22Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval [61.414236415351446]
長ビデオモーメント検索(LMVR)のための新しいベンチマークであるMomentSeekerを提案する。
MomentSeekerは、長く多様なビデオに基づいて作られ、平均1200秒以上持続する。
グローバルレベル、イベントレベル、オブジェクトレベル、アクション認識、オブジェクトローカライゼーション、因果推論といった一般的なタスクをカバーする。
論文 参考訳(メタデータ) (2025-02-18T05:50:23Z) - HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding [20.184894298462652]
我々は、長時間ビデオ理解モデルを評価するために、大規模な時間長ビデオベンチマークHLV-1Kを構築した。
HLV-1Kは、高品質質問応答(QA)とマルチチョイス質問応答(MCQA)を備えた1009時間ビデオからなる。
我々は,既存の最先端手法を用いてベンチマークを評価し,様々なレベルでの深層ビデオ理解能力をテストすることの価値を実証した。
論文 参考訳(メタデータ) (2025-01-03T05:32:37Z) - LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering [49.68215536040896]
LvBenchは多目的なマルチモーダル質問応答のための長文ビデオ理解ベンチマークである。
ビデオは70秒から4時間で、シングルシーン、マルチシーン、フルシーンのコンテキストをカバーしています。
本データセットは、慎重に選択された100本の映画から得られた20,061組の質問応答対からなる。
論文 参考訳(メタデータ) (2023-12-08T03:33:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。