論文の概要: Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model
- arxiv url: http://arxiv.org/abs/2607.16742v1
- Date: Sat, 18 Jul 2026 10:04:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.251619
- Title: Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model
- Title(参考訳): AIによる人間中心映像の多次元品質評価:データセットとモデル
- Abstract要約: HVEval+はAIが生成する人間中心ビデオの総合的品質評価データセットとしては最大である。
MoE-Raterは、Mixture-of-Experts (MoE)にインスパイアされたマルチモーダルな大規模言語モデル(MLLM)ベースのオールインワン方式である。
- 参考スコア(独自算出の注目度): 95.02470963378896
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-generated human-centric videos play a crucial role in a wide range of modern applications. However, they often suffer from quality issues and semantic mismatches, underscoring the importance of effective quality assessment for such videos. To this end, we extend our previous dataset HVEval with pairwise preference annotations, resulting in HVEval+, the largest holistic quality assessment dataset for AI-generated human-centric videos, which comprises 1k prompts based on a comprehensive taxonomy, 20k videos generated by 24 text-to-video (T2V) models, and extensive human annotations, including 60k mean opinion scores (MOSs) and 60k preference pairs across 3 dimensions (i.e., spatial quality, temporal quality, and text-video correspondence), as well as 20k category-specific question-answer (Q&A) pairs. Along with the HVEval+ dataset, we further propose MoE-Rater, a Mixture-of-Experts (MoE)-inspired and multimodal large language model (MLLM)-based all-in-one method that supports multi-dimensional quality rating, multi-dimensional pairwise comparison, and category-specific question answering within a single model. Specifically, we introduce Mixture of Projector Experts (MoPE) and Mixture of LoRA Experts (MoLE), together with a three-stage training strategy consisting of task-aware pre-training, task-specific adaptation, and adaptive routing optimization, to effectively unify multiple tasks, resulting in superior performance on both HVEval+ and Human-AGVQA datasets. Extensive experiments and comprehensive analysis demonstrate the significant potential of the HVEval+ dataset and the MoE-Rater method in advancing AI-generated video quality assessment and further facilitating the evaluation and optimization of T2V models.
- Abstract(参考訳): AIが生成する人間中心のビデオは、さまざまな現代的なアプリケーションにおいて重要な役割を果たす。
しかし、彼らはしばしば品質問題や意味的ミスマッチに悩まされ、このようなビデオに対する効果的な品質評価の重要性を強調している。
この目的のために、従来のデータセットであるHVEvalをペアワイズ・レコメンデーション・アノテーション(ペアワイズ・レコメンデーション・アノテーション)で拡張し、AI生成された人間中心ビデオの全体的品質評価データセットとして最大となるHVEval+を、包括的分類に基づく1kプロンプト、24のテキスト・ツー・ビデオ(T2V)モデルで生成された20kビデオ、および3次元にわたる60k平均意見スコア(MOS)と60k選好ペア(空間的品質、時間的品質、テキスト・ビデオ対応)を含む広範囲な人間のアノテーションを含む。
HVEval+データセットと合わせて,Mixture-of-Experts(MoE)にインスパイアされたマルチモーダルな大規模言語モデル(MLLM)に基づくオールインワン手法であるMoE-Raterを提案する。
具体的には,Mixture of Projector Experts (MoPE) とMixture of LoRA Experts (MoLE) を,タスク認識事前学習,タスク固有適応,適応ルーティング最適化からなる3段階のトレーニング戦略とともに導入し,複数のタスクを効果的に統一することにより,HVEval+とHuman-AGVQAデータセット上での優れたパフォーマンスを実現する。
HVEval+データセットとMoE-RaterメソッドがAI生成ビデオ品質評価を推進し、さらにT2Vモデルの評価と最適化を容易にすることを示す。
関連論文リスト
- VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation [65.0648741395158]
VGA-Benchは、ビデオ生成の品質と美的品質を評価するための統一されたベンチマークである。
我々は1016の多様なプロンプトを設計し、12のビデオ生成モデルを用いて6万以上のビデオの大規模データセットを生成する。
我々のモデルは人間の判断と信頼できる一致を実現し、精度と効率の両方を提供する。
論文 参考訳(メタデータ) (2026-04-11T09:44:39Z) - Analytic Score Optimization for Multi Dimension Video Quality Assessment [14.857118087904206]
本稿では,5つの重要な品質次元にアノテートされた多様なユーザ生成コンテンツ(UGC)を含む大規模多次元VQAデータセットを提案する。
データセット内の各ビデオは、これらの次元で3人以上のラッカーによってスコアされ、微粒なサブ属性ラベルが付けられます。
解析スコア最適化(ASO)は,多次元VQAから導出される学習後目標である。
論文 参考訳(メタデータ) (2026-02-18T20:34:24Z) - VideoScore2: Think before You Score in Generative Video Evaluation [69.43069741467603]
VideoScore2は、視覚的品質、テキスト・ツー・ビデオのアライメント、物理的/常識的一貫性を明確に評価する多次元、解釈可能、そして人間によるアライメントフレームワークである。
我々のモデルは、27,168人の注釈付きビデオを含む大規模なデータセットVideoFeedback2で訓練されている。
論文 参考訳(メタデータ) (2025-09-26T18:09:03Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation [46.994391428519776]
AI生成ビデオ評価のための包括的なデータセットとベンチマークであるAIGVE-60Kを提案する。
本稿では,LMMに基づくAIGV評価尺度であるLOVEを提案する。
論文 参考訳(メタデータ) (2025-05-17T17:49:26Z) - AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM [54.44479359918971]
AIGVQA-DBは,1,048プロンプトを用いた15の高度なテキスト・ビデオ・モデルによって生成された36,576個のAIGVからなる大規模データセットである。
AIGV-Assessorは、複雑な品質特性を活用して、正確なビデオ品質スコアとペアビデオ嗜好をキャプチャする新しいVQAモデルである。
論文 参考訳(メタデータ) (2024-11-26T08:43:15Z) - Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model [56.03592388332793]
主観的・客観的な品質評価の観点からAIGC-VQA問題を考察する。
主観的観点からは,2,808本のAIGCビデオからなる大規模映像品質評価(LGVQ)データセットを構築した。
我々は,AIGCビデオの知覚的品質を,空間的品質,時間的品質,テキスト・ビデオアライメントの3つの重要な次元から評価した。
本稿では,AIGCビデオの多次元品質を正確に評価するUnify Generated Video Quality Assessment (UGVQ)モデルを提案する。
論文 参考訳(メタデータ) (2024-07-31T07:54:26Z) - EvalCrafter: Benchmarking and Evaluating Large Video Generation Models [70.19437817951673]
これらのモデルはしばしば、マルチアスペクト能力を持つ非常に大きなデータセットで訓練されているので、単純な指標から大きな条件生成モデルを判断することは困難である、と我々は主張する。
我々のアプローチは、テキスト・ツー・ビデオ生成のための700のプロンプトの多種多様な包括的リストを作成することである。
そこで我々は、視覚的品質、コンテンツ品質、動作品質、テキスト・ビデオアライメントの観点から、慎重に設計されたベンチマークに基づいて、最先端のビデオ生成モデルを評価する。
論文 参考訳(メタデータ) (2023-10-17T17:50:46Z) - Unified Quality Assessment of In-the-Wild Videos with Mixed Datasets
Training [20.288424566444224]
我々は、コンピュータビジョンアプリケーションにおいて、Wildビデオの品質を自動評価することに注力する。
品質評価モデルの性能向上のために,人間の知覚から直観を借りる。
複数のデータセットで単一のVQAモデルをトレーニングするための混合データセットトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2020-11-09T09:22:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。