論文の概要: RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement
- arxiv url: http://arxiv.org/abs/2608.09111v1
- Date: Mon, 10 Aug 2026 04:38:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.080919
- Title: RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement
- Title(参考訳): RAVEN-Eval:LMM選好判断に基づくAIビデオ生成モデルのルーブリックガイドによる自動評価
- Authors: Ziheng Jia, Jiaying Qian, Zicheng Zhang, Xiaorong Zhu, Lancheng Gao, Xiongkuo Min,
- Abstract要約: 本稿では,AIビデオ生成モデルのためのルーリック誘導自動評価フレームワークであるRAVEN-Evalを提案する。
RAVEN-Evalは150のテキスト・トゥ・ビデオ(T2V)タスクと100のイメージ・トゥ・ビデオ(I2V)タスクをキュレートし、4500以上のAIGVを体系的に収集する。
ルーブリック誘導による自動LMM選好判断を採用しており、LMM判断者はタスク固有のルーブリックに応じてペアワイズ比較を行う。
- 参考スコア(独自算出の注目度): 57.69183952694724
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI video generation has advanced rapidly and entered widespread commercial use. As a result, quality differences among videos produced by state-of-the-art AI video generation models~(AIVGMs) have become increasingly difficult to discern using conventional evaluation criteria, such as visual fidelity and semantic instruction following. Meanwhile, human evaluation now requires more expertise and sustained attention, substantially increasing annotation costs. This calls for automated evaluation that can reliably distinguish fine-grained differences among advanced AIVGMs with minimal human intervention. To address this challenge, we present RAVEN-Eval, a rubric-guided automated evaluation framework for AIVGMs, built primarily on the LMM-as-a-judge paradigm. Through an automatic task curation and quality-filtering pipeline, RAVEN-Eval curates 150 text-to-video~(T2V) tasks and 100 image-to-video~(I2V) tasks, and systematically collects more than 4,500 AIGVs. At its core, RAVEN-Eval adopts rubric-guided automated LMM preference judgement, in which LMM judges conduct pairwise comparisons according to task-specific rubrics. It further introduces an anchor-based model insertion approach to reduce the evaluation cost of incorporating new models. Finally, we evaluate 20 high-performance AIVGMs, as well as the judging capabilities of 13 LMM judges, and establish the RAVEN-Eval Leaderboards. Overall, RAVEN-Eval paves a scalable path for automatic and trustworthy evaluation of rapidly evolving AIVGMs.
- Abstract(参考訳): AIビデオ生成は急速に進歩し、広く商業的に利用されるようになった。
その結果、現状のAIビデオ生成モデル(AIVGM)による映像の品質差は、視覚的忠実度や意味的指示といった従来の評価基準を用いて識別することがますます困難になっている。
一方、人間の評価には専門知識と注意が必要となり、アノテーションのコストが大幅に増大した。
これにより、人間の介入を最小限に抑えた高度なAIVGM間のきめ細かい違いを確実に識別できる自動評価が求められます。
この課題に対処するために、主にLMM-as-a-judgeパラダイムに基づいて構築されたAIVGMのためのルーリック誘導自動評価フレームワークであるRAVEN-Evalを提案する。
RAVEN-Evalは、自動タスクキュレーションと品質フィルタリングパイプラインを通じて、150のテキスト・トゥ・ビデオ〜(T2V)タスクと100のイメージ・トゥ・ビデオ〜(I2V)タスクをキュレートし、4500以上のAIGVを体系的に収集する。
RAVEN-Evalはルーブリック誘導による自動LMM選好判断を採用しており、LMM判断はタスク固有のルーブリックに応じてペアワイズ比較を行う。
さらに、新しいモデルを導入する際の評価コストを低減するために、アンカーベースのモデル挿入手法を導入する。
最後に、20個の高性能AIVGMと13個のLMM審査員の判断能力を評価し、RAVEN-Eval Leaderboardを確立する。
全体として、RAVEN-Evalは、急速に進化するAIVGMの自動的かつ信頼性の高い評価のためのスケーラブルなパスを舗装している。
関連論文リスト
- AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation [11.572835837392867]
AI生成ビデオ評価(AIGVE)のための統合モデルAIVE-MACSを紹介する。
AIGVE-BENCH 2は、2500のAI生成ビデオと22,500の人間による注釈付き詳細なコメントと数値スコアからなる大規模なベンチマークです。
教師付きベンチマークとゼロショットベンチマークの総合的な実験は、AIGVE-MACSがスコアリング相関とコメント品質の両方で最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-07-02T00:20:06Z) - UVE: Are MLLMs Unified Evaluators for AI-Generated Videos? [21.200287880994235]
本稿では,AI生成ビデオ(AIGV)の統一評価手段として,マルチモーダル大言語モデル(MLLM)の有用性について検討する。
UVE-Benchは、最先端のVGMが生成したビデオを収集し、15の評価側面で相互に人間の好みのアノテーションを提供する。
実験結果から,高度なMLLMは人間の評価に遅れを取っているものの,AIGVの統一評価において有望な能力を示し,既存の評価手法をはるかに上回っていることが示唆された。
論文 参考訳(メタデータ) (2025-03-13T01:52:27Z) - AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM [54.44479359918971]
AIGVQA-DBは,1,048プロンプトを用いた15の高度なテキスト・ビデオ・モデルによって生成された36,576個のAIGVからなる大規模データセットである。
AIGV-Assessorは、複雑な品質特性を活用して、正確なビデオ品質スコアとペアビデオ嗜好をキャプチャする新しいVQAモデルである。
論文 参考訳(メタデータ) (2024-11-26T08:43:15Z) - GAIA: Rethinking Action Quality Assessment for AI-Generated Videos [56.047773400426486]
アクション品質アセスメント(AQA)アルゴリズムは、主に実際の特定のシナリオからのアクションに焦点を当て、規範的なアクション機能で事前訓練されている。
我々は,新たな因果推論の観点から大規模主観評価を行うことにより,GAIAを構築した。
その結果、従来のAQA手法、最近のT2Vベンチマークにおけるアクション関連指標、メインストリームビデオ品質手法は、それぞれ0.454、0.191、0.519のSRCCで性能が良くないことがわかった。
論文 参考訳(メタデータ) (2024-06-10T08:18:07Z) - A-Bench: Are LMMs Masters at Evaluating AI-generated Images? [78.3699767628502]
A-Benchは、マルチモーダルモデル(LMM)がAI生成画像(AIGI)を評価するマスターであるかどうかを診断するために設計されたベンチマークである。
最終的に、16のテキスト・ツー・イメージモデルの2,864のAIGIがサンプリングされ、それぞれが人間の専門家によって注釈付けされた質問回答と組み合わせられ、18のLMMでテストされる。
論文 参考訳(メタデータ) (2024-06-05T08:55:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。