論文の概要: VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation
- arxiv url: http://arxiv.org/abs/2607.13527v1
- Date: Wed, 15 Jul 2026 07:26:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.683881
- Title: VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation
- Title(参考訳): VGIFスコア:ビデオ生成における時空間インストラクションの解釈と評価
- Abstract要約: VGIF-Scoreは、ビデオ生成における指示に従うための高度に自動化され解釈可能なフレームワークである。
約4.3Kのきめ細かい評価と組み合わせて、223の長い、構造的に絡み合ったプロンプトのベンチマークであるVGIF-Rub上で、このフレームワークをインスタンス化する。
プロプライエタリでオープンソースのVGMを3K以上のビデオで実験したところ、VGIF-Scoreはビデオ生成命令の信頼性、解釈可能、診断に有用な評価を提供することがわかった。
- 参考スコア(独自算出の注目度): 43.856491043310875
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent video generation models (VGMs) have made substantial progress in visual fidelity, yet their ability to follow long, compositional instructions remains insufficiently evaluated. Existing evaluation protocols often rely on prompts that are short and semantically shallow, with limited atomic constraints and weak spatio-temporal dependencies. They also frequently depend on costly human evaluation or handcrafted vision pipelines, while providing little diagnostic insight into which instruction constraints succeed or fail. To address this gap, we propose VGIF-Score, a highly automated and interpretable framework for evaluating instruction following in video generation. VGIF-Score consists of two complementary components: an objective completion branch that parses prompts into a Spatio-Temporal Directed Acyclic Graph (ST-DAG) and performs dependency-aware QA with short-circuit diagnostics, and a subjective satisfaction branch that uses instruction-conditioned AutoRubric to assess cinematography, visual purity, motion smoothness, and physics adherence. Together, these components produce a unified score that captures both objective completion and perceptual satisfaction. We instantiate this framework on VGIF-Bench, a benchmark of 223 long, structurally entangled prompts paired with approximately 4.3K fine-grained evaluation items. Experiments on 14 proprietary and open-source VGMs across more than 3K generated videos show that VGIF-Score provides reliable, interpretable, and diagnostically useful evaluation of video generation instruction following. The code will be available at https://github.com/PRIS-CV/VGIF-SCORE.
- Abstract(参考訳): 近年の映像生成モデル (VGM) は, 映像の忠実度を著しく向上させたが, 長い合成指示に従う能力は十分に評価されていない。
既存の評価プロトコルは、しばしば短く、意味的に浅いプロンプトに依存し、制限された原子制限と弱い時空間依存性を持つ。
また、コストのかかる人的評価や手作りのビジョンパイプラインにも依存することが多いが、命令の制約が成功するか失敗するかについての診断的な洞察はほとんど得られない。
このギャップに対処するために,ビデオ生成における指示に従うための高度に自動化され解釈可能なフレームワークであるVGIF-Scoreを提案する。
VGIF-Scoreは2つの補完的なコンポーネントで構成されている: プロンプトを時空間指向非巡回グラフ(ST-DAG)に解析し、短周期の診断で依存性を意識したQAを実行する客観的補完ブランチと、撮影、視覚的純度、運動の滑らかさ、物理順応性を評価するために指示条件付きオートルーブリックを使用する主観的満足度ブランチである。
これらのコンポーネントは統合されたスコアを生成し、客観的な完成度と知覚的満足度の両方をキャプチャする。
約4.3Kのきめ細かい評価項目と組み合わせて、223の長い、構造的に絡み合ったプロンプトのベンチマークであるVGIF-Bench上で、このフレームワークをインスタンス化する。
プロプライエタリでオープンソースのVGMを3K以上のビデオで実験したところ、VGIF-Scoreはビデオ生成命令の信頼性、解釈可能、診断に有用な評価を提供することがわかった。
コードはhttps://github.com/PRIS-CV/VGIF-SCOREで入手できる。
関連論文リスト
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding [98.3098451637867]
Video-MME-v2は、ビデオ理解の堅牢性と忠実さを厳格に評価するために設計された総合的なベンチマークである。
データ品質を保証するため、Video-MME-v2は厳格に制御された人間のアノテーションパイプラインを通して構築される。
論文 参考訳(メタデータ) (2026-04-06T17:59:56Z) - Video-Oasis: Rethinking Evaluation of Video Understanding [20.076100437038313]
ビデオ理解は、パフォーマンス向上が視覚的知覚、言語的推論、あるいは知識事前に起因するかどうかを判断するのは難しい。
ビデオ理解のための既存の評価と蒸留時間課題を評価するための診断スイートである Video-Oasis を提供する。
分析の結果,(1)既存のベンチマークサンプルの54%は視覚的入力や時間的文脈を使わずに解決可能であること,(2)残りのサンプルでは,最先端のモデルではランダムな推測以上の性能を示すことが判明した。
論文 参考訳(メタデータ) (2026-03-31T11:37:42Z) - Q-Save: Towards Scoring and Attribution for Generated Video Evaluation [65.83319736145869]
本稿では,AIGV品質の総合評価のためのベンチマークデータセットとモデルであるQ-Saveを紹介する。
データセットには10000近いビデオが含まれており、それぞれにスカラー平均評価スコア(MOS)と微粒な属性ラベルが付与されている。
品質評価と属性に基づく説明を共同で行う統一評価モデルを提案する。
論文 参考訳(メタデータ) (2025-11-24T07:00:21Z) - VideoScore2: Think before You Score in Generative Video Evaluation [69.43069741467603]
VideoScore2は、視覚的品質、テキスト・ツー・ビデオのアライメント、物理的/常識的一貫性を明確に評価する多次元、解釈可能、そして人間によるアライメントフレームワークである。
我々のモデルは、27,168人の注釈付きビデオを含む大規模なデータセットVideoFeedback2で訓練されている。
論文 参考訳(メタデータ) (2025-09-26T18:09:03Z) - EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing [170.71134330650796]
EdiVal-Agentは、命令ベースの画像編集のためのオブジェクト指向評価フレームワークである。
標準のシングルターンだけでなく、マルチターンの命令ベースの編集を精度良く評価するように設計されている。
EdiVal-Benchは、インコンテキスト、フローマッチング、拡散パラダイムにまたがる9つの命令タイプと13の最先端編集モデルをカバーするベンチマークである。
論文 参考訳(メタデータ) (2025-09-16T17:45:39Z) - EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs [23.111439393372986]
EAS-GBenchは,エゴセントリックビデオの質問応答ベンチマークである。
本ベンチマークでは,複数の言語のみのビデオ大言語モデル(ビデオLLM)を評価した。
論文 参考訳(メタデータ) (2025-06-06T06:33:16Z) - TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos [26.97196583891564]
本稿では,高密度ダイナミックビデオの微粒化理解のための時間指向ベンチマークTUNAを紹介する。
我々のTUNAは様々なビデオシナリオとダイナミックスを備えており、解釈可能で堅牢な評価基準によって支援されている。
この評価は、アクション記述の制限、多目的理解の不十分、カメラモーションに対する感度の低下など、ビデオの時間的理解における重要な課題を明らかにする。
論文 参考訳(メタデータ) (2025-05-26T15:24:06Z) - Understanding Long Videos via LLM-Powered Entity Relation Graphs [51.13422967711056]
GraphVideoAgentは、ビデオシーケンスを通して視覚的エンティティ間の進化する関係をマップし、監視するフレームワークである。
当社の手法は,業界ベンチマークと比較した場合,顕著な効果を示す。
論文 参考訳(メタデータ) (2025-01-27T10:57:24Z) - FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning [15.363132825156477]
大規模視覚言語モデル(LVLM)の評価に適した人中心ベンチマークであるFIOVAを紹介する。
実際のビデオは3,002本(それぞれ33.6本)で、それぞれが5つのアノテーションによって独立して注釈付けされている。
本稿では,アノテータのコンセンサスから得られる認知重みを組み込んだ事象レベルの評価指標であるFIOVA-DQを提案する。
論文 参考訳(メタデータ) (2024-10-20T03:59:54Z) - Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs [20.168429351519055]
ビデオ理解はマルチモーダル大言語モデル(LMLM)にとって重要な次のステップである
合成ビデオ生成によるベンチマーク構築フレームワークであるVideoNIAH(Video Needle In A Haystack)を提案する。
我々は、プロプライエタリモデルとオープンソースモデルの両方を包括的に評価し、ビデオ理解能力の重大な違いを明らかにする。
論文 参考訳(メタデータ) (2024-06-13T17:50:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。