論文の概要: VGI-Bench: Probing Visual Intelligence in Video Generation Models
- arxiv url: http://arxiv.org/abs/2608.19583v3
- Date: Wed, 26 Aug 2026 01:14:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.784143
- Title: VGI-Bench: Probing Visual Intelligence in Video Generation Models
- Title(参考訳): VGI-Bench:ビデオ生成モデルにおけるビジュアルインテリジェンスの調査
- Authors: Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai,
- Abstract要約: VGIベンチは、映像生成モデルの視覚的推論能力のきめ細かい評価である。
評価の結果,現在の生成システムは視覚的根拠に基づく推論タスクのサブセットを解くことができるが,信頼性は保たないことがわかった。
VGI-benchは次世代のビデオ生成モデルの開発を刺激することを期待している。
- 参考スコア(独自算出の注目度): 69.37282368476755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent studies suggest that video generation models can exhibit certain forms of zero-shot visual reasoning through generated frames. Yet reliable evaluation remains challenging: benchmarks should adopt inputs aligned with the visual priors of current video models, require valid evolving processes rather than only plausible final states, and calibrate task difficulty to remain challenging yet partly feasible. To this end, we introduce VGI-bench, containing 27 tasks and 810 instances, organized by a two-level taxonomy of task domains and skill tags for fine-grained evaluation of visual reasoning capabilities of video generation models. Our evaluations show that current generative systems can solve a subset of visually grounded reasoning tasks, but remain far from reliable, with even the strongest model, Seedance 2.0, achieving only 51.0% under our evaluation criteria. Our analysis further explore the output failure modes, input condition sensitivity, performance transfer boundary from synthetic fine-tuning, and internal denoising perspective revealing limited self-correction, where later steps mainly refine early hypotheses rather than correct reasoning errors. We hope VGI-bench will help stimulate the development of next-generation video generation models. Website: https://hexuan21.github.io/VGI-Bench/
- Abstract(参考訳): 近年の研究では、ビデオ生成モデルは、生成されたフレームを通して、ある種のゼロショットの視覚的推論を示すことが示唆されている。
ベンチマークは、現在のビデオモデルの視覚的前提に沿ったインプットを採用し、妥当な最終状態だけでなく、有効な進化プロセスを必要とし、課題のキャリブレーションを困難かつ部分的に実現可能であるように調整する必要がある。
この目的のために,ビデオ生成モデルの視覚的推論能力を詳細に評価するために,タスクドメインの2段階の分類とスキルタグによって構成された27のタスクと810のインスタンスを含むVGIベンチを導入した。
評価結果から,現在の生成系は視覚的根拠に基づく推論タスクのサブセットを解くことができるが,信頼性は高く,最強モデルであるSeedance 2.0さえも,評価基準下では51.0%しか達成できないことがわかった。
分析では、出力障害モード、入力条件感度、合成微調整による性能伝達境界、自己補正が限定された内部認知的視点について検討した。
VGI-benchは次世代のビデオ生成モデルの開発を刺激することを期待している。
ウェブサイト:https://hexuan21.github.io/VGI-Bench/
関連論文リスト
- Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods [6.921364920053057]
トレーニング不要で理論上は正当化された検出器であるSTALLを導入し、ビデオの確率に基づくスコアを提供する。
我々は,2つの公開ベンチマーク上でSTALLを評価し,最新の生成モデルを用いた新しいベンチマークであるComGenVidを紹介する。
論文 参考訳(メタデータ) (2026-03-16T09:26:56Z) - VIPER: Process-aware Evaluation for Generative Video Reasoning [64.86465792516658]
我々は、時間的、構造的、象徴的、空間的、物理的、計画的推論にまたがる16のタスクにまたがる包括的なベンチマークVIPERを紹介する。
実験の結果,現状の映像モデルでは約20%のPOC@1.0しか達成できず,良好な結果が得られた。
論文 参考訳(メタデータ) (2025-12-31T16:31:59Z) - RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence [24.51106324851909]
RULER-Benchは、認知ルールの観点から、映像生成モデルの推論能力を評価するために設計されたベンチマークである。
生成された各ビデオの評価のために、4つのメトリクスをカバーするチェックリストを構築し、GPT-o3を利用して各質問にスコアを割り当てる。
実験により、最先端のモデルはルールコヒーレンスメートル法で48.87%しか達成していないことが示されている。
論文 参考訳(メタデータ) (2025-12-02T10:29:51Z) - TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models [42.763907973320464]
TiViBench(TiViBench)は、画像対ビデオ(I2V)生成モデルの推論能力を評価するために設計された階層型ベンチマークである。
我々は、好みの最適化にインスパイアされた、シンプルで効果的なテストタイム戦略であるVideoTPOを紹介する。
TiViBenchとVideoTPOは共に、ビデオ生成モデルにおける推論の評価と進歩の道を開いた。
論文 参考訳(メタデータ) (2025-11-17T18:52:44Z) - Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing [84.16442052968615]
RISEBenchはReasoning-Informed ViSual Editing (RISE)の最初のベンチマークである。
RISEBenchは、時間、因果、空間、論理的推論の4つの主要な推論カテゴリに焦点を当てている。
オープンソースモデルとプロプライエタリモデルの両方を含む,9つの目立った視覚編集モデルを評価する実験を行った。
論文 参考訳(メタデータ) (2025-04-03T17:59:56Z) - ReVLA: Reverting Visual Domain Limitation of Robotic Foundation Models [55.07988373824348]
既存の3つのロボット基礎モデルの視覚的一般化能力について検討する。
本研究は,既存のモデルがドメイン外シナリオに対する堅牢性を示していないことを示す。
モデルマージに基づく段階的なバックボーンリバーサルアプローチを提案する。
論文 参考訳(メタデータ) (2024-09-23T17:47:59Z) - Transformation-based Adversarial Video Prediction on Large-Scale Data [19.281817081571408]
本稿では,映像から抽出したフレーム列を考慮に入れた上で,映像予測の課題に焦点をあてる。
まず, 判別器分解の系統的研究を行い, その状態を改善する。
そこで我々は,従来の隠れ状態が予測された動きにしたがって変化する新しい再帰ユニットを提案する。
論文 参考訳(メタデータ) (2020-03-09T10:52:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。