論文の概要: VI-Bench: Benchmarking Prompt Inversion from AIGC Videos
- arxiv url: http://arxiv.org/abs/2609.08079v1
- Date: Tue, 08 Sep 2026 00:44:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:41:14.24416
- Title: VI-Bench: Benchmarking Prompt Inversion from AIGC Videos
- Title(参考訳): VI-Bench: AIGCビデオからのプロンプトインバージョンをベンチマーク
- Authors: Wulin Xie, Rui Zhao, Kecen Li, Xiujin Liu, Bokang Zhang, Zheng Liu, Xinwen Hou, Chen Gong,
- Abstract要約: 我々は1610万人の実ユーザプロンプトと900人の人間認証AIGCビデオから構築されたベンチマークVI-Benchを紹介する。
Vi-Bench上の2つのプロプライエタリモデルと16のオープンソースモデルを含む18の代表的なVLMを、再生されたビデオのプロンプトとビデオレベルの忠実度とを即時的に一致させるインバージョンスコアを用いて評価する。
- 参考スコア(独自算出の注目度): 19.5343015012776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video generation have made prompt-based control increasingly central to AIGC video generation. Prompts specify what a video should depict and how it should be represented, controlling factors such as visual style or camera behavior. Understanding this recoverability is important both for creative reuse and editing, and for assessing prompt leakage risks. However, existing video understanding benchmarks do not measure this capability: a caption may describe what is visible, but a replayable prompt must recover the generation-relevant controls needed to reproduce the video. To address this gap, we introduce VI-Bench, a benchmark built from 16.1 million real-user prompts and 900 human-verified AIGC videos. VI-Bench spans three progressively harder settings, namely single-shot semantic grounding, control over style and camera behavior, and multi-shot compositional inversion, and evaluates five generation-critical dimensions: subject, action, scene, style, and camera. We evaluate 18 representative VLMs, including 2 proprietary and 16 open-source models on VI-Bench, using an Inversion Score that measures prompt-level alignment with the original prompt and video-level fidelity of the regenerated video. The results reveal substantial limitations: even the strongest model achieves only 0.632 on Inversion Score, performance degrades sharply as samples require richer control and multi-shot reasoning, and models often produce plausible prompts whose regenerated videos deviate from the reference. These findings show that video prompt inversion is a distinct and under-evaluated capability requiring models to transform visual understanding into replay-stable generative control.
- Abstract(参考訳): 近年のビデオ生成の進歩により、AIGCビデオ生成において、プロンプトベースの制御がますます中心になっている。
プロンプトは、ビデオが何を描写すべきか、どのように表現すべきかを定義し、視覚的スタイルやカメラの振る舞いなどの要因を制御する。
この回復可能性を理解することは、創造的再利用と編集の両方に重要であり、迅速な漏洩リスクの評価にも重要である。
しかし、既存のビデオ理解ベンチマークでは、この能力を計測していない:キャプションは、何が見えるかを記述するが、再生可能なプロンプトは、ビデオの再生に必要な生成関連コントロールを回復しなければならない。
このギャップに対処するため、我々は1610万人の実ユーザプロンプトと900人の人間認証AIGCビデオから構築されたベンチマークであるVI-Benchを紹介した。
VI-Benchは、シングルショットのセマンティックグラウンド、スタイルとカメラの振る舞いの制御、マルチショットのコンポジションインバージョンという3つのより難しい設定にまたがっており、主観、アクション、シーン、スタイル、カメラの5つの世代クリティカルディメンションを評価している。
Vi-Bench上の2つのプロプライエタリモデルと16のオープンソースモデルを含む18の代表的なVLMを、再生されたビデオのプロンプトとビデオレベルの忠実度とを即時的に一致させるインバージョンスコアを用いて評価する。
最強モデルでさえ、インバージョンスコアで0.632しか達成できず、サンプルがよりリッチな制御とマルチショット推論を必要とするため、性能は急激に低下し、再生されたビデオが参照から逸脱する可視的なプロンプトがしばしば生成される。
これらの結果から,映像のプロンプト・インバージョンは,視覚的理解をリプレイ・安定な生成制御に変換するためのモデルを必要とする,明瞭で低評価能力であることが示唆された。
関連論文リスト
- ReConFuse: Reconstruction-Error Guided Semantic Fusion for AI-Generated Video Detection [10.547980601243518]
ビデオレベルのAI生成ビデオ検出のための再構成誘導型セマンティックフュージョンフレームワークReConFuseを提案する。
ReConFuseは、WF-VAE再構成ビデオから再構成エラーキューを抽出し、それらを多フレームセマンティック特徴と整列させ、Mambaベースのモジュールを使用してビデオレベルの分類のための時間的進化をモデル化する。
論文 参考訳(メタデータ) (2026-06-03T10:35:47Z) - Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding [98.3098451637867]
Video-MME-v2は、ビデオ理解の堅牢性と忠実さを厳格に評価するために設計された総合的なベンチマークである。
データ品質を保証するため、Video-MME-v2は厳格に制御された人間のアノテーションパイプラインを通して構築される。
論文 参考訳(メタデータ) (2026-04-06T17:59:56Z) - VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics [83.61875204972465]
ビデオ接続(Video Connecting)は,ビデオクリップの開始と終了の間にスムーズな中間映像コンテンツを生成するタスクである。
このギャップを埋めるため、私たちはビデオ接続に特化した新しいベンチマークであるVC-Benchを提案しました。
VC-Benchは、ビデオ品質スコアVQS、スタート-エンド一貫性スコアSECS、トランジッションスムースネススコアSSの3つの中核的な側面に焦点を当てている。
論文 参考訳(メタデータ) (2026-01-27T06:15:12Z) - Plenoptic Video Generation [80.3116444692858]
PlenopticDreamerは、同期時間記憶を維持するために生成幻覚を同期するフレームワークである。
中心となる考え方は、マルチインアウトのビデオ条件付きモデルを自己回帰的にトレーニングすることだ。
トレーニングでは,コンバージェンス向上のためのコンテキストスケーリング,エラー蓄積による幻覚への自己条件付け,拡張ビデオ生成をサポートする長時間ビデオコンディショニング機構が組み込まれている。
論文 参考訳(メタデータ) (2026-01-08T18:58:32Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - Controllable Video Generation: A Survey [72.38313362192784]
本稿では、制御可能なビデオ生成の体系的レビューを行い、理論的基礎と最近の現場の進歩の両方について述べる。
まず、主要な概念を導入し、一般的に使われているオープンソースビデオ生成モデルを紹介します。
次に、映像拡散モデルにおける制御機構に着目し、生成を誘導する認知過程に異なる種類の条件を組み込む方法について分析する。
論文 参考訳(メタデータ) (2025-07-22T06:05:34Z) - CustomVideoX: 3D Reference Attention Driven Dynamic Adaptation for Zero-Shot Customized Video Diffusion Transformers [15.558659099600822]
CustomVideoXは、LoRAパラメータをトレーニングして参照機能を抽出することで、事前トレーニングされたビデオネットワークを活用する。
本稿では,参照画像特徴の直接的かつ同時エンゲージメントを可能にする3D参照注意を提案する。
実験の結果, CustomVideoXはビデオの一貫性や品質という点で既存手法よりも優れていた。
論文 参考訳(メタデータ) (2025-02-10T14:50:32Z) - TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation [97.96178992465511]
生成したビデオは、新しい概念の出現と、時間経過とともに現実の動画のようにそれらの関係の遷移を取り入れるべきである、と我々は主張する。
ビデオ生成モデルの時間構成性を評価するため,細部まで作り上げたテキストプロンプトのベンチマークであるTC-Benchと,それに対応する地上の真理ビデオ,ロバストな評価指標を提案する。
論文 参考訳(メタデータ) (2024-06-12T21:41:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。