論文の概要: FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
- arxiv url: http://arxiv.org/abs/2607.24241v2
- Date: Wed, 29 Jul 2026 07:34:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.712957
- Title: FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
- Title(参考訳): FilmBench:シネマビデオ生成のためのフィルムグレードベンチマーク
- Abstract要約: フィルムベンチ (FilmBench) は、映画アカデミーの伝統のプロ向けシネマティック言語に基づくテキスト・トゥ・ビデオ (T2V) とレファレンス・トゥ・ビデオ (R2V) のベンチマークである。
プロンプトは20の映画ジャンルにまたがる受賞作品のクリップからリバースエンジニアリングされ、プロの監督が選ぶ。
評価は、3軸12成分35(T2V)+3(R2Vのみ)の3段階のシネマティック分類に従う。
- 参考スコア(独自算出の注目度): 31.49880258407637
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Progress in video generation keeps narrowing the visual gap between AI-generated and professionally produced footage, yet most benchmarks still draw prompts from web sources or LLM templates and score them with untrained, generic multimodal models. More fundamentally, their evaluation taxonomies remain rudimentary (overall visual quality, coarse text alignment and temporal smoothness) rather than the professional Cinematic Language criteria by which films are actually made and judged, so they assess basic video plausibility rather than film-grade craft. We introduce FilmBench, a text-to-video (T2V) and reference-to-video (R2V) benchmark grounded in the professional Cinematic Language of the film- academy tradition and co-developed with directors and faculty from the Beijing Film Academy and the Hujing Digital Media & Entertainment Group film studio. It rests on three choices. First, prompts are reverse-engineered from clips of award-winning films spanning 20 cinematic genres and chosen by professional directors, so every prompt is anchored to a verified live-action reference; the prompts follow real shot lists, and most script multiple shots (1,056 of the 1,169 prompts are multi-shot), unlike prior single-clip benchmarks. Second, evaluation follows a three-level Cinematic taxonomy of 3 axes, 12 components and 35 (T2V) +3 (R2V-only) sub-metrics. Third, we develop an in-house expert-grade automatic evaluation agent and open-source its core suite of Cinematic Language operators (FilmOps). Benchmarking leading video generation models (9 for T2V, 7 for R2V), the evaluator reproduces the human model ranking at model-level Spearman \r{ho} = 0.95 (T2V) and 0.96 (R2V). Scores fall well below prior web-style benchmarks, with two consistent gaps in dynamic aesthetics and a marked single- to multi-shot performance drop that widens for weaker models.
- Abstract(参考訳): ビデオ生成の進歩は、AI生成とプロが生成する映像の間の視覚的ギャップを狭め続けているが、ほとんどのベンチマークは、WebソースやLLMテンプレートからのプロンプトを引いて、トレーニングされていない汎用マルチモーダルモデルでスコア付けする。
より根本的には、映画が実際に製作され、判断されるプロのシネマティック・ランゲージの基準よりも、その評価分類は初歩的な(あらゆる視覚的品質、粗いテキストアライメント、時間的滑らかさ)ままであり、フィルムグレードの工芸品よりも基本的なビデオの妥当性を評価する。
映画アカデミーの伝統のプロ的シネマティック言語に基づくテキスト・ビデオ(T2V)とレファレンス・トゥ・ビデオ(R2V)のベンチマークであるFilmBenchを紹介する。
3つの選択肢がある。
まず、プロンプトは20の映画ジャンルにまたがる受賞作品のクリップからリバースエンジニアリングされ、プロの監督が選んだので、プロンプトは検証済みのライブアクションレファレンスに固定され、プロンプトは実際のショットリストに従っており、ほとんどのスクリプト多重ショット(1,169のプロンプトの1,056はマルチショット)は、以前のシングルクリップのベンチマークとは異なりである。
第2に、評価は3つの軸、12の成分、35の(T2V)+3の(R2Vのみ)サブメトリックの3段階のシネマティック分類に従う。
第3に、社内の専門家による自動評価エージェントを開発し、その中核となるCinematic Language operator(FilmOps)をオープンソース化する。
主要なビデオ生成モデル(T2Vは9、R2Vは7)をベンチマークし、モデルレベルのSpearman \r{ho} = 0.95(T2V)と0.96(R2V)でランク付けされた人間のモデルを再現する。
スコアは、Webスタイルのベンチマークよりもはるかに低く、ダイナミックな美学の2つの一貫したギャップと、より弱いモデルで拡大するシングル・ツー・マルチショットのパフォーマンス低下がある。
関連論文リスト
- PAI-Actor: Cinematic Multi-Character Replacement in Dynamic Scenes [51.8637101384136]
PAI-Actorは動的映画のシーンにおける文字置換のためのシネマティック・マルチキャラクタ・アニメーション・フレームワークである。
私たちのゴールは、オリジナルのシーンダイナミックス、カメラモーション、バックグラウンドコンテンツを保存しながら、実際のビデオクリップ内の複数のキャラクターを置き換え、アニメーションすることです。
実験の結果,PAI-Actorは高忠実度マルチキャラクタアニメーションを実現し,シーンの整合性,映像品質,より効率的な長文生成を実現している。
論文 参考訳(メタデータ) (2026-09-05T06:27:27Z) - Evaluating Multimodal Narrative Understanding of Popular Hollywood Films [7.103108369478014]
マルチモーダル言語モデルは、フィルムの大規模計算分析を可能にすることをますます約束している。
私たちは、ボックスオフィスの人気と、おそらくパブリックドメインのステータスという、2つの基準で定義されたハリウッド映画の新しいコレクションを構築します。
多くの視覚言語モデルがこの課題に苦しむのに対し、オーディオ視覚モデルは最大精度61.1%に達し、人間レベルの性能を大きく下回っている。
論文 参考訳(メタデータ) (2026-08-17T04:04:22Z) - CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation [107.75241387090271]
大規模かつオープンなText-to-Audio-VideoデータセットであるCineDance-1Mを紹介する。
平均92.8秒と24.2秒の連続撮影を行い、オーディオとビデオの両方のアノテーションを提供する。
包括的評価のために,多様なプロンプトスイートと6次元の人間対応計量システムを備えたCineBenchを提案する。
論文 参考訳(メタデータ) (2026-06-08T15:35:51Z) - Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation [78.24409139109507]
フィルム製造制御を4つの非交叉階層制御ノードに形式化するフレームワークであるStable Cinemetricsを紹介する。
10以上のモデルと20Kビデオにまたがる大規模な人間研究を行い、80以上の映画専門家のプールで注釈を付けました。
SCINEは、ビデオ生成モデルのランドスケープにプロの動画生成を集中させる最初のアプローチである。
論文 参考訳(メタデータ) (2025-09-30T17:22:18Z) - VideoScore2: Think before You Score in Generative Video Evaluation [69.43069741467603]
VideoScore2は、視覚的品質、テキスト・ツー・ビデオのアライメント、物理的/常識的一貫性を明確に評価する多次元、解釈可能、そして人間によるアライメントフレームワークである。
我々のモデルは、27,168人の注釈付きビデオを含む大規模なデータセットVideoFeedback2で訓練されている。
論文 参考訳(メタデータ) (2025-09-26T18:09:03Z) - ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models [87.43784424444128]
映画言語理解に特化したベンチマークであるShotBenchを紹介する。
画像とビデオクリップから3.5k以上の専門家によるQAペアを収録し、200本以上の称賛された(オスカー賞にノミネートされた)映画から細心の注意を払ってキュレートしている。
ShotBench上でのビジョン・ランゲージ・モデル24件の評価では,特に細粒度の視覚的手がかりや複雑な空間的推論に苦慮している。
論文 参考訳(メタデータ) (2025-06-26T15:09:21Z) - CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation [22.88243961225531]
CineTechBenchは、調味された撮影の専門家による正確な手動アノテーションに基づいて作られたベンチマークである。
私たちのベンチマークでは、撮影スケール、ショットアングル、コンポジション、カメラの動き、照明、色、焦点距離の7つの重要な側面をカバーしています。
生成タスクでは,映像の質の高いカメラの動きを再現するための高度な映像生成モデルの評価を行う。
論文 参考訳(メタデータ) (2025-05-21T06:02:39Z) - Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model [133.01510927611452]
我々は、30Bationalパラメータと最大204フレームの動画を生成する機能を備えた、テキストからビデオまでの事前トレーニングモデルであるStep-Video-T2Vを提案する。
Vari Autoencoder (Vari Autoencoder, Video-VAE) はビデオ生成タスク用に設計されており、16x16空間圧縮比と8x時間圧縮比を達成している。
Step-Video-T2Vのパフォーマンスは、新しいビデオ生成ベンチマークであるStep-Video-T2V-Evalで評価され、最先端のテキスト・ビデオの品質を示している。
論文 参考訳(メタデータ) (2025-02-14T15:58:10Z) - Can video generation replace cinematographers? Research on the cinematic language of generated video [31.0131670022777]
本稿では,テキスト・ツー・ビデオ(T2V)モデルにおける撮影制御を改善するための3つのアプローチを提案する。
まず,20のサブカテゴリ,ショットフレーミング,ショットアングル,カメラの動きを網羅した,微妙な注釈付き映画言語データセットを紹介する。
第二に、カメラディフ(CameraDiff)は、ロラを精度よく安定した撮影制御に利用し、フレキシブルショット生成を確実にする。
第3に,撮影アライメントの評価とマルチショット合成のガイドを目的としたCameraCLIPを提案する。
論文 参考訳(メタデータ) (2024-12-16T09:02:24Z) - VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention [76.3175166538482]
VideoGen-of-Thought(VGoT)は、単一の文から複数ショットのビデオ合成を自動化するステップバイステップのフレームワークである。
VGoTは、ナラティブな断片化、視覚的不整合、トランジションアーティファクトの3つの課題に対処する。
トレーニング不要のパイプラインで組み合わせられたVGoTは、ショット内面の一貫性が20.4%、スタイルの一貫性が17.4%向上した。
論文 参考訳(メタデータ) (2024-12-03T08:33:50Z) - MSG score: A Comprehensive Evaluation for Multi-Scene Video Generation [0.0]
本稿では,連続シナリオに基づくマルチシーンビデオの生成に必要なメトリクスについて述べる。
ビデオ生成では、単一の画像とは異なり、フレーム間の文字の動きは歪みや意図しない変化のような潜在的な問題を引き起こす。
本稿では,このプロセスを自動化するスコアベース評価ベンチマークを提案し,これらの複雑さをより客観的かつ効率的に評価する。
論文 参考訳(メタデータ) (2024-11-28T13:11:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。