論文の概要: WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- arxiv url: http://arxiv.org/abs/2609.30221v1
- Date: Thu, 24 Sep 2026 17:48:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.18731
- Title: WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
- Title(参考訳): WanPE: 最新のテキスト・ビデオ生成のためのシネマティックプロンプト向上を目指して
- Abstract要約: We present WanPE, a 397B- Parameter prompt enhancement model training on 1.05M real-world video to master director-level cinematic planning。
WanPEはビデオ・グラウンド・リバース・コンストラクションを通じて撮影レベルの撮影計画を定式化し、セマンティック・コンシスタンスGRPOを採用している。
Wan3.0のビデオジェネレータを使用すると、WanPE-397Bは生のユーザープロンプトよりも10.66-18.84ポイントを5-15秒、劇的な50.86ポイントを30秒のアリーナで増やす。
- 参考スコア(独自算出の注目度): 48.2464369182342
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video generation begins in text space by authoring a cinematic screenplay, then materializes into pixels. As contemporary video generators scale to 30 seconds and faithfully follow complex conditions, the textual prompt largely directs the production, planning how actions, camera trajectories, lighting, and sound unfold across multi-shot sequences. In this paper, we present WanPE, a 397B-parameter prompt enhancement model trained on 1.05M real-world videos to master director-level cinematic planning. WanPE formulates shot-level cinematic plans via video-grounded reverse construction and employs Semantic-Consistency GRPO (SC-GRPO) to faithfully preserve user requirements across shots and over time. To benchmark this capability, we curate WanPEval, a human-annotated testbed covering durations from 5 to 30 seconds across varying intent granularities, supported by approximately 11K blind pairwise assessments. When powering Wan3.0's video generator, WanPE-397B boosts human preference over raw user prompts by 10.66-18.84 points at 5-15 seconds and by a dramatic 50.86 points in the 30-second arena. Ablation studies show that reverse construction demonstrates clear superiority over forward rewriting, while SC-GRPO robustly preserves semantic fidelity across model scales. Ultimately, WanPE leads all evaluated commercial offerings at 5-15 seconds and remains competitive with Seedance 2.5 at 30 seconds.
- Abstract(参考訳): ビデオ生成は、映画の脚本を執筆することでテキスト空間で始まり、ピクセルに実体化される。
現代のビデオジェネレータは30秒に拡大し、複雑な条件を忠実に追従するので、テキストプロンプトは、アクション、カメラの軌跡、照明、そしてマルチショットシーケンスに広がる音などを計画する。
本稿では,397Bパラメトリック・プロンプト・エンハンスメント・モデルであるWanPEについて述べる。
WanPEは、ビデオ・グラウンドのリバース・コンストラクションを通じてショットレベルの撮影計画を定式化し、セマンティック・コンシスタンスGRPO(SC-GRPO)を使用して、ショットや時間の経過とともにユーザーの要求を忠実に保存する。
この能力をベンチマークするために、人間による注釈付きテストベッドであるWanPEvalを、意図の粒度によって5秒から30秒の期間にわたってキュレートする。
Wan3.0のビデオジェネレータを使用すると、WanPE-397Bは生のユーザープロンプトよりも10.66-18.84ポイントを5-15秒、劇的な50.86ポイントを30秒のアリーナで増やす。
アブレーション研究により、逆構造は前方書き直しよりも明確な優位性を示し、一方SC-GRPOはモデルスケール全体にわたって意味的忠実性を保持することが示されている。
最終的に、WanPEは評価されたすべての商用製品を5~15秒でリードし、Seedance 2.5と30秒で競合し続ける。
関連論文リスト
- FilmBench: A Film-Grade Benchmark for Cinematic Video Generation [31.49880258407637]
フィルムベンチ (FilmBench) は、映画アカデミーの伝統のプロ向けシネマティック言語に基づくテキスト・トゥ・ビデオ (T2V) とレファレンス・トゥ・ビデオ (R2V) のベンチマークである。
プロンプトは20の映画ジャンルにまたがる受賞作品のクリップからリバースエンジニアリングされ、プロの監督が選ぶ。
評価は、3軸12成分35(T2V)+3(R2Vのみ)の3段階のシネマティック分類に従う。
論文 参考訳(メタデータ) (2026-07-27T10:20:31Z) - Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration [61.98029663481308]
Soap2SoapはDualBridgeメカニズムを通じて長期の視覚的一貫性を強制するマルチエージェントフレームワークである。
クローズドループ検証エージェントは、識別、安定性、アライメントを監査し、選択的再生を誘導する。
論文 参考訳(メタデータ) (2026-05-17T12:38:21Z) - MultiShotMaster: A Controllable Multi-Shot Video Generation Framework [67.38203939500157]
現在の生成技術はシングルショットクリップで優れているが、物語的なマルチショットビデオを作成するのに苦労している。
高度に制御可能なマルチショットビデオ生成のためのフレームワークであるMultiShotMasterを提案する。
論文 参考訳(メタデータ) (2025-12-02T18:59:48Z) - VISTA: A Test-Time Self-Improving Video Generation Agent [45.53495043750626]
VISTA (Video Iterative Self-IprovemenT Agent) は、反復ループでプロンプトを精製することで、ビデオ生成を自律的に改善する新しいシステムである。
ビデオの品質とユーザの意図との整合性を継続的に改善し、最先端のベースラインに対して最大60%の対等な勝利率を達成する。
人間の評価は一致し、VISTAの出力は66.4%である。
論文 参考訳(メタデータ) (2025-10-17T17:12:08Z) - ViPE: Video Pose Engine for 3D Geometric Perception [89.29576047606703]
ViPEは、便利で多用途なビデオ処理エンジンである。
それは、制約のない生のビデオから、カメラの内在、カメラの動き、および密集した近距離マップを効率的に推定する。
ViPEを使って大規模なビデオのアノテートを行います。
論文 参考訳(メタデータ) (2025-08-12T18:39:13Z) - xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations [120.52120919834988]
xGen-SynVideo-1(xGen-SynVideo-1)は、テキスト記述からリアルなシーンを生成することができるテキスト・ツー・ビデオ(T2V)生成モデルである。
VidVAEはビデオデータを空間的にも時間的にも圧縮し、視覚トークンの長さを大幅に削減する。
DiTモデルは、空間的および時間的自己アテンション層を取り入れ、異なる時間枠とアスペクト比をまたいだ堅牢な一般化を可能にする。
論文 参考訳(メタデータ) (2024-08-22T17:55:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。