TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL
Abstractの概要
TempActは、ストリーミング合成向けの自己回帰型動画生成の弱点に対処する。単一のグローバルプロンプトでは生成される各チャンクでどのサブイベントが発生すべきかを指定できない一方、単純なステップごとのプロンプト付けでは、遅延反応、意味の混在、プロンプト遷移時のエラー伝播を引き起こす可能性がある。この手法は、LLMプランナーがグローバルな指示をスパンを考慮したステッププロンプトに分解し、自己回帰型動画拡散エクスキューターがこれらのステップと事前の視覚コンテキストを条件としてチャンクを生成する、プランナー・エクスキューター強化学習フレームワークを導入している。これら2つのコンポーネントは、階層的グループ探索と、時間的追従性、計画品質、局所的なステップ追従性、美的シグナルなどの、プランナーレベルおよびエクスキューターレベルの個別の報酬を用いて共同で訓練される。時間的に構造化されたプロンプトに関する実験では、一般的な視覚的品質だけでなく、生成された動画がイベントの順序と状態遷移を維持しているかどうかが評価される。
新規性
本論文の主な新規性は、時間的に妥当な自己回帰型動画生成を、単なるエクスキューターの調整問題としてではなく、共同の計画および実行問題として捉えたことにある。LLMプランナー、拡散ベースのエクスキューター、階層的なプランナー/エクスキューター強化学習、および遷移を考慮したプロンプト平滑化を組み合わせることで、時間的分解とプロンプト切り替えの実行が同時に最適化される。
成果
Temporal Orderベンチマークにおいて、TempActはVBenchとPickScoreを概ね維持しつつ、Self-ForcingおよびLongLiveの両バックボーンでステッププロンプトのベースラインよりもTemporal-Following Scoreを向上させた。評価スコアの平均は、Self-Forcingでは0.400から0.462へ、LongLiveでは0.432から0.488へと上昇し、Qwen3-VLおよびGeminiのどちらの審査モデルでも改善が見られた。ユーザー評価においても、TempActは対応するベースラインよりも好まれる頻度が高いと報告されており、評価モデルと人間の意見の合致率はQwen3-VLで76%、Gemini-3-Flashで81%であると報告されている。
論文の注目点
- TempActは、LLMプランナーを使用してグローバルプロンプトからスパンを考慮したステップへの分解をサンプリングし、自己回帰型拡散エクスキューターを用いて生成済みの視覚的履歴に基づいてそれらを実現する。
- 本手法の学習には独立した信用割り当てを伴う階層的強化学習が用いられ、計画レベルの報酬が実行可能な時間的分解を導く一方で、局所的な遷移レベルの報酬がプロンプト切り替えの実行を改善し、エラーの伝播を減少させる。
- この手法は、全体的な視覚的品質の指標を実質的に低下させることなく、2つの自己回帰型動画バックボーンにわたって時間的な指示追従性を向上させ、その改善はVLMベースの評価と人間の好みの両方によって裏付けられている。