論文の概要: TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL
- arxiv url: http://arxiv.org/abs/2606.28016v1
- Date: Fri, 26 Jun 2026 12:19:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.482571
- Title: TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL
- Title(参考訳): TempAct:Planner-Executor RLによる自動回帰ビデオ生成における時間的可塑性の向上
- Authors: Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyun Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang,
- Abstract要約: 自己回帰(AR)ビデオ拡散モデルにより、ビデオチャンクをキャッシュされたビジュアルコンテキストでチャンクで合成することで、低レイテンシなストリーミング生成を可能にする。
1つのグローバルプロンプトは、どのサブイベントを各チャンクで実現すべきかを指定しないが、ステップワイズプロンプトにナビゲート的に切り替えると、しばしば遅延反応、ブレンドステップセマンティクス、プロンプト遷移間のエラー伝播につながる。
我々は、時間分解とステップ条件付き実行を協調的に最適化し、時間分解可能なARビデオ生成のためのプランナー-実行型強化学習フレームワークであるTempActでこれらの課題に対処する。
- 参考スコア(独自算出の注目度): 72.1388821142982
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive (AR) video diffusion models enable low-latency streaming generation by synthesizing videos chunk by chunk with cached visual context, but this chunk-wise formulation makes temporal instruction following ambiguous. A single global prompt does not specify which sub-event should be realized in each chunk, while naively switching to step-wise prompts often leads to delayed reactions, blended step semantics, and error propagation across prompt transitions. These failures are difficult to address with supervised fine-tuning or distillation alone: SFT suffers from exposure bias, while rollout-based distillation still optimizes low-level denoising or teacher-distribution matching rather than directly enforcing action ordering and prompt-transition correctness. We address these challenges with TempAct, a planner--executor reinforcement learning framework that jointly optimizes temporal decomposition and step-conditioned execution for temporally plausible AR video generation. TempAct uses an LLM planner to explore span-aware step prompts that are executable by the video model, and trains an AR diffusion executor to follow these prompts under its own generated histories. Its key mechanism is hierarchical group exploration: candidate plans form planning groups, and each plan induces an execution group of multiple continuations from a shared visual context, enabling plan-level credit assignment for long-horizon temporal outcomes and executor-level credit assignment for prompt-switch behavior. We further design hierarchical rewards that combine plan-quality and full-video temporal feedback for the planner with local transition-level step-following rewards, aesthetic regularization, and KL constraints for the executor. Experiments on Self-Forcing and LongLive show that TempAct improves temporal consistency while preserving overall visual quality.
- Abstract(参考訳): 自己回帰(AR)ビデオ拡散モデルにより、ビデオチャンクをキャッシュされた視覚的コンテキストでチャンクで合成することで、低レイテンシなストリーミング生成が可能になるが、このチャンクワイドな定式化は、時間的指示を曖昧にさせる。
1つのグローバルプロンプトは、どのサブイベントを各チャンクで実現すべきかを指定しないが、ステップワイズプロンプトにナビゲート的に切り替えると、しばしば遅延反応、ブレンドステップセマンティクス、プロンプト遷移間のエラー伝播につながる。
SFTは露光バイアスに悩まされる一方、ロールアウトベースの蒸留は、アクションオーダーや即時移行正しさを直接強制するのではなく、低レベルのデノナイジングや教師分布マッチングを最適化する。
我々は、時間分解とステップ条件付き実行を協調的に最適化し、時間分解可能なARビデオ生成のためのプランナー-実行型強化学習フレームワークであるTempActを用いて、これらの課題に対処する。
TempActはLLMプランナーを使用して、ビデオモデルで実行可能なスパン認識ステッププロンプトを探索し、AR拡散エグゼキュータをトレーニングして、これらのプロンプトを生成された履歴の下で追跡する。
その主要なメカニズムは階層的なグループ探索であり、候補プランは計画グループを形成し、各プランは共有された視覚的コンテキストから複数の継続の実行グループを誘導する。
さらに、プランナーのためのプラン品質とフルビデオの時間的フィードバックを、局所的な移行レベルのステップフォロー報酬、美容整合、実行者のKL制約と組み合わせた階層的な報酬を設計する。
Self-ForcingとLongLiveの実験は、TempActが全体的な視覚的品質を維持しながら時間的一貫性を改善していることを示している。
関連論文リスト
- HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning [51.95194664412812]
大規模言語モデル(LLM)は、幅広いタスクにまたがる自律エージェントとして強力な能力を示している。
長期LLMエージェント学習のための階層的計画と情報フォールディング(HIPIF)を提案する。
HIPIFはエージェントをエンドツーエンドにトレーニングし、明示的なサブゴールの周りに長い水平実行を組織すると同時に、完了したサブゴール履歴を折り畳み、長いコンテキスト干渉を減らす。
論文 参考訳(メタデータ) (2026-06-09T07:35:14Z) - STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models [81.32710031596591]
ビデオ推論タスクには、動きの追跡、時間順、フレーム全体の視覚状態の進化が必要である。
視覚言語モデル(LVLM)上に構築された既存の手法はしばしば、チェーン・オブ・ソート(CoT)を通じて推論を外部化することでこの問題に対処する。
STORMSは,LVLMに明示的なテキストCoTではなく,有界な連続的な潜在軌道を推論する2段階のフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T16:33:00Z) - Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning [13.499744113926505]
DRAPEは、MCITのために連続インスタンス固有のソフトプロンプトを合成するプロンプト学習フレームワークである。
DRAPEは、代表的なプロンプトベースとLoRAベースの連続学習ベースライン間の最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-11T15:59:06Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating [8.031311182554981]
長距離ロボット操作は、高レベルの計画と低レベルの制御のギャップを埋める必要がある。
現在のVision-Language-Actionモデルは、しばしばこれらのプロセスを絡めて、各ステップで冗長なマルチモーダル推論を実行する。
本稿では、テキストタスクの分解、視覚目標の想像力、連続的なアクション生成を単一のパラメータ効率のバックボーン内で統合するデュアルシステムアーキテクチャStreamVLAを提案する。
論文 参考訳(メタデータ) (2026-02-01T08:51:17Z) - Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning [55.90805559207812]
動的リモートシーンでは、双方向通信における伝送遅延は、リモート認識状態とオペレータ意図の間のギャップを生じさせる。
本稿では,時間的ダイナミクスと軽量遅延アノテーションを用いて,オープン語彙認識を充実させる表現を提案する。
提案手法はReplicaベンチマークで74%のノード精度を実現し,Concept.Graphよりも優れていた。
論文 参考訳(メタデータ) (2025-09-27T04:31:24Z) - Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos [32.71627274876863]
本稿では,授業ビデオにおけるプロシージャ計画の課題に対処し,開始と終了の視覚的観察から協調的かつタスクに沿ったアクションシーケンスを生成することを目的とする。
これまでの研究は主に、観察された状態と観察されていない行動の間のギャップを埋めるためにテキストレベルの監督に依存してきたが、行動間の複雑な時間的関係を捉えるのに苦労した。
本研究では,拡散モデル内に潜時空間時間モジュールを導入した仮設仮設時間補間拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-07-04T08:54:59Z) - Diffusion Meets Options: Hierarchical Generative Skill Composition for Temporally-Extended Tasks [12.239868705130178]
線形時間論理(LTL)によって規定された命令に基づいて計画の生成と更新を行うデータ駆動階層型フレームワークを提案する。
提案手法は,オフラインの非専門家データセットから階層的強化学習を用いて,時間的タスクを選択肢の連鎖に分解する。
バッチ生成における行列誘導後サンプリング手法を考案し,拡散生成オプションの速度と多様性を向上する。
論文 参考訳(メタデータ) (2024-10-03T11:10:37Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。