論文の概要: Self Gradient Forcing: Native Long Video Extrapolation
- arxiv url: http://arxiv.org/abs/2607.20368v1
- Date: Wed, 22 Jul 2026 16:59:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.160314
- Title: Self Gradient Forcing: Native Long Video Extrapolation
- Title(参考訳): セルフグラディエント・フォース:ネイティブのロングビデオ外挿
- Authors: Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan,
- Abstract要約: 自己グラディエント強制は、歴史的文脈-段階的ギャップを回復する。
コードとモデルがリリースされ、自動回帰ビデオ生成の研究が進められる。
- 参考スコア(独自算出の注目度): 60.00513917489133
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent autoregressive video diffusion methods are increasingly built upon Self Forcing, where the student is trained on histories produced by its own rollout rather than ground-truth video contexts. This reduces exposure bias, but the historical key-value cache is still used by future frames only as frozen rollout state. As a result, future losses cannot supervise how earlier generated latents should be written into more useful keys and values for later video-latent generation. We call this the historical context-gradient gap. We propose Self Gradient Forcing (SGF), a two-pass training strategy that restores this missing supervision signal without backpropagating through the full serial rollout. Pass 1 performs a no-gradient autoregressive rollout matching inference and, at a sampled denoising exit step, records both the self-generated context and the noisy latents fed to the model. Pass 2 performs parallel context-gradient reconstruction for the recorded exit step. The generated context is used as stop-gradient clean-latent input, while the model recomputes the context KV representations and future-to-context causal attention. Thus, SGF provides the missing memory-writing supervision within the native autoregressive training objective, using losses on future video latents to train the model to encode context into more effective causal memory. Across extensive long-horizon frame-wise and chunk-wise experiments under different initializations, SGF achieves stronger native long-video extrapolation than Self Forcing, especially in subject identity, background/layout consistency, and temporal stability. Remarkably, using only a 5-second training window, SGF can extrapolate to videos lasting several minutes. Code and models will be released to advance research on autoregressive video generation.
- Abstract(参考訳): 最近の自己回帰的ビデオ拡散法は、学生が地味なビデオコンテキストではなく、自身のロールアウトによって生成された履歴に基づいて訓練されるセルフフォース(Self Forcing)上に構築されている。
これにより露光バイアスが軽減されるが、過去のキーバリューキャッシュは、今後もフリーズされたロールアウト状態としてのみ使用される。
結果として、将来的な損失は、後続のビデオレイテンシ生成において、より有用なキーと値に、より早く生成された潜伏語が書き込まれるかどうかを監視できない。
これを歴史的文脈の緩やかなギャップと呼ぶ。
完全シリアルロールアウトをバックプロパゲートすることなく、この欠落した監視信号を復元する2パストレーニング戦略であるSelf Gradient Forcing (SGF)を提案する。
パス1は、非段階的な自己回帰的ロールアウトマッチングを行い、サンプルデノナイジング出口ステップでは、モデルに供給された自己生成コンテキストとノイズラジェントの両方を記録する。
パス2は、記録された出口ステップの並列コンテキスト段階の再構築を行う。
生成したコンテキストは停止段階のクリーンレイテンシ入力として使用され、一方モデルではコンテキストKV表現とFuture-to-context因果注意を再計算する。
これにより、SGFは、将来のビデオ潜伏者による損失を利用して、コンテキストをより効果的な因果記憶にエンコードするようにモデルを訓練する、ネイティブな自己回帰学習目標におけるメモリ書き込みの監督を欠いている。
異なる初期化下での広範囲な長水平フレームおよびチャンクワイド実験において、SGFは、特に主観的アイデンティティ、背景/レイアウトの整合性、時間的安定性において、セルフフォースよりも強力なネイティブな長ビデオ外挿を実現する。
興味深いことに、SGFは5秒のトレーニングウィンドウだけで、数分間のビデオに外挿できる。
コードとモデルがリリースされ、自動回帰ビデオ生成の研究が進められる。
関連論文リスト
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators [68.69611976783243]
OPSD-Vは、数ステップの自己回帰(AR)ビデオ拡散モデルの訓練後の自己蒸留パラダイムである。
鍵となるアイデアは、トレーニング中の時間的文脈として実際の長時間ビデオデータを導入し、それを高密度な軌跡レベルの監視に使用することである。
実験では、視覚的品質、運動力学、VBenchLongスコアが一貫した改善を示している。
論文 参考訳(メタデータ) (2026-07-09T17:59:11Z) - RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO [53.38929612273108]
因果自己回帰ビデオ拡散モデルは、以前生成されたコンテンツから将来のチャンクを外挿することでリアルタイムストリーミング生成をサポートする。
本稿では,リアルタイム自動回帰ビデオ補間ネットワーク(RAVEN)を紹介した。これは,各自己ロールアウトを,クリーンな歴史的エンドポイントのインターリーブシーケンスに再パッケージするトレーニングタイムテストフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T17:59:30Z) - End-to-End Training for Autoregressive Video Diffusion via Self-Resampling [63.84672807009907]
自己回帰ビデオ拡散モデルは、世界シミュレーションの可能性を保っているが、列車テストミスマッチに起因する露出バイアスに弱い。
教師なしのフレームワークであるResampling Forcingを導入し、スクラッチから大規模まで自動回帰ビデオモデルのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-17T18:53:29Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。