論文の概要: Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency
- arxiv url: http://arxiv.org/abs/2607.11836v1
- Date: Mon, 13 Jul 2026 17:27:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.56754
- Title: Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency
- Title(参考訳): サイクルワールド:逆予測サイクル一貫性による長期ビデオワールドモデルにおける誤り蓄積の軽減
- Authors: Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao,
- Abstract要約: Cycle-Worldは、安定的で時間的に一貫した長ビデオ生成のために設計されたフレームワークである。
提案手法は,トレーニング段階と推論段階の両方に厳密な時間的可逆性を付与することにより,誤差の漂流に対処する。
VBenchベンチマークの実験では、Cycle-Worldの2相相相のシナジーがエラードリフトを著しく緩和することを示した。
- 参考スコア(独自算出の注目度): 123.12549538776109
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive diffusion models have enabled high-quality video generation, yet their sequential nature inherently suffers from error accumulation. In long-horizon video synthesis, minor prediction deviations compound over time, inevitably leading to unconstrained generative drift, structural collapse, and severe visual degradation. To address this, we propose Cycle-World, a novel framework designed for stable and temporally consistent long-video generation. Our approach tackles error drift by enforcing strict temporal reversibility across both the training and inference phases. Theoretically, we demonstrate that forward generative drift can be strictly bottlenecked by a cycle-consistency objective. During training, we integrate an efficient reverse-prediction model to implicitly embed causal constraints into the forward generator, compelling it to produce reversible sequences that tightly adhere to the natural video manifold. At inference time, we repurpose this frozen reverse model as a runtime corrector. Through gradient-based cycle guidance, it iteratively refines the generated latent representations, actively suppressing accumulated errors before they are committed to the historical context. Extensive experiments on the VBench benchmark demonstrate that Cycle-World's dual-phase synergy significantly mitigates error drift, achieving state-of-the-art overall generation quality and long-horizon temporal consistency in 60-second synthesis.
- Abstract(参考訳): 自己回帰拡散モデルにより高品質なビデオ生成が可能になったが、そのシーケンシャルな性質は本質的にエラーの蓄積に悩まされている。
ロングホライゾンビデオ合成において、小さな予測偏差は時間の経過とともに複合され、必然的に、制約のない生成的ドリフト、構造的崩壊、重度の視覚的劣化を引き起こす。
そこで本研究では,安定かつ時間的に一貫した長ビデオ生成を目的とした新しいフレームワークであるCycle-Worldを提案する。
提案手法は,トレーニング段階と推論段階の両方に厳密な時間的可逆性を付与することにより,誤差の漂流に対処する。
理論的には、前向きな生成的ドリフトはサイクル整合性の対象によって厳密にボトルネック化できることを示す。
トレーニング中、私たちは効率的な逆予測モデルを統合することで、フォワードジェネレータに因果制約を暗黙的に埋め込み、自然なビデオ多様体に密着した可逆的なシーケンスを生成する。
推論時には、この凍結した逆モデルを実行時修正器として再利用する。
勾配に基づくサイクルガイダンスを通じて、生成された潜在表現を反復的に洗練し、過去の文脈にコミットする前に蓄積したエラーを積極的に抑制する。
VBenchベンチマークの広範囲な実験により、Cycle-Worldの2相相相のシナジーはエラードリフトを著しく軽減し、60秒の合成において、最先端の全体的な生成品質と長時間の時間的一貫性を達成することが示されている。
関連論文リスト
- Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation [25.677744104220853]
ビデオフレームは、特定の動作セマンティクスに固執しながら、所定のエンドポイント間で現実的な中間フレームを合成することを目的としている。
本稿では,前向きと後向きの軌跡の対称性を強制する新しい双方向フレームワークを提案する。
本手法は,37フレームと73フレームの両方のタスクにおいて,画像品質,運動の滑らかさ,動的制御における最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-02T06:58:46Z) - Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation [43.89162138967428]
本稿では,ビデオ拡散モデルに適した新しい蒸留フレームワークを提案する。
その中核となる革新は,(1)空間監督重量を動的に調整し,過度な分布シフトに起因するアーティファクトを防止する適応回帰損失,(2)スムーズで物理的に妥当なサンプリング軌道を促進する時間正規化損失,(3)知覚的品質を維持しながらサンプリングオーバーヘッドを低減する推論時間枠戦略である。
VBench と VBench2 ベンチマークの実験およびアブレーション実験により,本手法は安定した数段階のビデオ合成を実現し,知覚的忠実度と運動リアリズムを著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-03-23T11:54:33Z) - HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising [52.237486207964245]
HiARは階層的なデノベーションフレームワークで、従来の世代順を逆転させる。
発声ステップ毎に全てのブロックを因果生成し、各ブロックが常に同じノイズレベルでコンテキストで条件付けされるようにする。
VBench(20世代)では、HiARは比較したすべての方法の中で最高の総合スコアと最低時間ドリフトを達成する。
論文 参考訳(メタデータ) (2026-03-09T17:58:16Z) - TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation [45.36298679288268]
自動回帰ビデオ生成は、以前生成されたコンテンツに対して、新しいフレームのバッチを反復的に条件付けすることで、長いビデオ合成を可能にする。
近年の研究では、こうしたパイプラインは、長い地平線上でエラーが蓄積され増幅される厳しい時間的ドリフトに悩まされていることが示されている。
条件付けに再利用される前に、不安定な潜伏トークンを識別・削除することで、時間的ドリフトを緩和する簡易な推論時間法を提案する。
論文 参考訳(メタデータ) (2026-01-30T19:44:16Z) - LoL: Longer than Longer, Scaling Video Generation to Hour [50.945885467651216]
この研究は、品質劣化の少ないリアルタイム、ストリーミング、無限長のビデオ生成の最初のデモンストレーションを実現する。
実例として、最大12時間までの連続ビデオを生成し、私たちの知る限り、ストリーミングビデオ生成において最も長く実証された結果の1つである。
論文 参考訳(メタデータ) (2026-01-23T17:21:35Z) - End-to-End Training for Autoregressive Video Diffusion via Self-Resampling [63.84672807009907]
自己回帰ビデオ拡散モデルは、世界シミュレーションの可能性を保っているが、列車テストミスマッチに起因する露出バイアスに弱い。
教師なしのフレームワークであるResampling Forcingを導入し、スクラッチから大規模まで自動回帰ビデオモデルのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-17T18:53:29Z) - BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models [50.986189632485285]
モデル自身のロールアウトから補正軌道を構築する自己教師型スキームであるバックワードアグリゲーション(BAgger)を導入する。
数段階の蒸留と分配整合損失に依存する従来のアプローチとは異なり、BAggerは標準的なスコアやフローマッチングの目的を持つ列車である。
因果拡散変換器でBAggerをインスタンス化し、テキスト・ツー・ビデオ、ビデオ・エクステンション、マルチプロンプト・ジェネレーションで評価する。
論文 参考訳(メタデータ) (2025-12-12T23:02:02Z) - AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion [19.98565541640125]
自動回帰拡散(AR-Diffusion, Auto-Regressive Diffusion)は, フレキシブルビデオ生成のための自己回帰拡散モデルと拡散モデルの強みを組み合わせた新しいモデルである。
自己回帰生成に触発されて、個々のフレームの腐敗タイムステップに非減少制約を組み込む。
このセットアップは、時間的因果的注意とともに、時間的コヒーレンスを保ちながら、長さの異なる柔軟なビデオの生成を可能にする。
論文 参考訳(メタデータ) (2025-03-10T15:05:59Z) - Intrinsic Temporal Regularization for High-resolution Human Video
Synthesis [59.54483950973432]
時間整合性は、画像処理パイプラインをビデオドメインに拡張する上で重要である。
フレームジェネレーターを介して本質的信頼度マップを推定し,運動推定を調節する,本質的な時間正規化方式を提案する。
我々は、本質的な時間的規制をシングルイメージジェネレータに適用し、強力な「Internet」が512Times512$の人間のアクションビデオを生成します。
論文 参考訳(メタデータ) (2020-12-11T05:29:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。