論文の概要: Mitigating Compounding Error via Video Representation Regularization
- arxiv url: http://arxiv.org/abs/2607.27036v1
- Date: Wed, 29 Jul 2026 15:29:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.726783
- Title: Mitigating Compounding Error via Video Representation Regularization
- Title(参考訳): 映像表現規則化による合成誤差の緩和
- Authors: Taiye Chen, Qi Zhang, Yisen Wang,
- Abstract要約: ビデオ拡散に基づく世界モデルは、ロボット工学、自律運転、シミュレーションタスクのための長い自己回帰ビデオ生成を可能にする。
スライディングウインドウの自己回帰推論は、時間とともにフレーム品質を低下させる深刻なエラー蓄積に悩まされる。
ビデオワールドモデルの内部表現力学について検討し,合成誤差が隠れ表現の次元的崩壊と密結合していることを明らかにする。
本稿では,遅延表現を安定化し,反復的誤り蓄積を抑制する軽量な訓練制約である映像表現正規化を提案する。
- 参考スコア(独自算出の注目度): 32.14962855907007
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video diffusion-based world models enable long autoregressive video generation for robotics, autonomous driving and simulation tasks, yet sliding-window autoregressive inference suffers from severe error accumulation that degrades frame quality over time. Although this phenomenon has been widely observed, the underlying mechanism of compounding error and how to achieve stable long-horizon generation remain largely unresolved. In this paper, we investigate the internal representation dynamics of video world models and discover that compounding error is tightly coupled with dimensional collapse of hidden representations. Specifically, the effective rank of model representations sharply decreases at the onset of generation drift, revealing a strong connection between representational degradation and long-term rollout instability. Furthermore, we find that pure training data scaling fails to boost model resistance to error drift, contradicting mainstream scaling paradigms. To address this problem, we propose video representation regularization, a lightweight training constraint that stabilizes latent representations and suppresses iterative error accumulation. Compared with Diffusion Forcing, our method achieves improvements from 38.65 to 55.56 and from 44.37 to 72.08 on the Aesthetic Quality and Imaging Quality metrics of VBench. Our work establishes the first connection between autoregressive video drifting and model internal representations, adopts erank as a quantitative metric for error accumulation, reveals counterintuitive scaling limitations for video world models, and presents a simple yet effective regularization strategy to improve long video generation robustness.
- Abstract(参考訳): ビデオ拡散ベースの世界モデルは、ロボット工学、自律運転、シミュレーションタスクのための長い自己回帰ビデオ生成を可能にするが、スライドウインドウの自己回帰推論は、時間とともにフレーム品質を低下させる深刻なエラー蓄積に悩まされる。
この現象は広く観測されているが、混合誤差のメカニズムと安定な長距離発生の方法はほとんど未解決のままである。
本稿では,ビデオワールドモデルの内部表現力学を考察し,合成誤差が隠れ表現の次元的崩壊と密結合していることを明らかにする。
具体的には、モデル表現の有効ランクは、生成ドリフトの開始時に急激に低下し、表現的劣化と長期のロールアウト不安定性の強い関係が明らかになる。
さらに、純粋なトレーニングデータスケーリングは、主流のスケーリングパラダイムと矛盾する、エラードリフトに対するモデル耐性を高めることに失敗する。
この問題に対処するために,遅延表現を安定化し,反復的エラー蓄積を抑制する軽量な訓練制約であるビデオ表現正規化を提案する。
拡散強制法と比較すると,VBenchの美的品質および画像品質指標において,38.65から55.56,44.37から72.08の改善が達成されている。
我々の研究は、自己回帰的ビデオドリフトとモデル内部表現との間の最初の接続を確立し、エラー蓄積の定量的指標としてerankを採用し、ビデオワールドモデルに対する直観的スケーリングの制限を明らかにし、ビデオ生成の堅牢性を改善するためのシンプルで効果的な正規化戦略を示す。
関連論文リスト
- Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency [123.12549538776109]
Cycle-Worldは、安定的で時間的に一貫した長ビデオ生成のために設計されたフレームワークである。
提案手法は,トレーニング段階と推論段階の両方に厳密な時間的可逆性を付与することにより,誤差の漂流に対処する。
VBenchベンチマークの実験では、Cycle-Worldの2相相相のシナジーがエラードリフトを著しく緩和することを示した。
論文 参考訳(メタデータ) (2026-07-13T17:27:13Z) - Towards Error-Free Long Video Generation [56.86952045212838]
本稿では,高品質でダイナミックでアイデンティティに一貫性のある単一ショット長ビデオを生成する,無限長のビデオ生成フレームワークを提案する。
まず,大規模なショートビデオデータに基づいて拡散モデルをビデオ拡張モデルとして微調整し,時間的コヒーレントなクリップを自動的に生成する。
我々のフレームワークは、リアルでコヒーレントな微小レベルのビデオ合成のための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2026-06-21T07:39:37Z) - Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity [57.83511884904928]
本研究では,実証分析による自己回帰映像生成モデルの訓練を高速化する手法を検討する。
その結果,少ないビデオフレームでのトレーニングではトレーニング時間が大幅に短縮される一方で,エラーの蓄積が悪化し,生成したビデオに矛盾が生じることが判明した。
リプシッツ連続性に触発されて、生成されたビデオの一貫性を改善するためにRepresentation Continuity(ReCo)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-08T09:43:03Z) - Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation [43.89162138967428]
本稿では,ビデオ拡散モデルに適した新しい蒸留フレームワークを提案する。
その中核となる革新は,(1)空間監督重量を動的に調整し,過度な分布シフトに起因するアーティファクトを防止する適応回帰損失,(2)スムーズで物理的に妥当なサンプリング軌道を促進する時間正規化損失,(3)知覚的品質を維持しながらサンプリングオーバーヘッドを低減する推論時間枠戦略である。
VBench と VBench2 ベンチマークの実験およびアブレーション実験により,本手法は安定した数段階のビデオ合成を実現し,知覚的忠実度と運動リアリズムを著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-03-23T11:54:33Z) - LoL: Longer than Longer, Scaling Video Generation to Hour [50.945885467651216]
この研究は、品質劣化の少ないリアルタイム、ストリーミング、無限長のビデオ生成の最初のデモンストレーションを実現する。
実例として、最大12時間までの連続ビデオを生成し、私たちの知る限り、ストリーミングビデオ生成において最も長く実証された結果の1つである。
論文 参考訳(メタデータ) (2026-01-23T17:21:35Z) - VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction [31.191310873846177]
VideoARは、ビデオ生成のための最初の大規模なVisual Autoregressiveフレームワークであり、マルチスケールの次世代の予測と自動回帰モデリングを組み合わせたものである。
VideoARは、フレーム内VARと因果次フレーム予測を統合することで、空間的および時間的依存関係をアンハングルする。
実証的な結果として、VideoARは、自動回帰モデル間の解像度を改善し、UCF-101上のFVDを99.5から88.6に改善し、10倍以上の推論ステップを減らし、拡散ベースのVBenchスコア81.74に到達した。
論文 参考訳(メタデータ) (2026-01-09T17:34:59Z) - Pack and Force Your Memory: Long-form and Consistent Video Generation [26.53691150499802]
ロングフォームビデオ生成は2つの課題を提示します。
モデルは、自動回帰復号に固有のエラーの蓄積を防止しながら、長距離依存関係をキャプチャしなければなりません。
MemoryPackとDirect Forcingは、長期ビデオ生成のコンテキスト一貫性と信頼性を大幅に向上させる。
論文 参考訳(メタデータ) (2025-10-02T08:22:46Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。