論文の概要: The Seriality Gap in Video Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.13031v1
- Date: Tue, 14 Jul 2026 17:59:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.246965
- Title: The Seriality Gap in Video Diffusion Models
- Title(参考訳): ビデオ拡散モデルにおけるシリアリティギャップ
- Abstract要約: 標準的な双方向ビデオ拡散性能は、因果連鎖の長さが長くなるにつれて低下することがわかった。
ボールとボールの相互作用が欠如している長さマッチングされたシングルボール制御では、劣化はほぼ消失する。
連続計算の増大を必要とするタスクと、デノベーションループがスケーラブルな連続計算を提供しないビデオ拡散モデルとのミスマッチである。
- 参考スコア(独自算出の注目度): 13.531579709109678
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When one ball strikes another, then another, video models should predict the consequences of each bounce. In controlled experiments on multi-ball hard-sphere dynamics, we find that the performance of standard bidirectional video diffusion degrades as the causal chain lengthens, even when provided more denoising steps. In a length-matched single-ball control, where ball-ball interactions are absent, the degradation largely disappears, isolating dependent-event structure rather than video length as the cause. Across intervention studies, methods that increase effective serial computation improve performance disproportionately, including autoregressive/blockwise generation and architectural depth. We identify this pattern as the seriality gap: a mismatch between tasks requiring growing serial computation and video diffusion models whose denoising loop does not provide scalable serial compute. We then prove that, for deterministic video prediction, denoising steps do not add serial computation beyond the backbone, indicating a structural obstacle for video diffusion on serial reasoning and simulation tasks.
- Abstract(参考訳): 1つのボールがもう1つのボールにぶつかると、ビデオモデルは各バウンスの結果を予測する。
マルチボールハードスフィア力学の制御実験では, 通常の双方向ビデオ拡散性能は, より分極的なステップを施しても, 因果連鎖長として低下することがわかった。
ボールとボールの相互作用が欠如している長さマッチングされたシングルボール制御では、劣化はほとんど失われ、ビデオ長ではなく依存物構造が分離される。
介入研究全体を通じて、効率的なシリアル計算を増加させる手法は、自己回帰/ブロックワイド生成やアーキテクチャの深さを含む性能を不均等に改善する。
連続計算の増大を必要とするタスクと、デノベーションループがスケーラブルな連続計算を提供しないビデオ拡散モデルとのミスマッチである。
そして, 決定論的ビデオ予測において, 逐次的推論やシミュレーションタスクにおけるビデオ拡散の構造的障害として, 背骨を超えるシリアル計算を加えないことを証明した。
関連論文リスト
- Mitigating Compounding Error via Video Representation Regularization [32.14962855907007]
ビデオ拡散に基づく世界モデルは、ロボット工学、自律運転、シミュレーションタスクのための長い自己回帰ビデオ生成を可能にする。
スライディングウインドウの自己回帰推論は、時間とともにフレーム品質を低下させる深刻なエラー蓄積に悩まされる。
ビデオワールドモデルの内部表現力学について検討し,合成誤差が隠れ表現の次元的崩壊と密結合していることを明らかにする。
本稿では,遅延表現を安定化し,反復的誤り蓄積を抑制する軽量な訓練制約である映像表現正規化を提案する。
論文 参考訳(メタデータ) (2026-07-29T15:29:39Z) - RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling [51.279397568734424]
Diffusion Transformers (DiTs) に基づく映像生成モデルは,映像合成において顕著な性能を発揮している。
DiTは3次元の注意の二次的な複雑さのために、高い推論遅延と計算コストに悩まされる。
我々はbftextRhymeFlowを紹介した。bftextRhymeFlowはトレーニング不要のフレームワークで、異なるフレームの認知軌道を分離する。
論文 参考訳(メタデータ) (2026-06-04T15:49:37Z) - FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - Causality in Video Diffusers is Separable from Denoising [38.11368818072302]
因果関係は、ビデオ、言語、ロボット軌道など、多くの複雑な生成過程の基盤となっている。
現在の因果拡散モデルでは、時間的推論を反復的妄想と結び付け、すべての層に因果的注意を向ける。
これらのモデルにおける因果推論は、多段階の分極過程から分離可能であることを示す。
これらの知見に触発されて、多段階フレームワイドレンダリングから因果トランスフォーマーエンコーダを介して、1フレーム毎の時間的推論を明示的に分離する新しいアーキテクチャであるSCD(Separable Causal Diffusion)を導入する。
論文 参考訳(メタデータ) (2026-02-10T18:57:21Z) - End-to-End Training for Autoregressive Video Diffusion via Self-Resampling [63.84672807009907]
自己回帰ビデオ拡散モデルは、世界シミュレーションの可能性を保っているが、列車テストミスマッチに起因する露出バイアスに弱い。
教師なしのフレームワークであるResampling Forcingを導入し、スクラッチから大規模まで自動回帰ビデオモデルのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-17T18:53:29Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z) - AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion [19.98565541640125]
自動回帰拡散(AR-Diffusion, Auto-Regressive Diffusion)は, フレキシブルビデオ生成のための自己回帰拡散モデルと拡散モデルの強みを組み合わせた新しいモデルである。
自己回帰生成に触発されて、個々のフレームの腐敗タイムステップに非減少制約を組み込む。
このセットアップは、時間的因果的注意とともに、時間的コヒーレンスを保ちながら、長さの異なる柔軟なビデオの生成を可能にする。
論文 参考訳(メタデータ) (2025-03-10T15:05:59Z) - Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps [48.16416920913577]
拡散モデルの予測時間スケーリングの挙動を,デノナイジングステップの増大を超えて検討する。
拡散サンプリングプロセスにおいて,より優れたノイズを特定することを目的とした探索問題を考察する。
その結果, 推定時間計算の増加は, 拡散モデルにより生成された試料の品質を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-01-16T18:30:37Z) - MSC: Multi-Scale Spatio-Temporal Causal Attention for Autoregressive Video Diffusion [0.0]
これらの問題に対処するためのマルチスケール因果関係(MSC)フレームワークを提案する。
本研究では,空間次元の多重分解能と時間次元の高低周波数を導入し,効率的な注意計算を実現する。
理論的には、我々の手法は計算の複雑さを大幅に減らし、訓練の効率を高めることができる。
論文 参考訳(メタデータ) (2024-12-13T03:39:09Z) - Unsupervised Flow-Aligned Sequence-to-Sequence Learning for Video
Restoration [85.3323211054274]
ビデオシーケンス内のフレーム間関係を適切にモデル化する方法は、ビデオ復元(VR)において重要であるが未解決の課題である。
本研究では,この問題を解決するために,教師なしフローアライメントシーケンス・ツー・シーケンス・モデル(S2SVR)を提案する。
S2SVRは、ビデオデブリ、ビデオスーパー解像度、圧縮されたビデオ品質向上など、複数のVRタスクにおいて優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2022-05-20T14:14:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。