論文の概要: FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- arxiv url: http://arxiv.org/abs/2607.27110v1
- Date: Wed, 29 Jul 2026 16:38:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.74322
- Title: FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- Title(参考訳): FreqForcing:スペクトル自己組織化による自己回帰長ビデオ生成
- Authors: Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang,
- Abstract要約: 本稿では,SSA(Spectral Self-Anchoring)による長ビデオ生成におけるエラー蓄積に対処するフリートレーニングフレームワークFreqForcingを提案する。
私たちのFreqForcingは、5sクリップで事前訓練されたSelf-Forcingを2分間に拡張し、24倍の補間を実現しています。
- 参考スコア(独自算出の注目度): 38.650762310010734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive video diffusion models enable real-time streaming video generation. However, errors introduced during self-rollout accumulate over long horizons, manifesting as color drift, motion stagnation, and eventual visual collapse. In this paper, we characterize this phenomenon from a frequency-domain perspective: error accumulation appears as a pronounced energy drift in the low-frequency bands. We further investigate the effectiveness of attention sink in the frequency domain, and find that it improves the video quality by alleviating the spectral energy drift to some extent, but cannot fully resolve it. Motivated by the above analysis, we propose FreqForcing, a training-free framework that addresses error accumulation in long-video generation via Spectral Self-Anchoring (SSA). The proposed SSA leverages the low-frequency components of anchor attention to maintain long-horizon visual stability, while preserving dynamic motion through the high-frequency components of local attention. Our FreqForcing extends Self-Forcing pretrained on 5s clips to two-minute generation, achieving 24x extrapolation. Extensive experiments show that FreqForcing outperforms existing training-free methods quantitatively and qualitatively while remaining competitive with representative training-based approaches.
- Abstract(参考訳): 自動回帰ビデオ拡散モデルはリアルタイムのストリーミングビデオ生成を可能にする。
しかし、自己ロールアウト中に生じたエラーは長い地平線の上に蓄積し、色流、動きの停滞、最終的な視覚的崩壊として現れる。
本稿では,この現象を周波数領域の観点から特徴づける:低周波帯において,誤差蓄積は顕著なエネルギードリフトとして現れる。
さらに、周波数領域における注意シンクの有効性について検討し、スペクトルエネルギーのドリフトをある程度緩和することで映像品質を向上させるが、完全には解決できないことを見出した。
本稿では,SSA(Spectral Self-Anchoring)による長ビデオ生成における誤りの蓄積に対処するトレーニングフリーフレームワークFreqForcingを提案する。
提案したSSAは、アンカーアテンションの低周波成分を利用して、局所アテンションの高周波成分を通した動的動きを保ちながら、長時間の視覚的安定性を維持する。
私たちのFreqForcingは、5sクリップで事前訓練されたSelf-Forcingを2分間に拡張し、24倍の補間を実現しています。
大規模な実験により、FreqForcingは、一般的なトレーニングベースのアプローチと競合しながら、既存のトレーニング不要の手法を定量的かつ質的に上回ることを示した。
関連論文リスト
- SAGA: Stable Acceleration Guidance for Autoregressive Video Generation [17.967260849031593]
トレーニング不要なtextbftextitstable textbftextitautoregressive video 生成手法である SAGA を提案する。
SAGAは、有限ウィンドウのスレピアン投影に基づく加速度領域スペクトル誘導目標を統合する。
実験により、SAGAは複数の自己回帰拡散モデルにおいて時間的品質を一貫して改善することが示された。
論文 参考訳(メタデータ) (2026-07-09T00:55:10Z) - SRENet: Spectral Re-Entry Network for Point Cloud Action Recognition [49.508770157706486]
本研究では,行動認識の周波数視点から,大域的文脈と微粒な動きの時間的ダイナミクスを学習するためのSRENetを提案する。
SRENetは、ポイントクラウドベースのアクション理解における周波数モデリングの有効性を検証し、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-02T05:11:47Z) - FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction [28.81130393371554]
ビデオ拡散モデルは、短いビデオ合成においてよく機能するが、コンテンツドリフト、時間的不整合、過度に平滑なダイナミクスに悩まされる。
長ビデオ生成のためのトレーニング不要なスペクトル再構成フレームワークであるFreeSpecを提案する。
Wan2.1 と LTX-Video の実験では、FreeSpec は特に時間的ダイナミクスのために長ビデオ生成を改善することが示されている。
論文 参考訳(メタデータ) (2026-05-07T16:21:34Z) - Train Short, Inference Long: Training-free Horizon Extension for Autoregressive Video Generation [15.110494847628212]
FLEXは、短期トレーニングと長期推論のギャップを埋める、トレーニングフリーの推論タイムフレームワークである。
それは6倍の補間(30秒間)で最先端モデルよりも大幅に優れ、12倍のスケール(60秒間)で長時間の微調整ベースラインのパフォーマンスに匹敵する。
プラグインとプレイの拡張として、FLEXは水平線拡張のための既存の推論パイプラインにシームレスに統合される。
論文 参考訳(メタデータ) (2026-02-15T07:14:47Z) - LoL: Longer than Longer, Scaling Video Generation to Hour [50.945885467651216]
この研究は、品質劣化の少ないリアルタイム、ストリーミング、無限長のビデオ生成の最初のデモンストレーションを実現する。
実例として、最大12時間までの連続ビデオを生成し、私たちの知る限り、ストリーミングビデオ生成において最も長く実証された結果の1つである。
論文 参考訳(メタデータ) (2026-01-23T17:21:35Z) - Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression [36.99018442740971]
映像拡散にStreamingLLMスタイルのアテンションシンクを鼻で適用すると、忠実度が低下し、動きが停滞することがわかった。
我々は、微調整なしでこれに対応する2つのトレーニング不要なメカニズムからなるDeep Forcingを紹介した。
以上の結果から,トレーニングフリーなKV-cache管理は,自動回帰ストリーミング長ビデオ生成のためのトレーニングベースアプローチと一致するか,あるいは超える可能性があることが示唆された。
論文 参考訳(メタデータ) (2025-12-04T18:46:44Z) - DiTVR: Zero-Shot Diffusion Transformer for Video Restoration [48.97196894658511]
DiTVRはゼロショットビデオ復元フレームワークで、拡散トランスフォーマーと軌跡を意識した注意と流れ一貫したサンプルを結合する。
我々の注意機構は、光流路に沿ってトークンを整列させ、特に時間力学に最も敏感な重要な層に重点を置いている。
フローガイドされたサンプリング装置は、低周波帯域にのみデータの一貫性を注入し、キャッシュを加速させながら高周波事前保存を行う。
論文 参考訳(メタデータ) (2025-08-11T09:54:45Z) - FANeRV: Frequency Separation and Augmentation based Neural Representation for Video [32.35716293561769]
ビデオのための周波数分離と拡張に基づくニューラル表現(FANeRV)を提案する。
FANeRVは離散ウェーブレット変換を用いて入力フレームを高周波数成分と低周波数成分に明示的に分離する。
特別に設計されたゲートネットワークは、これらの周波数成分を効果的に融合して最適な再構成を行う。
論文 参考訳(メタデータ) (2025-04-09T10:19:35Z) - FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention [57.651429116402554]
本稿では、一貫した長ビデオ生成のための既存の短ビデオ拡散モデルを拡張するための、単純で訓練のないアプローチについて検討する。
短いビデオ拡散モデルを直接適用することで、ビデオの品質が著しく低下することを発見した。
そこで本研究では,長い映像の特徴の周波数分布のバランスをとるために,FreeLongという新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-29T11:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。