論文の概要: Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
- arxiv url: http://arxiv.org/abs/2607.15849v1
- Date: Fri, 17 Jul 2026 11:07:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.832171
- Title: Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
- Title(参考訳): 実写自己回帰ビデオ生成のための実時間ノイズガイド適応
- Abstract要約: ノイズガイド最適化(TANGO)による端末点回避について紹介する。
我々の手法は、VBenchの最先端技術に対する絶対的な改善を3.1%で達成し、Fréchet Video Distanceを平均で15ドルのビデオで28.3%削減する。
- 参考スコア(独自算出の注目度): 39.009217034010796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autoregressive video diffusion models have enabled the generation of arbitrarily long videos by removing conditioning on future frames, thus greatly improving computational efficiency. Yet, they suffer from error accumulation over time, as the denoised sequence gradually drifts away from the conditioning distribution seen during training. Recent advances attempt to reduce this error by anchoring each generated frame to the learned manifold of real ones. However, even when all generated individual frames lie close to the real manifold, there are trajectories which the model lacks sufficient knowledge to continue without exiting it, thus reaching a terminal point. To prevent the model from being trapped in terminal points, we start from the hypothesis that for well-modeled future trajectories the distribution of the predicted noise should match the one of the forward noising process. To enforce such a prior at test time, we introduce Terminal points Avoidance through Noise Guided Optimization (TANGO), which uses the diffusion model as a critic of its own outputs, by predicting one step forward and requiring an isotropic Gaussian noise prediction. We use the deviation from this expected noise distribution to search for an alternative trajectory that does not lead to a terminal point. Our approach achieves a $3.1\%$ absolute improvement on VBench over state-of-the-art, while reducing Fréchet Video Distance by $28.3\%$ on average across $15$s videos. Our code is available on https://mever-team.github.io/tango.
- Abstract(参考訳): 自己回帰ビデオ拡散モデルにより、将来のフレームのコンディショニングを取り除き、計算効率を大幅に向上させることにより、任意に長いビデオを生成することができる。
しかし、これらは時間の経過とともにエラーの蓄積に悩まされ、復調シーケンスはトレーニング中に見られる条件分布から徐々に遠ざかっていく。
近年の進歩は、各生成されたフレームを実数の学習多様体に固定することで、この誤差を減らそうとしている。
しかし、生成された全ての個々のフレームが実多様体に近くにあるとしても、モデルがそれから抜け出さずに継続できる十分な知識を持っていない軌道が存在し、終点に達する。
モデルが終端点に閉じ込められるのを防ぐため、予測された雑音の分布が前方ノイズ発生過程の1つと一致するという仮説から始める。
このような事前テストを行うために,拡散モデルを用いた雑音誘導最適化(TANGO)による終端点回避手法を導入し,一段前進を予測し,等方的ガウス雑音予測を求める。
我々は、この予測された雑音分布から逸脱して、終点に繋がらない別の軌跡を探索する。
われわれの手法は、VBenchの最先端技術に対する絶対的な改善を3.1\%で達成し、Fréchet Video Distanceを平均で15ドルのビデオで28.3\%削減する。
私たちのコードはhttps://mever-team.github.io/tango.comで利用可能です。
関連論文リスト
- Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training [51.18425726646089]
我々は、画像とビデオの拡散モデルのための統合潜在空間フレームワークであるtextscSUREを提案する。
報酬分布を学習し、信頼性を直接利用して、密集したポストトレーニングをガイドする。
textscSURE-REFLは評価手法の中で最も高いVBench品質、セマンティック、総得点を達成する。
論文 参考訳(メタデータ) (2026-08-06T14:55:42Z) - Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models [0.0]
本稿では,ショートホライズン予測表示のためのオフ・ザ・シェルフ生成ビデオモデルのベンチマークを示す。
性能は、予測精度、ロールアウト毎のレイテンシ、ピークGPUメモリ使用量、時間的エラー進化を用いて評価される。
発見は、汎用な生成ビデオ合成と遠隔操作における予測表示の要件とのギャップを浮き彫りにする。
論文 参考訳(メタデータ) (2026-05-10T17:36:22Z) - Streaming Autoregressive Video Generation via Diagonal Distillation [50.13573884115673]
自己回帰モデルは、シーケンシャルフレーム合成のための自然なフレームワークを提供するが、高い忠実性を達成するためには重い計算を必要とする。
ビデオチャンクとデノイングステップの時間的情報を活用するために,ダイアゴナル蒸留を提案する。
本手法は,2.61秒(最大31FPS)で5秒ビデオを生成し,未蒸留モデル上で277.3倍のスピードアップを実現する。
論文 参考訳(メタデータ) (2026-03-10T10:45:24Z) - End-to-End Training for Autoregressive Video Diffusion via Self-Resampling [63.84672807009907]
自己回帰ビデオ拡散モデルは、世界シミュレーションの可能性を保っているが、列車テストミスマッチに起因する露出バイアスに弱い。
教師なしのフレームワークであるResampling Forcingを導入し、スクラッチから大規模まで自動回帰ビデオモデルのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-17T18:53:29Z) - Taming generative video models for zero-shot optical flow extraction [28.176290134216995]
将来のフレーム予測のためにのみ訓練された自己教師付きビデオモデルは、微調整なしで、出力フローを誘導することができる。
対実世界モデル(CWM)パラダイムに触発されて、我々はこのアイデアを生成型ビデオモデルに拡張する。
KLトラシング(KL-tracing)は、局所摂動を第1フレームに注入し、モデルを第1ステップでロールアウトし、摂動分布と非退化予測分布の間のクルバック・リーブラー分岐を計算する、新しいテストタイムプロシージャである。
論文 参考訳(メタデータ) (2025-07-11T23:59:38Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z) - Continuous Speculative Decoding for Autoregressive Image Generation [27.308442169466975]
連続的視覚自己回帰(AR)モデルは、画像生成において有望な性能を示す。
投機的復号化は 事実上 自己回帰推論を加速させた
この研究は、低受理率、不整合出力分布、解析式のない修正分布からの課題に対処する。
論文 参考訳(メタデータ) (2024-11-18T09:19:15Z) - Refining Pre-Trained Motion Models [56.18044168821188]
我々は、自己教師付きトレーニングによる最先端の教師付きモデルの改善に挑戦する。
実世界の未学習ビデオから「クリーン」な訓練信号を得ることに重点を置いている。
本研究では,本手法が実動画における完全教師付き手法よりも信頼性が高いことを示す。
論文 参考訳(メタデータ) (2024-01-01T18:59:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。