論文の概要: From Scores to Samples: Elastic Forcing for Autoregressive Video Generation
- arxiv url: http://arxiv.org/abs/2609.35491v1
- Date: Mon, 28 Sep 2026 16:00:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.82148
- Title: From Scores to Samples: Elastic Forcing for Autoregressive Video Generation
- Title(参考訳): スコアからサンプルへ:自動回帰ビデオ生成のための弾性強制
- Abstract要約: 分散マッチング蒸留(DMD)を利用した数ステップ自動回帰ビデオ生成
我々は、参照ビデオから直接ロールアウト分布を学習し、ポストトレーニング中の両方のスコアモデルを排除した。
我々のフレームワークは、凍結した自己教師付きビデオ表現空間における最大平均不一致(MMD)を最小限に抑える。
- 参考スコア(独自算出の注目度): 21.815761777157665
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Few-step autoregressive video generation commonly relies on Distribution Matching Distillation (DMD), requiring a bidirectional diffusion teacher and an online fake-score model. We instead learn the rollout distribution directly from reference videos, eliminating both score models during post-training. Our framework minimizes maximum mean discrepancy (MMD) in frozen self-supervised video representation spaces, using a hybrid Nyström--Monte Carlo estimator to balance approximation bias and sampling variance. Memory-efficient replay and gradient subsampling make this objective practical. Using the same architecture and initialization as Self-Forcing, our 1.3B model improves the VBench Total score from 83.80 to 84.64 while retaining 17 FPS. Removing auxiliary score models also enables 14B post-training on eight H200 GPUs. Beyond distillation, learning from reference videos enables the acquisition of new visual styles, semantic concepts, and spatial priors without a target-specific diffusion teacher.
- Abstract(参考訳): 数ステップの自動回帰ビデオ生成は、双方向拡散教師とオンライン偽スコアモデルを必要とする分散マッチング蒸留(DMD)に依存している。
代わりに、参照ビデオから直接ロールアウト分布を学習し、トレーニング後の両方のスコアモデルを取り除きます。
我々のフレームワークは、Nyström-Monte Carlo推定器を用いて、凍結自己教師付きビデオ表現空間における最大平均誤差(MMD)を最小化し、近似バイアスとサンプリング分散のバランスをとる。
メモリ効率のよいリプレイと勾配のサブサンプリングは、この目的を実践する。
我々の1.3Bモデルでは、VBench Totalスコアを83.80から84.64に改善し、17 FPSを維持した。
補助スコアモデルを削除することで、8つのH200 GPU上で14Bのポストトレーニングが可能になる。
蒸留以外にも、参照ビデオからの学習は、ターゲット固有の拡散教師なしで、新しい視覚的スタイル、意味概念、空間的事前の獲得を可能にする。
関連論文リスト
- ViRDM: Taming Representation Distribution Matching for Few-Step Causal Video Generation [24.773587278828675]
ViRDMは教師と批評家のいないポストトレーニングのレシピである。
3ネットワーク蒸留を発電機のみのポストトレーニングに変換する。
ジェネレータの更新はわずか20回で、公式のVBench評価では84.87回に達した。
論文 参考訳(メタデータ) (2026-09-24T02:07:07Z) - Toward Reliable Machine Unlearning: Theory, Algorithms, and Evaluation [1.7767466724342065]
本稿では,SOTA MIAスコアに基づく画像分類の最先端手法を超越したAdrial Machine UNlearning(AMUN)を提案する。
既存の手法は、最寄りの会員推定攻撃(MIA-NN)を導入して、再訓練されたモデルの動作を再現できないことを示す。
そこで我々は,スクラッチから再学習したモデルが生成する残りのクラスに対する分布を,クラス入力に対して近似することで,このリークを緩和する微調整対象を提案する。
論文 参考訳(メタデータ) (2025-12-07T20:57:25Z) - Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation [69.57572900337176]
本稿では,効率的なストリーミングビデオ生成のための新しいフレームワークであるReward Forcingを紹介する。
EMA-Sinkトークンは、長期コンテキストと最近のダイナミクスの両方をキャプチャし、初期フレームコピーを防ぐ。
Re-DMDは、視覚言語モデルにより評価されたより大きなダイナミックスを持つサンプルを優先順位付けすることで、モデル出力分布を高逆領域にバイアスする。
論文 参考訳(メタデータ) (2025-12-04T11:12:13Z) - Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion [67.94300151774085]
本稿では,自己回帰ビデオ拡散モデルのための新しい訓練パラダイムであるSelf Forcingを紹介する。
露光バイアスの長年の問題に対処し、地道的な文脈で訓練されたモデルは、自身の不完全な出力で条件付けられたシーケンスを生成する必要がある。
論文 参考訳(メタデータ) (2025-06-09T17:59:55Z) - From Slow Bidirectional to Fast Autoregressive Video Diffusion Models [48.35054927704544]
現在のビデオ拡散モデルは、印象的な生成品質を実現するが、双方向の注意依存のため、インタラクティブなアプリケーションに苦戦する。
この制限には、事前訓練された双方向拡散変換器を自己回帰変換器に適応させ、フレームをオンザフライで生成することで対処する。
我々のモデルは、VBench-Longベンチマークで84.27点のスコアを達成し、以前のすべてのビデオ生成モデルを上回った。
論文 参考訳(メタデータ) (2024-12-10T18:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。