論文の概要: Video Generation Models: A Survey of Post-Training and Alignment
- arxiv url: http://arxiv.org/abs/2610.00812v1
- Date: Wed, 30 Sep 2026 23:13:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.800478
- Title: Video Generation Models: A Survey of Post-Training and Alignment
- Title(参考訳): 映像生成モデル:ポストトレーニングとアライメントに関する調査
- Abstract要約: ビデオモデルは、人間の意図に確実に従わなかったり、時間的コヒーレンスを維持したり、物理的および安全上の制約を満たすことも多い。
画像やテキスト生成と比較すると、ビデオ生成におけるアライメントは独特な課題である。
本稿では,ビデオ生成モデルにおけるポストトレーニングとアライメントの総合的なレビューについて紹介する。
- 参考スコア(独自算出の注目度): 17.953416575154755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video generation has rapidly progressed from short, low-quality clips to high-resolution, long-duration sequences with complex spatiotemporal dynamics. Despite strong generative priors learned through large-scale pretraining, pretrained video models often fail to reliably follow human intent, maintain temporal coherence, or satisfy physical and safety constraints. Compared with image and text generation, alignment in video generation presents unique challenges, including error accumulation over time, motion-appearance coupling, multi-objective trade-offs, and limited supervision for temporal properties. These challenges motivate systematic post-training strategies that adapt pretrained models without retraining them from scratch. In this survey, we present the first comprehensive review of post-training and alignment in video generation models. We frame post-training as a unifying framework and distinguish between implicit alignment and explicit alignment based on how alignment signals are enforced. From this perspective, we organize existing approaches into four broad categories: supervised fine-tuning methods, self-training and distillation methods, preference- and reward-based methods, and inference-time methods. This taxonomy provides a coherent view of how alignment signals shape model behavior across both training and deployment. Beyond methodological advances, we review commonly used datasets, benchmarks, and evaluation practices, and discuss open challenges such as scalable reward design, long-horizon temporal consistency, stability-expressiveness trade-offs, and safety-aware generation. This survey aims to provide a structured conceptual foundation and practical guidance for advancing controllable and reliable video generation models.
- Abstract(参考訳): ビデオ生成は、短い、低品質のクリップから、複雑な時空間ダイナミクスを持つ高解像度の、長周期のシーケンスへと急速に進歩した。
大規模な事前訓練によって学習された強力な生成的先行性にもかかわらず、事前訓練されたビデオモデルは、人間の意図に確実に従わなかったり、時間的コヒーレンスを維持したり、物理的および安全上の制約を満たすことがしばしばある。
画像やテキスト生成と比較して、ビデオ生成におけるアライメントは、時間とともにエラーの蓄積、動き-外観結合、多目的トレードオフ、時間的特性の限定的な監視など、ユニークな課題を呈している。
これらの課題は、事前訓練されたモデルをスクラッチからトレーニングすることなく適応する、体系的なポストトレーニング戦略を動機付けます。
本稿では,ビデオ生成モデルにおけるポストトレーニングとアライメントの総合的なレビューについて紹介する。
我々は、統合フレームワークとしてポストトレーニングを行い、アライメント信号の強制方法に基づいて、暗黙のアライメントと明示的なアライメントを区別する。
この観点から、我々は既存のアプローチを、教師付き微調整法、自己学習・蒸留法、嗜好に基づく方法、報酬に基づく方法、推論時方法の4つの幅広いカテゴリに分類する。
この分類法は、アライメントがトレーニングとデプロイメントの両方でモデルの振る舞いを形作るかというコヒーレントな見解を提供する。
方法論的な進歩の他に、一般的なデータセット、ベンチマーク、評価プラクティスをレビューし、スケーラブルな報酬設計、長期的時間的一貫性、安定性と表現力のトレードオフ、安全に配慮した生成といったオープンな課題について議論する。
本調査は、制御可能で信頼性の高い映像生成モデルを進めるための、構造化された概念基盤と実践的ガイダンスを提供することを目的とする。
関連論文リスト
- CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation [31.482087672315895]
textbfCausalMotionは、構造化中間表現を通じてビデオ生成に明示的な物理的推論を注入する。
我々の手法は、特に動的に集中したシナリオにおいて、物理的妥当性と時間的コヒーレンスを一貫して改善する。
論文 参考訳(メタデータ) (2026-06-12T09:57:01Z) - A Systematic Post-Train Framework for Video Generation [76.26555417456773]
大規模ビデオ拡散モデルでは、高解像度でセマンティックにリッチなコンテンツを生成できることが顕著に示されている。
迅速な感度、時間的不整合、禁止的推論コストといった重要な問題のために、事前訓練されたパフォーマンスと実際のデプロイメント要件の間には、大きなギャップが残っている。
本研究では,事前学習されたモデルとユーザの意図を4つの相乗的段階を通して体系的に整合させる総合的なポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-28T09:34:51Z) - Demystifing Video Reasoning [71.53763299316041]
ビデオモデルにおける推論は、主に拡散認知のステップに沿って現れることを示す。
モデル性能に重要ないくつかの創発的推論行動を特定する。
これらの知見に触発され、私たちは概念実証としてトレーニングフリー戦略を提示した。
論文 参考訳(メタデータ) (2026-03-17T17:59:55Z) - Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations [53.91818843831925]
NExT-Vidは,新しい自己回帰型視覚生成事前学習フレームワークである。
本研究では,文脈分離型自己回帰予測器を導入し,セマンティック表現をターゲットデコーディングから切り離す。
文脈分離型フローマッチング事前学習により,本手法は強い表現を実現する。
論文 参考訳(メタデータ) (2025-12-24T07:07:08Z) - End-to-End Training for Autoregressive Video Diffusion via Self-Resampling [63.84672807009907]
自己回帰ビデオ拡散モデルは、世界シミュレーションの可能性を保っているが、列車テストミスマッチに起因する露出バイアスに弱い。
教師なしのフレームワークであるResampling Forcingを導入し、スクラッチから大規模まで自動回帰ビデオモデルのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-12-17T18:53:29Z) - Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss [35.69606926024434]
本稿では,初期雑音に基づくアプローチと新たな動きの整合性損失を組み合わせた,シンプルで効果的な解を提案する。
次に、生成したビデオに類似した特徴相関パターンを維持するために、動きの整合性損失を設計する。
このアプローチは、トレーニング不要のセットアップの利点を保ちながら、さまざまなモーションコントロールタスク間の時間的一貫性を改善する。
論文 参考訳(メタデータ) (2025-01-13T18:53:08Z) - Towards More Robust and Accurate Sequential Recommendation with
Cascade-guided Adversarial Training [54.56998723843911]
シーケンシャルレコメンデーションモデルの性質に特有の2つの特性は、その堅牢性を損なう可能性がある。
本稿では,シーケンシャルレコメンデーションモデルに特化して設計された,新たな逆行訓練法であるカスケード誘導逆行訓練を提案する。
論文 参考訳(メタデータ) (2023-04-11T20:55:02Z) - Learning Temporal Dynamics from Cycles in Narrated Video [85.89096034281694]
時が経つにつれて世界がどのように変化するかをモデル化する学習問題に対する自己監督型ソリューションを提案します。
私たちのモデルは、前方および後方の時間を予測するためにモダリティに依存しない関数を学習します。
将来的な動作の予測や画像の時間的順序付けなど,様々なタスクに対して,学習されたダイナミクスモデルを適用する。
論文 参考訳(メタデータ) (2021-01-07T02:41:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。