論文の概要: Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion
- arxiv url: http://arxiv.org/abs/2607.28058v1
- Date: Thu, 30 Jul 2026 11:36:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.53007
- Title: Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion
- Title(参考訳): ロールアウトエラーからの時間濃度:テキスト・ビデオ拡散における暗黙の選好最適化
- Abstract要約: 運動崩壊、物体のひらめき、色過飽和といった時間的に粗い人工物は、知覚現実主義にとって大きな障壁である。
既存の手法は2つの重要な制限があるため、これらの問題に対処する。
本稿では,ビデオ拡散モデルのためのトレーニング後フレームワークである集中型インプリシト・プレフレクション・最適化(cIPO)を提案する。
- 参考スコア(独自算出の注目度): 33.237232061796796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in preference alignment for diffusion-based video generation, particularly via Direct Preference Optimization (DPO), have significantly improved visual quality. However, temporally sparse artifacts such as motion collapse, object flickering, and color oversaturation remain a major barrier to perceptual realism. Existing methods struggle with these issues due to two key limitations: (1) the preference attribution bottleneck, where offline human annotations are costly and fail to accurately capture learning dynamics, while online reward signals are rollout-aware but often unstable and biased; and (2) temporal credit misallocation, where uniformly applied supervision cannot effectively target the brief segments in which artifacts occur. To address these challenges, we propose concentrated Implicit Preference Optimization (cIPO), a post-training framework for video diffusion models. cIPO derives implicit preference signals directly from the denoising process: given a real video, the model adds forward noise and reconstructs it via iterative denoising, treating the original as the preferred sample and the reconstruction as the dispreferred one. This formulation captures inference-time errors without requiring human annotations or external reward models. Moreover, frame-level discrepancies between original and reconstructed videos reveal when failures occur. cIPO leverages this by computing temporal reconstruction errors and concentrating optimization on high-error segments, enabling more precise correction of failure-prone regions. Extensive experiments demonstrate that cIPO consistently enhances video authenticity and temporal coherence across multiple datasets, highlighting the effectiveness and efficiency of implicit preference with temporally concentrated optimization.
- Abstract(参考訳): 特にDPO(Direct Preference Optimization)による拡散型ビデオ生成における嗜好アライメントの最近の進歩は、視覚的品質を著しく改善している。
しかし、運動崩壊、物体のひらめき、色過飽和といった時間的に粗い人工物は、知覚現実主義にとって大きな障壁である。
既存の手法では,(1)オフラインの人的アノテーションがコストが高く,学習のダイナミクスを正確に把握できない,という優先帰属ボトルネックや,オンライン報酬信号はロールアウトを意識しているが不安定でバイアスが多い,(2)一様に適用された監督が,人工物の発生する短いセグメントを効果的にターゲットできない,といった2つの制約により,これらの問題に対処している。
これらの課題に対処するため,ビデオ拡散モデルのためのトレーニング後フレームワークである集中型インプリシト・プライス・最適化(cIPO)を提案する。
cIPOは、暗黙の選好信号を直接デノナイジングプロセスから導き出す: 実際のビデオが与えられたら、そのモデルは前方のノイズを追加し、反復的なデノナイジングによって再構成し、元のものを好みのサンプルとして扱い、再構成を非推奨のものとして扱う。
この定式化は、人間のアノテーションや外部報酬モデルを必要とせずに、推論時のエラーをキャプチャする。
さらに、オリジナルビデオと再構成ビデオのフレームレベルの相違は、いつエラーが発生したかを明らかにする。
cIPOは、時間的再構成エラーを計算し、ハイエラーセグメントの最適化に集中することにより、障害が発生しやすい領域のより正確な修正を可能にする。
大規模な実験により、cIPOは複数のデータセットにわたるビデオの信頼性と時間的コヒーレンスを一貫して向上させ、時間的に集中した最適化による暗黙の選好の有効性と効率を強調している。
関連論文リスト
- P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization [55.74731799669337]
幻覚は近年、LVLM(Large Vision-Language Models)において大きな研究の注目を集めている。
直接選好最適化(DPO)は、人間が提供した修正選好から直接学習することを目的としている。
既存の選好ペアは視覚に依存しないことが多く、その本質的に非政治的な性質は、モデル学習を導く上での有効性を制限している。
本稿では、モデルが独自の選好ペアから生成し学習する新しい訓練パラダイムである知覚処理直接選好最適化(P$2$-DPO)を提案する。
論文 参考訳(メタデータ) (2026-06-02T09:22:53Z) - Temporal Aware Pruning for Efficient Diffusion-based Video Generation [22.469564305396002]
本研究では,効率的な拡散型ビデオ生成のためのトレーニング不要な時間アウェアであるTAPEを提案する。
TAPEは高い視覚的忠実性を維持しつつ、大幅なスピードアップを実現し、トークン削減手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-05-18T04:18:24Z) - SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning [17.14027883239169]
本稿では,V-A関節生成の時間感度を向上させるための訓練後フレームワークSyncDPOを提案する。
SyncDPOは,時間的アライメント能力の向上において,他の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-12T14:22:13Z) - CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating [49.94171749437024]
本稿では,ビジョンランゲージモデルに基づく粗大な異常報酬モデルである集中と集中(CaC)を提案する。
フレーム単位のバウンディングボックスアノテーション,時間的異常ウィンドウ,微粒な属性ラベルを備えた,最初の大規模ビデオ異常データセットを構築した。
実験では、CaCは微妙な異常に安定して集中することができ、微細な異常ベンチマークの精度が25.7%向上した。
論文 参考訳(メタデータ) (2026-05-12T08:08:33Z) - Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers [12.948398661304184]
Diffusion-APOは、ビデオ拡散モデルと人間の意図を一致させる軌跡認識アルゴリズムである。
オンラインランキング、半オンラインアンカー、オフラインリファインメント、蒸留対応ドリフト補正を統合した統一かつモジュール化されたRLHFフレームワークを導入する。
本研究では,Diffusion-APOが視覚的品質と指示の基準線を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-08T09:37:46Z) - CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models [66.56549019393042]
ビデオ言語モデル(VLM)は、強いマルチモーダル理解を実現するが、特に行動や時間秩序を推論する場合、幻覚を起こす傾向にある。
本稿では,シーンコンテキストを保ちながら,アクションや時間構造が異なる映像を合成する,対物映像生成のためのスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-08T10:03:07Z) - Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models [65.16788152626499]
LocalDPOは、ビデオ拡散モデルと人間の好みを一致させる新しいフレームワークを構築している。
そこで我々は,LocalDPOがビデオの忠実度,時間的コヒーレンス,人間の嗜好スコアを,他のポストトレーニングアプローチよりも一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-01-07T16:32:17Z) - Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models [5.61537470581101]
ゼロショット画像ベース拡散モデルを用いたビデオ再生における時間的コヒーレンス向上の課題に対処する。
本稿では,PSG(Perceptual Straightening Guidance)とMPES(Ensemble Sampling)の2つの補完的推論時間戦略を提案する。
論文 参考訳(メタデータ) (2025-10-29T11:40:06Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Collaborative Feedback Discriminative Propagation for Video Super-Resolution [66.61201445650323]
ビデオ超解像法(VSR)の主な成功は、主に空間情報と時間情報を探索することに由来する。
不正確なアライメントは通常、重要なアーティファクトを備えたアライメント機能につながる。
伝搬モジュールは同じタイムステップ機能のみを前方または後方に伝播する。
論文 参考訳(メタデータ) (2024-04-06T22:08:20Z) - Intrinsic Temporal Regularization for High-resolution Human Video
Synthesis [59.54483950973432]
時間整合性は、画像処理パイプラインをビデオドメインに拡張する上で重要である。
フレームジェネレーターを介して本質的信頼度マップを推定し,運動推定を調節する,本質的な時間正規化方式を提案する。
我々は、本質的な時間的規制をシングルイメージジェネレータに適用し、強力な「Internet」が512Times512$の人間のアクションビデオを生成します。
論文 参考訳(メタデータ) (2020-12-11T05:29:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。