論文の概要: DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution
- arxiv url: http://arxiv.org/abs/2606.29198v1
- Date: Sun, 28 Jun 2026 04:55:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.8305
- Title: DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution
- Title(参考訳): DTI: 顔画像生成超解像のための動的軌道初期化
- Authors: Yingwei Tang, Chen Yan, Wendi Liu, Qiang Hu, Xiaoyun Zhang,
- Abstract要約: フェースビデオ超解法(FVSR)のための動的軌道初期化(DTI)パラダイムを提案する。
新たなエンハンスメント・アンド・インジェクション・コンディショニング機構により, 知覚品質を損なうことなく, モデルの忠実度が大幅に向上した。
提案手法は,様々なメトリクスとベンチマークでSOTA全体の性能を向上する。
- 参考スコア(独自算出の注目度): 12.049894329245404
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As the most perceptually powerful Face Video Super-Resolution (FVSR) method, existing works in Generative FVSR (GFVSR) mainly exploit the generative prior of pretrained diffusion models. However, viewed as full generation, they suffer from fixed sampling and expensive inference costs if without large-scale auxiliary training. Furthermore, an excessive pursuit of generic perceptual metrics often results in low fidelity. To address these issues, we present Dynamic Trajectory Initialization (DTI) paradigm for GFVSR, which reformulates GFVSR as an input-driven directional restoration. With a novel enhancement-and-injection conditioning mechanism for pretrained DiT backbone, fidelity of our model has been significantly improved without compromising perceptual quality. To dynamically set the starting sampling point, we propose a Discriminative Guide (DG) trained via objective Signal-to-Noise Ratio (SNR) alignment. With only minor model adaptation and fine-tuning, our method achieves a SOTA overall performance across diverse metrics and benchmarks. An analysis of relationship between actual comprehensive quality and common metrics is also conducted, which demonstrates the perception-distortion trade-off and that the LPIPS is the most convincing metric in our case.
- Abstract(参考訳): 最も知覚力の高いFVSR(Face Video Super-Resolution)法として、GFVSR(Generative FVSR)の既存の研究は主に事前訓練された拡散モデルの生成前の手法を利用している。
しかし、フル世代と見なすと、大規模な補助訓練がなければ、一定のサンプリングと高価な推論コストに悩まされる。
さらに、一般的な知覚的指標の過剰な追跡は、しばしば低い忠実度をもたらす。
これらの課題に対処するため,GFVSRの動的軌道初期化(DTI)パラダイムを提案する。
プレトレーニングしたDiTバックボーンに対する新しいインジェクション・コンディショニング機構により, 知覚品質を損なうことなく, モデルの忠実度が著しく向上した。
そこで本研究では,信号対雑音比(SNR)アライメントを用いて学習した識別ガイド(DG)を提案する。
本手法は,マイナーモデル適応と微調整のみにより,様々なメトリクスやベンチマークに対してSOTA全体の性能を実現する。
また、実包括的品質と共通指標の関係分析を行い、知覚歪曲トレードオフとLPIPSが我々の場合で最も説得力のある指標であることを示す。
関連論文リスト
- Mitigating Error Amplification in Fast Adversarial Training [58.74042726356826]
FAT(Fast Adversarial Training)は、ネットワークに摂動不変表現の学習を促すことによって、モデルロバスト性の向上に有効であることが証明されている。
FATは、しばしば破滅的なオーバーフィッティング(CO)に悩まされ、モデルがトレーニングアタックに過度に適合し、目に見えないものへの一般化に失敗する。
本稿では、摂動予算と監視信号の両方を動的に調整する分散対応動的ガイダンス(DDG)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-27T11:23:18Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - RAAG: Ratio Aware Adaptive Guidance [9.525432706814675]
フローベースの生成モデルは驚くべき進歩を遂げた。
推論全体を通じて強力な、固定されたガイダンススケールを適用することは、現代的なアプリケーションに必要な、迅速な、数ステップのサンプリングには適していない。
本稿では,進化率に基づいて早期段階の指導尺度を自動的に減衰させる,シンプルな,理論的に基礎付けられた適応型指導スケジュールを提案する。
論文 参考訳(メタデータ) (2025-08-05T13:41:05Z) - SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution [46.311223206965934]
後続の超解像モデルの設計原理について検討し,その設計原理について検討する。
まず、ベースモデルの出力特性をよりよく模倣し、VSRモデルと上流ジェネレータとの整合性を確保するための2つのトレーニングペアを生成する方法を提案する。
第2に,(1)時間ステップサンプリング戦略,(2)低分解能(LR)入力に対する雑音増強効果の系統的解析を通じて,VSRモデル行動に対する批判的洞察を提供する。
論文 参考訳(メタデータ) (2025-06-24T17:57:26Z) - Diffusion Prior Interpolation for Flexibility Real-World Face Super-Resolution [48.34173818491552]
拡散事前補間(DPI)は、一貫性と多様性のバランスをとることができ、事前訓練されたモデルにシームレスに統合することができる。
合成および実データに対して行われた広範な実験において、DPIはSOTA FSR法よりも優れていることを示した。
論文 参考訳(メタデータ) (2024-12-21T09:28:44Z) - Degradation-Guided One-Step Image Super-Resolution with Diffusion Priors [75.24313405671433]
拡散に基づく画像超解像法 (SR) は、事前訓練された大規模なテキスト・画像拡散モデルを先行として活用することにより、顕著な成功を収めた。
本稿では,拡散型SR手法の効率問題に対処する新しい一段階SRモデルを提案する。
既存の微調整戦略とは異なり、SR専用の劣化誘導低ランク適応 (LoRA) モジュールを設計した。
論文 参考訳(メタデータ) (2024-09-25T16:15:21Z) - Learn to Preserve and Diversify: Parameter-Efficient Group with Orthogonal Regularization for Domain Generalization [28.977757627384165]
ドメイン・ドメイン(DG)は、限られたトレーニングデータと見つからないテストデータの間の分散シフトが発生したとき、モデルの性能劣化を避けることを目的としている。
近年、膨大なパラメータを持つ基礎モデルは、膨大なデータセットで事前訓練されており、強力な一般化能力を示している。
我々のフレームワークは5つのDGベンチマークでSOTA性能を実現し、テストコストを増すことなく少数のパラメータをトレーニングするのみである。
論文 参考訳(メタデータ) (2024-07-21T07:50:49Z) - Dissecting Arbitrary-scale Super-resolution Capability from Pre-trained
Diffusion Generative Models [24.82036158180386]
拡散に基づく生成モデル(DGM)は、高品質な視覚コンテンツを合成する際の非並列的な性能を達成している。
これらの課題に対する最近の解決策は、しばしばアーキテクチャ固有のDGMをゼロから訓練するか、または事前訓練されたDGMに対して反復的な微調整と蒸留を必要とする。
我々はDiff-SRを提案する。Diff-SRは、事前訓練されたDGMのみをベースとした最初のASSRの試みであり、追加の訓練は行わない。
論文 参考訳(メタデータ) (2023-06-01T14:20:06Z) - Generalized Real-World Super-Resolution through Adversarial Robustness [107.02188934602802]
本稿では,実世界のSRに取り組むために,敵攻撃の一般化能力を活用したロバスト超解法を提案する。
我々の新しいフレームワークは、現実世界のSR手法の開発においてパラダイムシフトをもたらす。
単一のロバストモデルを使用することで、実世界のベンチマークで最先端の特殊な手法より優れています。
論文 参考訳(メタデータ) (2021-08-25T22:43:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。