論文の概要: FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration
- arxiv url: http://arxiv.org/abs/2607.06389v1
- Date: Tue, 07 Jul 2026 15:24:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.573082
- Title: FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration
- Title(参考訳): FADRA : 残像適応による周波数認識拡散
- Authors: Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao,
- Abstract要約: ビデオ顔復元(VFR)は、高度に劣化したビデオシーケンスから高品質で時間的に一貫した顔の詳細を復元することを目的としている。
本稿では,周波数対応拡散フレームワークであるFADRAを提案する。
FADRAはより優れた顔構造を復元し、最先端の手法よりも時間的に一貫したビデオを生成する。
- 参考スコア(独自算出の注目度): 19.325369139066925
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video face restoration (VFR) aims to recover high-quality and temporally consistent facial details from severely degraded video sequences; however, existing methods still struggle to balance spatial fidelity and temporal coherence under complex degradations. To address this, we propose FADRA, a frequency-aware diffusion framework with iterative residual adaptation specifically tailored for robust VFR. We first leverage the strong temporal consistency of a pre-trained text-to-video diffusion model and introduce lightweight LoRA adapters together with a Low-Quality (LQ) Pixel-Alignment Feature Fusion module to efficiently adapt the frozen generative prior to the VFR task. To further adapt the frozen diffusion backbone to the downstream VFR task beyond LoRA-based adaptation, we introduce a Repeated Residual Adaptation Head (RRAH) for step-wise residual refinement after the diffusion backbone. To make this refinement explicitly guided by the degraded observation, RRAH further takes the LQ latent together with the current velocity prediction as input, allowing the model to repeatedly revisit LQ cues and predict residual updates at each flow-matching step. This LQ-guided repeated residual adaptation helps recover fine facial details while preserving the inherent temporal priors of the pre-trained model. Furthermore, to ensure the structural integrity of perceptually important details, we introduce a Frequency-Aware Loss that provides explicit supervision across multiple spectral bands, emphasizing visually sensitive frequency components that are crucial for perceptual quality and prone to temporal jittering. Extensive experiments demonstrate that FADRA recovers better facial structures and produces more temporally consistent videos than state-of-the-art methods, leading to clear gains in both quantitative metrics and visual perception.
- Abstract(参考訳): ビデオ顔の復元(VFR)は、高度に劣化したビデオシーケンスから高品質で時間的に整合した顔の詳細を復元することを目的としているが、既存の手法では複雑な劣化下での空間的忠実度と時間的コヒーレンスとのバランスに苦慮している。
そこで本稿では,高機能なVFRに適した繰り返し残差適応型拡散フレームワークであるFADRAを提案する。
まず,事前学習したテキスト・ビデオ拡散モデルの時間的一貫性を活用し,低品質(LQ)のPixel-Alignment Feature Fusionモジュールとともに軽量のLoRAアダプタを導入し,VFRタスクに先立って凍結生成を効率的に適応する。
凍結拡散バックボーンをLoRAによる適応以上の下流VFRタスクにさらに適応させるため,拡散バックボーン後段階的残留改善のための繰り返し残留適応ヘッド(RRAH)を導入する。
この改良を劣化した観測で明示的に導くため、RRAHは現在の速度予測と共にLQ遅延を入力とし、モデルが繰り返しLQキューを再検討し、各フローマッチングステップで残留更新を予測する。
このLQ誘導繰り返し残差適応は、事前訓練されたモデル固有の時間的先行を保ちながら、きめ細かな顔の細部を回復するのに役立つ。
さらに、知覚上重要な細部の構造的整合性を確保するために、複数のスペクトル帯域を横断する明示的な監視を提供する周波数認識損失を導入し、知覚品質に不可欠な周波数成分と時間的ジッタリングの傾向を強調した。
大規模な実験により、FADRAはより優れた顔構造を回復し、最先端の手法よりも時間的に一貫したビデオを生成することが示され、定量的な測定値と視覚的知覚の両方において明らかな利益をもたらす。
関連論文リスト
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features [51.5076190312734]
ビデオ超解法アプローチは、エラーの蓄積、空間的アーティファクト、知覚的品質と忠実さのトレードオフに悩まされる。
ビデオ超解像(DGAF-VSR)に適した特徴を持つ新しい誘導拡散モデルを提案する。
合成および実世界のデータセットの実験では、DGAF-VSRがVSRの重要な側面において最先端の手法を超越していることが示されている。
論文 参考訳(メタデータ) (2025-11-21T03:40:45Z) - Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models [5.61537470581101]
ゼロショット画像ベース拡散モデルを用いたビデオ再生における時間的コヒーレンス向上の課題に対処する。
本稿では,PSG(Perceptual Straightening Guidance)とMPES(Ensemble Sampling)の2つの補完的推論時間戦略を提案する。
論文 参考訳(メタデータ) (2025-10-29T11:40:06Z) - LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration [3.2944592608677614]
本稿では,VCMで符号化された先行画像を用いた高精細ビデオ再生のための,最初のゼロショット・プラグ・アンド・プレイ逆解器であるLVTINOを提案する。
我々の条件付け機構は、自動微分の必要性を回避し、少数のニューラルファンクション評価で最先端のビデオ再構成品質を達成する。
論文 参考訳(メタデータ) (2025-10-01T18:10:08Z) - DiTVR: Zero-Shot Diffusion Transformer for Video Restoration [48.97196894658511]
DiTVRはゼロショットビデオ復元フレームワークで、拡散トランスフォーマーと軌跡を意識した注意と流れ一貫したサンプルを結合する。
我々の注意機構は、光流路に沿ってトークンを整列させ、特に時間力学に最も敏感な重要な層に重点を置いている。
フローガイドされたサンプリング装置は、低周波帯域にのみデータの一貫性を注入し、キャッシュを加速させながら高周波事前保存を行う。
論文 参考訳(メタデータ) (2025-08-11T09:54:45Z) - Temporal-Consistent Video Restoration with Pre-trained Diffusion Models [51.47188802535954]
ビデオ復元(VR)は、劣化したビデオから高品質なビデオを復元することを目的としている。
事前訓練拡散モデル(DM)を用いた最近のゼロショットVR法は,逆拡散時の近似誤差と時間的整合性の欠如に悩まされている。
本稿では,DMのシード空間におけるビデオフレームを直接パラメータ化し,近似誤差を排除した新しいMAP(Posterior Maximum)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-19T03:41:56Z) - Rethinking Video Tokenization: A Conditioned Diffusion-based Approach [58.164354605550194]
新しいトークン化ツールであるDiffusion Conditioned-based Gene Tokenizerは、GANベースのデコーダを条件付き拡散モデルで置き換える。
再建に基本的MSE拡散損失とKL項,LPIPSを併用した訓練を行った。
CDTのスケールダウン版(3$times inference speedup)でさえ、トップベースラインと互換性がある。
論文 参考訳(メタデータ) (2025-03-05T17:59:19Z) - Motion-Guided Latent Diffusion for Temporally Consistent Real-world Video Super-resolution [15.197746480157651]
本稿では,事前学習した潜伏拡散モデルの強度を利用した実世界のVSRアルゴリズムを提案する。
我々は、LRビデオの時間的ダイナミクスを利用して、動作誘導損失で潜時サンプリング経路を最適化することにより拡散過程を導出する。
動作誘導潜在拡散に基づくVSRアルゴリズムは、実世界のVSRベンチマークデータセットの最先端技術よりも、知覚品質が大幅に向上する。
論文 参考訳(メタデータ) (2023-12-01T14:40:07Z) - Intrinsic Temporal Regularization for High-resolution Human Video
Synthesis [59.54483950973432]
時間整合性は、画像処理パイプラインをビデオドメインに拡張する上で重要である。
フレームジェネレーターを介して本質的信頼度マップを推定し,運動推定を調節する,本質的な時間正規化方式を提案する。
我々は、本質的な時間的規制をシングルイメージジェネレータに適用し、強力な「Internet」が512Times512$の人間のアクションビデオを生成します。
論文 参考訳(メタデータ) (2020-12-11T05:29:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。