論文の概要: TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration
- arxiv url: http://arxiv.org/abs/2606.24336v1
- Date: Tue, 23 Jun 2026 09:21:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.858638
- Title: TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration
- Title(参考訳): TIGER: 高品質な顔ビデオ再生のためのアイデンティティ、幾何学、生成優先事項のモデリング
- Authors: Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou,
- Abstract要約: Face Video Restoration (FVR) は、劣化した入力から高忠実な顔映像を復元することを目的としている。
我々はTIGERを提案する。Tyos Identity, Geometry, gEnerative pRiors for high-quality FVR。
TIGERは、アイデンティティの忠実度と時間的安定性の両方において最先端のパフォーマンスを実現し、高品質で効率的でアイデンティティに一貫性のあるFVRを提供する。
- 参考スコア(独自算出の注目度): 20.79185234393381
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Face Video Restoration (FVR) aims to recover high-fidelity facial videos from degraded input while preserving identity and semantic consistency across frames. Existing methods often struggle to simultaneously address three key challenges: identity shift, viewpoint-entangled guidance, and perceptual realism. To tackle these issues, we propose TIGER, a structured tri-prior fusion framework that Tames Identity, Geometry, and gEnerative pRiors for high-quality FVR. Specifically, an Identity Prior is first established by injecting subject-discriminative embeddings into the latent space, effectively anchoring the subject's identity against severe degradations. Then, to provide temporally consistent structural guidance for dynamic videos, TIGER constructs a Geometry Prior by lifting 2D reference cues into a disentangled 3D parameter space, creating a geometric anchor through cross-source parameter fusion. Moreover, to achieve maximum efficiency without compromising realism, we harness the video generation model's Generative Prior through a one-step rectified flow. We further design a progressive three-stage training optimization strategy that refines structural fidelity, textural reconstruction, and distribution-level realism to ensure robust optimization. We also construct a large-scale FVR dataset to facilitate robust training and standardized evaluation. Extensive experiments demonstrate that TIGER achieves state-of-the-art performance in both identity fidelity and temporal stability, delivering a high-quality, efficient and identity-consistent FVR. Project page: https://yzhoulv.github.io/Tiger/.
- Abstract(参考訳): Face Video Restoration (FVR)は、フレーム間のアイデンティティとセマンティック一貫性を維持しながら、劣化した入力から高忠実な顔映像を復元することを目的としている。
既存の方法は、アイデンティティシフト、視点の絡み合ったガイダンス、知覚現実主義という3つの主要な課題に同時に対処するのに苦労することが多い。
これらの課題に対処するために,TIGERを提案する。Tyos Identity, Geometry, gEnerative pRiors for high-quality FVR。
具体的には、主観的識別的埋め込みを潜伏空間に注入し、被写体を深刻な劣化に対して効果的に固定することで、アイデンティティ優先が確立される。
そして、動的ビデオに対して時間的に一貫した構造的ガイダンスを提供するため、TIGERは、2D参照キューをアンタングルされた3Dパラメータ空間に持ち上げ、ソース間のパラメータ融合を通じて幾何学的アンカーを生成することにより、Geometry Priorを構築する。
さらに,リアリズムを損なうことなく最大効率を達成するために,映像生成モデルの生成優先を1ステップの補正フローで活用する。
さらに, 構造的忠実度, テクスチャ再構築, 分布レベルリアリズムを改良し, 堅牢性を確保する3段階学習最適化戦略を設計する。
また、ロバストなトレーニングと標準化された評価を容易にするために、大規模なFVRデータセットを構築した。
広範囲にわたる実験により、TIGERは恒常性と時間的安定性の両方において最先端の性能を達成し、高品質で効率的かつ恒常的なFVRを提供することを示した。
プロジェクトページ: https://yzhoulv.github.io/Tiger/。
関連論文リスト
- SGR-OCC: Evolving Monocular Priors for Embodied 3D Occupancy Prediction via Soft-Gating Lifting and Semantic-Adaptive Geometric Refinement [9.891265334631889]
3Dセマンティック占有予測は、具現化されたAIの基盤である。
我々は,SGR-OCC(Soft-Gating and Ray-Refinement Occupancy)を提案する。
局所予測タスクでは、SGR-OCCは58.55$%の完了IoUと49.89$%のセマンティックmIoUを達成し、それぞれ3.65$%と3.69$%の前のベストメソッドであるEmbodiedOcc++を上回っている。
論文 参考訳(メタデータ) (2026-03-14T18:45:03Z) - FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation [50.71369329585773]
フェースレベルでメッシュを生成する新しいAutoregressive AutoencoderフレームワークであるFACEを紹介する。
当社のワンフェイスワンツーケン戦略は、メッシュの基本構築ブロックである三角形の面を、単一の統一トークンとして扱います。
FACEは、標準ベンチマークで最先端の再構築品質を達成する。
論文 参考訳(メタデータ) (2026-03-02T06:47:15Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z) - Towards Geometry-Aware and Motion-Guided Video Human Mesh Recovery [60.51998732898099]
HMRMambaは3Dヒューマンメッシュリカバリのための新しいパラダイムである。
構造状態空間モデル(Structured State Space Models)をその効率性と長距離モデリングに利用した先駆者である。
まず、新しいデュアルスキャンのMambaアーキテクチャを特徴とするGeometry-Aware Lifting Moduleについて述べる。
論文 参考訳(メタデータ) (2026-01-29T08:05:02Z) - StdGEN++: A Comprehensive System for Semantic-Decomposed 3D Character Generation [57.06461272772509]
StdGEN++は、多種多様な入力から高忠実で意味的に分解された3D文字を生成するための、新しく包括的なシステムである。
最先端の性能を達成し、幾何学的精度と意味的絡み合いにおいて既存の手法を著しく上回っている。
結果として、非破壊的な編集、物理学に準拠したアニメーション、視線追跡など、より進んだ下流の機能をアンロックする。
論文 参考訳(メタデータ) (2026-01-12T15:41:27Z) - CodeFormer++: Blind Face Restoration Using Deformable Registration and Deep Metric Learning [1.1666234644810893]
CodeFormer++は、アイデンティティを保ちながら、高品質な顔復元のための生成前駆体の有用性を最大化する、新しいフレームワークである。
筆者らは,(1) 生成顔と復元顔とを意味的に整合させる学習型変形可能な顔登録モジュール,(2) 生成顔のテクスチャを動的に抽出し,保存した顔の質を高めるためのテクスチャガイド付き復元ネットワーク,(3) 情報的正負のサンプルとBFRの深部メートル法学習の統合により,識別・保存・生成機能の融合を図る。
論文 参考訳(メタデータ) (2025-10-06T00:53:50Z) - Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations [131.33758144860988]
アイデンティティ保存型テキスト・ツー・ビデオ(IPT2V)生成は、一貫した人間のアイデンティティを持つ高忠実度ビデオを作成することを目的としている。
現在のエンドツーエンドフレームワークは、重要な空間的・時間的トレードオフを被る。
本稿では,表現をレイアウトの空間的特徴と運動力学の時間的特徴に分解する,シンプルで効果的な空間時空間分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-07T06:54:44Z) - ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning [57.91881829308395]
AIポートレートや広告といった幅広いアプリケーションシナリオのために、ID-T2I(ID-preserving text-to-image generation)が注目されている。
我々は,ID-T2I性能を向上させるための一般的なフィードバック学習フレームワークである textbfID-Aligner を提案する。
論文 参考訳(メタデータ) (2024-04-23T18:41:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。