論文の概要: Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal
- arxiv url: http://arxiv.org/abs/2608.20212v1
- Date: Thu, 20 Aug 2026 16:10:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.632614
- Title: Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal
- Title(参考訳): レンズをアンウォープする: 物理界のアプローチによるビデオグラスの除去
- Abstract要約: 大規模な生成前駆体は、静止画の塗布による眼鏡の除去において有望であることが示されている。
生成前の知覚的性質に対処する新しい伝達フレームワークを提案する。
提案手法は,27.68FPSの推論速度を維持しつつ,高い忠実度と構造精度を実現する。
- 参考スコア(独自算出の注目度): 14.477197847602207
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-fidelity removal of eyeglasses from video is a major challenge in facial attribute editing, as the underlying facial geometry is often obscured by complex refractive distortions and view-dependent specular reflections. While large-scale generative priors have shown promise in eye-glasses removal via static image inpainting, they often lack the structural constraints necessary to maintain identity, expression, and pose, leading to visible "identity drift" in both static images and dynamic sequences. In this paper, we propose a novel transfer framework that addresses the stochastic nature of generative priors. Our pipeline first extracts high-fidelity synthetic face images from a commercial-grade generative model (Nano Banana, Gemini 3 Pro Image), regularizes them via a three-stage structural filtering process to preserve identity, expression, and pose, and finally applies physically-based simulation of lens optics during training to provide diverse, paired data. This process transfers Nano Banana's photo-realistic, multi-view knowledge into a specialized restoration architecture, JFSnet (Joint Feature-Spatial network). JFSnet integrates DINOv2-based semantic features with a convolutional decoder for spatial reconstruction, leveraging translation equivariance constraints to improve temporal consistency and high-frequency detail preservation. Evaluations on the curated Flickr-Faces-HQ (FFHQ) subset (12,163 images) show that our approach achieves high fidelity and structural accuracy, while maintaining inference speed of 27.68 FPS. In perceptual studies on CelebV-Text video sequences, our results are consistently preferred over diffusion and GAN-based baselines for ocular consistency, temporal stability, and overall restoration quality.
- Abstract(参考訳): 映像から眼鏡を高忠実に除去することは、顔属性の編集において大きな課題である。
大規模な生成前駆体は、静的画像の塗布による眼鏡の除去を約束しているが、それらはアイデンティティ、表現、ポーズを維持するのに必要な構造的制約を欠くことが多く、静的画像と動的シーケンスの両方で見える「アイデンティティドリフト」につながっている。
本稿では,生成前の確率的性質に対処する新しい転送フレームワークを提案する。
我々のパイプラインはまず,市販の合成顔画像(Nano Banana, Gemini 3 Pro Image)から高忠実度合成顔画像を抽出し,それらを3段階構造フィルタリングプロセスで正規化し,個人性,表情,ポーズを保存し,最終的には,多彩なペアリングデータを提供するためのトレーニング中にレンズ光学の物理的シミュレーションを適用した。
このプロセスは、Nano Bananaのフォトリアリスティックでマルチビューの知識を、特別な復元アーキテクチャであるJSSnet(Joint Feature-Spatial Network)に転送する。
JFSnetはDINOv2ベースのセマンティック機能と空間再構成のための畳み込みデコーダを統合し、変換等価制約を活用して時間的一貫性と高周波詳細保存を改善する。
Flickr-Faces-HQ (FFHQ) サブセット (12,163 画像) の評価の結果,提案手法は27.68 FPS の推論速度を維持しつつ,高い忠実度と構造的精度を実現していることがわかった。
CelebV-Text ビデオシーケンスの知覚的研究では,眼の一貫性,時間的安定性,全体的な回復品質に対する拡散と GAN ベースのベースラインよりも常に優先される。
関連論文リスト
- Integrated Forward-Inverse Network for Lensless Image Reconstruction [9.610123731413415]
IFIN(Integrated Forward-Inverse Network)は、物理誘導型アーキテクチャで、各スケールで学習可能な逆更新によって、異なる前方投影をインターリーブする。
IFINは、挑戦的なレンズレスベンチマークで最先端の再構築品質を達成する。
論文 参考訳(メタデータ) (2026-07-06T02:28:30Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z) - InpaintHuman: Reconstructing Occluded Humans with Multi-Scale UV Mapping and Identity-Preserving Diffusion Inpainting [64.42884719282323]
InpaintHumanは、モノクロビデオから高忠実で完全でアニマタブルなアバターを生成する新しい方法である。
我々のアプローチは、アイデンティティの忠実性を保証するために、直接ピクセルレベルの監視を採用する。
論文 参考訳(メタデータ) (2026-01-05T13:26:02Z) - VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement [51.83206132052461]
ビデオ顔強調(VFE)は、劣化したビデオシーケンスから高品質な顔領域を再構築することを目指している。
ビデオの超解像と生成フレームワークに依存する現在の手法は、3つの根本的な課題に直面している。
ビデオ・フェイス・エンハンスメントのための新規かつ効率的なワンステップ拡散フレームワークであるVividFaceを提案する。
論文 参考訳(メタデータ) (2025-09-28T02:39:48Z) - DicFace: Dirichlet-Constrained Variational Codebook Learning for Temporally Coherent Video Face Restoration [24.004683996460685]
ビデオ顔の復元は、劣化した入力から顔の詳細を回復しながら、時間的一貫性を維持する上で重要な課題に直面します。
本稿では,Vector-Quantized Variational Autoencoders (VQ-VAEs) をビデオ復元フレームワークに拡張する手法を提案する。
論文 参考訳(メタデータ) (2025-06-16T10:54:28Z) - VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping [43.30061680192465]
ビデオ・フェイス・スワップに特化して設計された初めての拡散型フレームワークを提案する。
提案手法は,VidFaceVAEと組み合わせた特殊設計拡散モデルである。
本フレームワークは,従来の手法と比較して,アイデンティティの保存,時間的整合性,視覚的品質において優れた性能を発揮する。
論文 参考訳(メタデータ) (2024-12-15T18:58:32Z) - MultiDiff: Consistent Novel View Synthesis from a Single Image [60.04215655745264]
MultiDiffは、単一のRGB画像からシーンを一貫した新しいビュー合成のための新しいアプローチである。
以上の結果から,MultiDiffは,課題の多いリアルタイムデータセットであるRealEstate10KとScanNetにおいて,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-06-26T17:53:51Z) - DiffFAE: Advancing High-fidelity One-shot Facial Appearance Editing with Space-sensitive Customization and Semantic Preservation [84.0586749616249]
本稿では,高忠実度顔画像編集に適した1段階かつ高効率な拡散ベースフレームワークDiffFAEを提案する。
高忠実度クエリ属性転送には、空間感性物理カスタマイズ(SPC)を採用し、忠実度と一般化能力を保証している。
ソース属性を保存するために、Regional-responsive Semantic Composition (RSC)を導入する。
このモジュールは、切り離されたソースを無視する特徴を学習するためにガイドされ、髪、服、背景などの非顔的属性からアーティファクトを保存し緩和する。
論文 参考訳(メタデータ) (2024-03-26T12:53:10Z) - CLR-Face: Conditional Latent Refinement for Blind Face Restoration Using
Score-Based Diffusion Models [57.9771859175664]
最近の生成優先法は、有望なブラインドフェイス修復性能を示している。
入力に忠実なきめ細かい顔の詳細を生成することは、依然として難しい問題である。
本稿では,VQGANアーキテクチャの内部に拡散型プライマーを導入し,非破壊な潜伏埋め込みにおける分布の学習に重点を置いている。
論文 参考訳(メタデータ) (2024-02-08T23:51:49Z) - High-resolution Face Swapping via Latent Semantics Disentanglement [50.23624681222619]
本稿では,事前学習したGANモデルの事前知識を用いた,新しい高分解能幻覚顔交換法を提案する。
我々は、ジェネレータの進行的な性質を利用して、潜在意味論を明示的に解き放つ。
我々は,2時間制約を潜時空間と画像空間に課すことにより,映像面スワップに拡張する。
論文 参考訳(メタデータ) (2022-03-30T00:33:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。