論文の概要: IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
- arxiv url: http://arxiv.org/abs/2605.30230v1
- Date: Thu, 28 May 2026 17:00:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.565226
- Title: IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
- Title(参考訳): IP-Adapterは、微調整不要な拡散型音声生成システム
- Authors: Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang,
- Abstract要約: 安定拡散とIP-アダプタの事前訓練による重み付けにより,直接音声合成を行うファインタニングフリーのパラダイムを提案する。
本手法はリップシンク精度と視覚的忠実度の両方において既存のSOTA手法より優れる。
- 参考スコア(独自算出の注目度): 28.582878502096666
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid advancement of diffusion models, talking face generation has made remarkable progress. However, existing diffusion-based methods still require task-specific fine-tuning and large-scale audiovisual datasets, resulting in high computational costs that hinder scalability and accessibility of diffusion-based approaches across the research community. To address this, we propose a finetuning-free paradigm that directly performs talking face generation using the pretrained weights of Stable Diffusion and IP-Adapter. This backbone leverages the visual embedding capability of IP-Adapter to mine lip-related semantics from the pretrained Stable Diffusion. To address the challenges of identity drift, synchronization errors, and temporal instability, we also design three trainable-parameterfree components: (1) the Structurist, which explicitly disentangles and reassembles lip and appearance features to mitigate identity drift and appearance distortion; (2) the Structure Controller, which adaptively refines embeddings based on quasi-monotonic motion trends for precise lip synchronization; and (3) the Noise Sensor, which introduces Gaussian prior to detect and suppress flicker and jitter artifacts and enhance temporal consistency. Experimental results show that our method outperforms existing SOTA approaches in both lip-sync accuracy (at least 0.16 gain in PCLD) and visual fidelity (at least 0.7 improvement in FID), establishing a novel fine-tuning-free diffusion framework for talking face generation.
- Abstract(参考訳): 拡散モデルの急速な進歩により、話し顔の生成は顕著な進歩を遂げた。
しかし、既存の拡散ベースの手法は依然としてタスク固有の微調整と大規模オーディオヴィジュアルデータセットを必要とするため、研究コミュニティ全体の拡散ベースのアプローチのスケーラビリティとアクセシビリティを阻害する計算コストが高い。
そこで本研究では,安定拡散とIP-アダプタの事前学習重みを用いた音声生成を直接行うファインタニングフリーなパラダイムを提案する。
このバックボーンは、IP-Adapterの視覚的埋め込み機能を利用して、事前訓練された安定拡散から唇関連セマンティクスをマイニングする。
同一性ドリフト, 同期誤差, 時間的不安定性の課題に対処するため, 1) 識別ドリフト, 外観歪みを緩和するため, 唇と外観の特徴を明示的に分解・再組み立てするStructurist, (2) 擬似モノトニックな動きの傾向に基づく埋め込みを適応的に洗練するStructurist, (3) フレッカやジッタのアーチファクトの検出・抑制に先立ってガウス的を導入するノイズセンサ, の3つのトレーニング可能なパラメータフリーコンポーネントを設計した。
実験結果から,本手法はリップシンク精度(PCLDでは0.16以上,FIDでは0.7以上)と視覚的忠実度(FIDでは0.7以上)の両方において既存のSOTA手法よりも優れており,会話顔生成のための新たな微調整自由拡散フレームワークが確立されている。
関連論文リスト
- Bridging Restoration and Generation Manifolds in One-Step Diffusion for Real-World Super-Resolution [22.963799508399365]
最近の単一段階蒸留は推論を加速するが、認識歪んだトレードオフに直面している。
実時間ISR(IDaS-SR)の適応的インバージョンと劣化認識サンプリングを提案する。
IDaS-SRは決定論的復元と生成のボトルネックを埋める一段階のフレームワークである。
論文 参考訳(メタデータ) (2026-04-27T07:43:00Z) - V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising [65.5867130156805]
統合JTフレームワークにおける視覚的コデノゲーションの体系的研究であるV-Coについて述べる。
本研究は,視覚的コデノジングを効果的に行うための4つの重要な要素を明らかにする。
V-Coは、基礎となる画素空間拡散ベースラインと強い前の画素拡散法より優れている。
論文 参考訳(メタデータ) (2026-03-17T17:01:54Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation [0.0]
本稿では,参照条件付き潜在拡散フレームワークであるTempoSyncDiffを紹介する。
効率的な音声駆動音声ヘッド生成のための数ステップの推論を探索する。
このフレームワークはアイデンティティアンカーと、アイデンティティドリフトとフレーム間フリックを緩和するために設計された時間的正規化を備えている。
論文 参考訳(メタデータ) (2026-03-06T09:09:01Z) - Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers [55.15722080205737]
Edit2Perceiveは、深度、正規度、マッティングの編集モデルを適応させる統合拡散フレームワークである。
私たちの単一ステップの決定論的推論は、比較的小さなデータセットでトレーニングしながら、より高速なランタイムをもたらす。
論文 参考訳(メタデータ) (2025-11-24T01:13:51Z) - Boosting Fidelity for Pre-Trained-Diffusion-Based Low-Light Image Enhancement via Condition Refinement [63.54516423266521]
事前学習拡散ベース(PTDB)法は、しばしばコンテンツ忠実さを犠牲にして知覚的リアリズムを高める。
本稿では,事前学習した拡散モデルにおける条件付けのための新しい最適化手法を提案する。
我々のアプローチはプラグアンドプレイであり、より効率的な制御を提供するために既存の拡散ネットワークにシームレスに統合される。
論文 参考訳(メタデータ) (2025-10-20T02:40:06Z) - MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation [16.202732894319084]
MoDiT は 3D Morphable Model (3DMM) と Diffusion-based Transformer を組み合わせた新しいフレームワークである。
i) 時間的注意と偏りのある自己/横断的意識のメカニズムを改良した階層的認知戦略により, モデルによる唇同期の洗練が可能となった。
2) 空間的制約を明確化し, 正確な3次元インフォームド光流予測を実現するための3次元MM係数の統合。
論文 参考訳(メタデータ) (2025-07-07T15:13:46Z) - ReDDiT: Rehashing Noise for Discrete Visual Generation [53.813067778912]
離散拡散変圧器(終端型ReDDiT)のためのリハッシングノイズアプローチを提案する。
我々は、吸収状態を拡張し、離散拡散モデルの表現能力を向上させることを目的としている。
実験の結果、ReDDiTはベースラインモデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-05-26T08:17:20Z) - One-Step Diffusion Model for Image Motion-Deblurring [85.76149042561507]
本稿では,脱臭過程を1段階に短縮する新しいフレームワークである脱臭拡散モデル(OSDD)を提案する。
拡散モデルにおける忠実度損失に対処するために,構造復元を改善する改良された変分オートエンコーダ(eVAE)を導入する。
提案手法は,実測値と非参照値の両方で高い性能を達成する。
論文 参考訳(メタデータ) (2025-03-09T09:39:57Z) - PiRD: Physics-informed Residual Diffusion for Flow Field Reconstruction [5.06136344261226]
データ忠実度向上のためのCNNベースの手法は、トレーニング期間中の低忠実度データパターンと分布に依存している。
提案したモデルである物理インフォームド残差拡散(Residual Diffusion)は、標準の低忠実度入力からデータの品質を高める能力を示す。
実験結果から, 2次元乱流に対して, 再学習を必要とせず, 高品質な流れを効果的に再現できることが示唆された。
論文 参考訳(メタデータ) (2024-04-12T11:45:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。