論文の概要: AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation
- arxiv url: http://arxiv.org/abs/2605.02948v2
- Date: Fri, 08 May 2026 17:11:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 16:31:22.731126
- Title: AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation
- Title(参考訳): AsymTalker:非対称蒸留による恒常的長期トーキングヘッド生成
- Authors: Yuxin Lu, Qian Qiao, Jiayang Sun, Guibo Zhu, Min Cao,
- Abstract要約: AsymTalkerは,新しい拡散型音声ヘッド生成法である。
静的アイデンティティイメージを時間的コヒーレントな潜在表現に変換することにより、時間的空間的ミスアライメントを緩和する。
600秒のビデオで高忠実でアイデンティティに一貫性のある合成を保証し、66FPSのリアルタイム推論速度に達する。
- 参考スコア(独自算出の注目度): 13.60100129586038
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion-based talking head generation has achieved remarkable visual quality, yet scaling it to long-term videos remains challenging. The widely adopted chunk-wise paradigm introduces two fundamental failures: (1) temporal-spatial misalignment between static identity references and dynamic audio streams, and (2) cascading identity drift propagated through self-generated continuity references across chunks. To address both issues, we propose AsymTalker, a novel diffusion-based talking head generation method comprising Temporal Reference Encoding (TRE) and Asymmetric Knowledge Distillation (AKD). First, TRE mitigates temporal-spatial misalignment by transforming the static identity image into a temporally coherent latent representation through encoding of a temporally replicated pseudo-video, without introducing additional parameters. Second, AKD resolves the inherent conditioning dilemma in chunk-wise training: using ground-truth references causes train-inference mismatch, while self-generated references entangle supervision with identity drift. Our asymmetric design circumvents this by anchoring the teacher model with ground-truth continuity references to provide drift-free, chunk-level supervision, thereby avoiding the teacher bottleneck. Meanwhile, the student model learns under inference-aligned conditions, conditioned only on self-generated references, and is trained via distribution matching to preserve identity over long horizons. Extensive experiments show AsymTalker achieves state-of-the-art results on HDTF and VFHQ. It guarantees high-fidelity, identity-consistent synthesis over 600-second videos and reaches a real-time inference speed of 66 FPS.
- Abstract(参考訳): 拡散に基づく音声ヘッド生成は目覚ましい視覚的品質を達成したが、それを長期ビデオに拡張することは依然として困難である。
広範に採用されているチャンクワイドパラダイムは,(1)静的なアイデンティティ参照と動的オーディオストリームの時間空間的ミスアライメント,(2)チャンク間の自己生成的連続性参照によって伝播するカスケードアイデンティティドリフトの2つの基本的障害を導入している。
両問題に対処するため,時間参照符号化(TRE)と非対称知識蒸留(AKD)を組み合わせた新しい拡散型音声ヘッド生成法であるAsymTalkerを提案する。
まず、TREは、時間的に複製された擬似ビデオのエンコーディングを通じて、静的なアイデンティティイメージを時間的に一貫性のある潜在表現に変換することにより、時間的空間的ミスアライメントを緩和する。
第二に、AKDはチャンクワイドトレーニングにおいて固有の条件付きジレンマを解消する。
我々の非対称設計は、教師モデルに地道連続性参照を固定することにより、ドリフトフリーでチャンクレベルの監督を提供し、教師のボトルネックを回避することでこれを回避している。
一方、学生モデルは、自己生成参照のみに条件付けされた推論整合条件下で学習し、分散マッチングにより、長い地平線上のアイデンティティを保持するように訓練される。
大規模な実験により、AsymTalkerはHDTFとVFHQで最先端の結果を得ることができた。
600秒のビデオで高忠実でアイデンティティに一貫性のある合成を保証し、66FPSのリアルタイム推論速度に達する。
関連論文リスト
- OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising [52.237486207964245]
HiARは階層的なデノベーションフレームワークで、従来の世代順を逆転させる。
発声ステップ毎に全てのブロックを因果生成し、各ブロックが常に同じノイズレベルでコンテキストで条件付けされるようにする。
VBench(20世代)では、HiARは比較したすべての方法の中で最高の総合スコアと最低時間ドリフトを達成する。
論文 参考訳(メタデータ) (2026-03-09T17:58:16Z) - TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation [0.0]
本稿では,参照条件付き潜在拡散フレームワークであるTempoSyncDiffを紹介する。
効率的な音声駆動音声ヘッド生成のための数ステップの推論を探索する。
このフレームワークはアイデンティティアンカーと、アイデンティティドリフトとフレーム間フリックを緩和するために設計された時間的正規化を備えている。
論文 参考訳(メタデータ) (2026-03-06T09:09:01Z) - EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation [8.795438456031512]
マルチモーダル生成モデルは、高い視覚的品質を達成するが、その禁止されたレイテンシと時間的安定性は、リアルタイムなデプロイメントを妨げている。
ストリーミング推論はこれらの問題を悪化させ、ぼやけ、時間的ドリフト、唇のデクロナイゼーションといったマルチモーダルな曖昧さが顕著になる。
複数教師による異なる嗜好領域の事前学習モデルを微調整し、適応MDD(ACCDMD)は、スケジュールを介して段階的に音のCFG劣化誤差を校正する、Long Hybrid Tailは、長い水平自転期間に尾フレームのみにアライメントを強制する。
論文 参考訳(メタデータ) (2026-02-14T08:32:38Z) - Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy [39.04292189640444]
Harmonyは、機械的に音声と視覚の同期を強制する新しいフレームワークである。
それは新しい最先端技術を確立し、生成忠実度と重要な点の両方において既存の方法よりもはるかに優れており、きめ細かいオーディオと視覚の同期を実現している。
論文 参考訳(メタデータ) (2025-11-26T16:53:05Z) - Towards One-step Causal Video Generation via Adversarial Self-Distillation [71.30373662465648]
最近のハイブリッドビデオ生成モデルは、自己回帰時間力学と拡散に基づく空間認知を組み合わせている。
我々のフレームワークは、複数の推論ステップ設定を柔軟にサポートする単一の蒸留モデルを生成する。
論文 参考訳(メタデータ) (2025-11-03T10:12:47Z) - READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation [55.58089937219475]
本稿では,最初のリアルタイム拡散変換器を用いた音声ヘッド生成フレームワークREADを提案する。
提案手法はまず,VAEを用いて高度に圧縮されたビデオ潜時空間を学習し,音声生成におけるトークン数を大幅に削減する。
また,READは,実行時間を大幅に短縮した競合する音声ヘッドビデオを生成することにより,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-05T13:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。