論文の概要: UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
- arxiv url: http://arxiv.org/abs/2608.11752v2
- Date: Thu, 13 Aug 2026 06:23:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.781502
- Title: UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
- Title(参考訳): UniSwap: ビデオストリーミングのためのオーディオとビジュアルのアイデンティティスワップ
- Abstract要約: 講演ビデオにおける音声と視覚の相互同一性をストリーミングする最初のフレームワークであるUniSwapについて紹介する。
実験では、強い音声と視覚の同期、競争力のあるアイデンティティ保存、効率的なストリーミング、安定したロングフォーム生成が示される。
- 参考スコア(独自算出の注目度): 23.032949794607106
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Talking-video character replacement requires coordinated transfer of appearance and voice while preserving the source motion, scene, linguistic content, and audio-video timing. Existing methods use separately optimized models for the two modalities, making audio-visual consistency difficult to enforce. We present UniSwap, the first framework for streaming joint audio-visual identity replacement in talking videos. Given a source video, a reference image, and a reference voice clip, UniSwap transfers the reference appearance and vocal timbre within a single audio-visual diffusion transformer while preserving the source content and dynamics. To address the scarcity of aligned cross-identity training pairs, we introduce a swap-and-reconstruct pipeline that removes visual and vocal identity from real clips and uses the original clips as reconstruction targets. Starting from a bidirectional backbone, we progressively adapt the model through In-context Pretraining for joint replacement, Conditional Streaming Adaptation for block-causal KV-cached generation, and Efficient Self-forcing DMD for mitigating exposure bias and reducing sampling from 30 to 3 denoising steps per block. Efficient Multi-LoRA Switching enables the three DMD roles to share a single frozen backbone. Feature-RoPE Decomposition keeps cached positions within the training range, supporting stable long-form inference. Experiments demonstrate strong audio-visual synchronization, competitive identity preservation, efficient streaming, and stable long-form generation.
- Abstract(参考訳): トーキング・ビデオ・キャラクタの置き換えには、ソースの動き、シーン、言語内容、オーディオ・ビデオのタイミングを保存しながら、外観と音声の協調的な転送が必要である。
既存の方法は2つのモードに対して個別に最適化されたモデルを使用するため、音声と視覚の一貫性を強制することは困難である。
講演ビデオにおける音声と視覚の相互同一性をストリーミングする最初のフレームワークであるUniSwapについて紹介する。
ソースビデオ、参照画像、参照音声クリップが与えられた場合、UniSwapは、ソースの内容とダイナミクスを保存しながら、単一のオーディオ-視覚拡散変換器内に参照の外観と声の音色を転送する。
協調したクロスアイデンティティトレーニングペアの不足に対処するため,実際のクリップから視覚的および声道的アイデンティティを取り除き,元のクリップを再構成ターゲットとして使用するスワップ・アンド・リコンストラクト・パイプラインを導入する。
両方向のバックボーンから始めると、共同置換のためのインコンテキスト事前訓練、ブロック因果KVキャッシュ生成のための条件付きストリーミング適応、露出バイアスを緩和し、ブロック毎の30から3段階のサンプリングを削減できる効率的な自己強制MDDにより、モデルを段階的に適応する。
効率的なMulti-LoRAスイッチングにより、3つのMDDロールが単一の冷凍バックボーンを共有することができる。
Feature-RoPE Decompositionはトレーニング範囲内にキャッシュされた位置を保持し、安定したロングフォーム推論をサポートする。
実験では、強い音声と視覚の同期、競争力のあるアイデンティティ保存、効率的なストリーミング、安定したロングフォーム生成が示される。
関連論文リスト
- OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation [73.57253966578186]
OmniVAEは、音声とビデオの潜伏表現の微粒なセマンティックアライメントを学習する、共同で訓練されたオーディオビデオVAEである。
実験により、両方の目的が常に潜在空間の学習性を改善することが示された。
論文 参考訳(メタデータ) (2026-07-26T21:51:28Z) - UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating [60.20680928161925]
LTX-2.3上に構築されたメモリ駆動型マルチショットオーディオビデオ生成システムであるUnityShotsを紹介する。
ビデオストリームは、2つの固定サイズスロットと、開口ショットに固定された長期メモリ(LTM)スロットと、直前のテールを保持する短期メモリ(STM)スロットとを保持する。
音声ストリームは、ショット毎に基準話者トークンを注入し、スライド音声バンクを介さずに声の音色を保存する。
論文 参考訳(メタデータ) (2026-06-19T18:06:15Z) - DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization [16.192222723269925]
ビデオダビングは、映画製作、マルチメディア制作、補助音声技術に広く応用されている。
既存のアプローチでは、限られたダビングデータセットを直接トレーニングするか、事前トレーニングされたテキスト音声(TTS)モデルに適応する2段階のパイプラインを採用する。
本稿では,事前学習したTSモデルからビデオ駆動ダビングへの知識伝達を効果的に行う,新しい2段階トレーニングフレームワークであるDiFlowDubberを提案する。
2つの主要なベンチマークデータセットの実験では、DiFlowDubberは、複数のメトリクスで過去のメソッドより優れていることが示されている。
論文 参考訳(メタデータ) (2026-03-15T07:53:23Z) - ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA [63.95311560556552]
既存のビデオパーソナライズ手法は、視覚的類似性を保ちながら、ビデオとオーディオを別々に扱う。
被験者の外観と音声を1つのモデルで共同生成するID-LoRAを提案する。
人間の嗜好研究において、ID-LoRA は Kling 2.6 Pro よりも 73% のアノテータが音声に類似し、65% が話し方で好まれる。
論文 参考訳(メタデータ) (2026-03-10T22:23:36Z) - UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions [34.27531187147479]
UniAVGenは、ジョイントオーディオとビデオ生成のための統一されたフレームワークである。
UniAVGenは、オーディオオーディオ同期、音色、感情の一貫性において全体的なアドバンテージを提供する。
論文 参考訳(メタデータ) (2025-11-05T10:06:51Z) - Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback [9.569613635896026]
任意の長さの音声ビデオを生成するための拡散変換器(DiT)ベースのフレームワークを提案する。
また,マルチキャラクタ・オーディオ駆動アニメーションの学習自由化手法についても紹介する。
実験により,本手法は既存の最先端手法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-10-14T02:50:05Z) - StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing [63.72095377128904]
視覚的ダビングタスクは、運転音声と同期した口の動きを生成することを目的としている。
音声のみの運転パラダイムは、話者固有の唇習慣を不十分に捉えている。
Blind-inpaintingアプローチは、障害を処理する際に視覚的なアーティファクトを生成する。
論文 参考訳(メタデータ) (2025-09-26T05:23:31Z) - StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation [91.45910771331741]
オーディオ駆動型アバタービデオ生成のための現在の拡散モデルでは、自然な音声同期とアイデンティティの整合性を備えた長ビデオの合成が困難である。
本稿では,無限長高画質映像を後処理なしで合成する最初のエンドツーエンドビデオ拡散変換器であるStableAvatarについて述べる。
論文 参考訳(メタデータ) (2025-08-11T17:58:24Z) - MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation [21.216297567167036]
MirrorMeは、LTXビデオモデル上に構築されたリアルタイムで制御可能なフレームワークである。
MirrorMeは映像を空間的に時間的に圧縮し、効率的な遅延空間をデノイングする。
EMTDベンチマークの実験では、MirrorMeの忠実さ、リップシンク精度、時間的安定性が実証されている。
論文 参考訳(メタデータ) (2025-06-27T09:57:23Z) - MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation [55.95148886437854]
メモリ誘導EMO (Memory-guided EMOtion-aware diffusion) は、音声による映像を生成するエンドツーエンドのポートレートアニメーション手法である。
MEMOは、多様な画像とオーディオタイプ、全体的な品質、オーディオ-リップ同期、アイデンティティの整合性、表現-感情アライメントにおいて、よりリアルな会話ビデオを生成する。
論文 参考訳(メタデータ) (2024-12-05T18:57:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。