論文の概要: Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation
- arxiv url: http://arxiv.org/abs/2608.30951v1
- Date: Mon, 31 Aug 2026 15:22:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.477245
- Title: Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation
- Title(参考訳): 完全視力保存による3次元対話顔生成のための音声駆動型対向防御
- Abstract要約: 音声駆動型3次元音声合成のための非受容型音声防御法を提案する。
音声信号の知覚的マスキング領域内の保護的摂動を隠蔽するために,精神音響マスキングを利用する。
- 参考スコア(独自算出の注目度): 25.267385523244872
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The rapid development of generative portrait models has raised growing concerns about privacy leakage and identity misuse. In particular, audio-driven 3D talking face generation can reconstruct a reusable 3D portrait of a target person from a monocular video and animate it with arbitrary speech, making realistic identity impersonation alarmingly practical. Existing proactive defenses mainly operate in the visual domain by injecting subtle perturbations into acial regions to disrupt identity acquisition. However, such perturbations often compromise visual quality due to the strong structural priors and social sensitivity of human faces, and are easily weakened by common real-world transformations such as resizing. To overcome these limitations, we propose an imperceptible audio defense for audio-driven 3D talking face generation by shifting protection from the visual modality to the audio modality. Specifically,we exploit psychoacoustic masking to hide protective perturbations within perceptually masked frequency regions of the speech signal, thereby reducing perceptual distortion while suppressing reliable facial animation. Extensive experiments demonstrate that the proposed method effectively degrades 3D talking face generation while preserving favorable perceptual quality. These findings highlight psychoacoustically guided audio perturbations as a practical and promising direction for privacy-preserving portrait protection.
- Abstract(参考訳): ジェネレーティブ・ポートレート・モデルの急速な発展は、プライバシーの漏洩やアイデンティティの誤用に対する懸念が高まっている。
特に、音声駆動の3D通話顔生成は、モノクロ映像から対象者の再利用可能な3D肖像画を再構成し、任意の音声でアニメーション化することにより、現実的なアイデンティティの偽造を驚くほど現実的にすることができる。
既存のプロアクティブディフェンスは主に視覚領域で活動し、微妙な摂動をアシアル領域に注入してアイデンティティ獲得を妨害する。
しかし、このような摂動はしばしば人間の顔の強い構造的先行と社会的感受性のために視覚的品質を損なうことが多く、リサイズのような一般的な現実世界の変換によって容易に弱められる。
これらの制約を克服するために,視覚的モダリティから音声的モダリティへ保護をシフトさせることにより,音声駆動型3D音声顔生成のための知覚不可能なオーディオディフェンスを提案する。
具体的には、心理音響マスクを用いて、音声信号の知覚的マスキング周波数領域における保護的摂動を隠蔽し、信頼性の高い顔のアニメーションを抑えながら知覚的歪みを低減する。
広汎な実験により, 提案手法は, 良好な知覚品質を維持しつつ, 3次元発話顔生成を効果的に劣化させることを示した。
これらの知見は、プライバシー保護のための実用的で有望な方向として、精神音響学的に誘導された音声摂動を浮き彫りにする。
関連論文リスト
- Transferable Adversarial Facial Images for Privacy Protection [15.211743719312613]
視覚的品質を維持しつつ、転送性を改善した新しい顔プライバシー保護方式を提案する。
生成モデルの潜在空間をトラバースするために,まずグローバルな逆潜時探索を利用する。
次に、視覚的アイデンティティ情報を保存するための重要なランドマーク正規化モジュールを導入する。
論文 参考訳(メタデータ) (2024-07-18T02:16:11Z) - Talk3D: High-Fidelity Talking Portrait Synthesis via Personalized 3D Generative Prior [29.120669908374424]
本研究では,Talk3Dと呼ばれる新しい音声駆動音声ヘッド合成フレームワークを提案する。
予め訓練された3D認識生成前を効果的に活用することにより、そのもっともらしい顔のジオメトリを忠実に再構築することができる。
提案手法は,既存の手法と比較して,極端な頭部ポーズ下であっても,現実的な顔のジオメトリーの生成に優れる。
論文 参考訳(メタデータ) (2024-03-29T12:49:40Z) - Identity-Preserving Talking Face Generation with Landmark and Appearance
Priors [106.79923577700345]
既存の人物生成法は、現実的でリップ同期のビデオを生成するのに困難である。
本稿では,ランドマーク生成とランドマーク・ツー・ビデオレンダリングによる2段階のフレームワークを提案する。
提案手法は,既存の対人顔生成法よりも現実的で,リップシンクで,アイデンティティを保ったビデオを生成することができる。
論文 参考訳(メタデータ) (2023-05-15T01:31:32Z) - Pose-Controllable 3D Facial Animation Synthesis using Hierarchical
Audio-Vertex Attention [52.63080543011595]
階層型音声頂点アテンションを利用してポーズ制御可能な3次元顔アニメーション合成法を提案する。
提案手法により,よりリアルな表情と頭部姿勢運動が得られる。
論文 参考訳(メタデータ) (2023-02-24T09:36:31Z) - GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face
Synthesis [62.297513028116576]
GeneFace は、汎用的で高忠実な NeRF ベースの話し顔生成法である。
ヘッド・トルソ問題を解消するために,ヘッド・アウェア・トルソ・NeRFを提案する。
論文 参考訳(メタデータ) (2023-01-31T05:56:06Z) - CodeTalker: Speech-Driven 3D Facial Animation with Discrete Motion Prior [27.989344587876964]
音声駆動の3D顔アニメーションは広く研究されているが、現実主義と鮮明さを達成するにはまだまだギャップがある。
本稿では,学習したコードブックの有限プロキシ空間において,音声による顔のアニメーションをコードクエリタスクとしてキャストすることを提案する。
提案手法は, 定性的かつ定量的に, 現在の最先端手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-01-06T05:04:32Z) - Imitator: Personalized Speech-driven 3D Facial Animation [63.57811510502906]
State-of-the-artメソッドは、ターゲットアクターの顔トポロジを変形させ、ターゲットアクターのアイデンティティ固有の話し方や顔の慣用性を考慮せずに入力オーディオを同期させる。
本稿では,音声による表情合成手法であるImitatorについて述べる。
提案手法は,ターゲットアクターの発話スタイルを保ちながら,入力音声から時間的コヒーレントな表情を生成する。
論文 参考訳(メタデータ) (2022-12-30T19:00:02Z) - FaceFormer: Speech-Driven 3D Facial Animation with Transformers [46.8780140220063]
音声駆動の3D顔アニメーションは、人間の顔の複雑な形状と、3Dオーディオ視覚データの利用が制限されているため、難しい。
本研究では,トランスフォーマーをベースとした自動回帰モデルFaceFormerを提案し,長期音声コンテキストを符号化し,アニメーション3D顔メッシュのシーケンスを自動回帰予測する。
論文 参考訳(メタデータ) (2021-12-10T04:21:59Z) - Image-to-Video Generation via 3D Facial Dynamics [78.01476554323179]
静止画像から様々な映像を生成するために多目的モデルであるFaceAnimeを提案する。
私たちのモデルは、顔ビデオや顔ビデオの予測など、さまざまなAR/VRやエンターテイメントアプリケーションに汎用的です。
論文 参考訳(メタデータ) (2021-05-31T02:30:11Z) - Pose-Controllable Talking Face Generation by Implicitly Modularized
Audio-Visual Representation [96.66010515343106]
ポーズ制御可能な発話顔を生成するためのクリーンで効果的なフレームワークを提案する。
我々は1枚の写真のみを識別基準として生の顔画像を操作する。
私達のモデルに極度な視野の堅牢性および話す表面前部化を含む複数の高度の機能があります。
論文 参考訳(メタデータ) (2021-04-22T15:10:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。