論文の概要: STEER: Steerable Dyadic Head Avatars
- arxiv url: http://arxiv.org/abs/2607.23840v1
- Date: Sun, 26 Jul 2026 20:53:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.25045
- Title: STEER: Steerable Dyadic Head Avatars
- Title(参考訳): STEER:ステアブルなダイアドヘッドアバター
- Authors: Kartik Teotia, Helge Rhodin, Hyeongwoo Kim, Marc Habermann, Christian Theobalt,
- Abstract要約: 反応型対話型頭部アバターに先立って制御可能な3次元動的運動であるSTEERを提案する。
STEERは、会話の振る舞いを、視線、ヘッドリズム、感情の明確なコントロールに分解し、ユーザーがアバターの聴き方、反応、会話パートナーとの関わり方を制御できるようにする。
- 参考スコア(独自算出の注目度): 69.46647113012527
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Facial movement and expression are central to face-to-face communication, conveying turn-taking, attention, agreement, and engagement alongside speech. While speech-driven facial animation has made strong progress in lip synchronization and audio-conditioned motion generation, most methods treat conversational behavior as an emergent byproduct of audio, or expose only coarse sequence-level affect control. As a result, key non-verbal channels such as gaze contact and aversion, rhythmic head motion, and emotion remain difficult to explicitly control. We present STEER, a controllable 3D dyadic motion prior for reactive conversational head avatars. STEER factorizes conversational behavior into explicit controls for gaze, head rhythm, and emotion, allowing users to steer how an avatar listens, reacts, and engages with a conversation partner. Since temporally aligned annotations for these behaviors are not available in public dyadic corpora, we introduce a tracking and annotation pipeline that recovers behavioral pseudo-labels from in-the-wild dyadic video. A causal flow-matching transformer then learns partner-aware target motion conditioned on audio, partner motion, emotion and the proposed behavioral controls. We further embed STEER in a photorealistic avatar pipeline by extending a Universal Gaussian Head-Avatar Prior with a learned mapping from tracked parametric motion into its avatar-driving space. This enables controllable animation of high-fidelity Gaussian head avatars without re-training the underlying avatar model. STEER outperforms recent dyadic motion baselines on motion quality, dynamics, and diversity, remains competitive on partner coupling, and enables gaze, head-rhythm, and emotion edits together with an interactive live deployment. We make our code and dataset annotations available at our webpage.
- Abstract(参考訳): 顔の動きと表情は、対面コミュニケーションの中心であり、会話と共にターンテイキング、注意、合意、エンゲージメントを伝達する。
音声による顔のアニメーションは、唇の同期や音声条件の動作生成において大きく進歩しているが、ほとんどの方法は、会話の振る舞いを音声の創発的な副産物として扱うか、粗いシーケンスレベルの感情制御のみを公開する。
その結果, 視線接触や逆転, リズミカル頭部運動, 感情などの非言語チャネルは, 明示的に制御することが困難である。
反応型対話型頭部アバターに先立って制御可能な3次元動的運動であるSTEERを提案する。
STEERは、会話の振る舞いを、視線、ヘッドリズム、感情の明確なコントロールに分解し、ユーザーがアバターの聴き方、反応、会話パートナーとの関わり方を制御できるようにする。
これらの動作に対する時間的整合アノテーションは公的なダイアディックコーパスでは利用できないため、我々は、その場でのダイアディックビデオから振る舞いの擬似ラベルを復元するトラッキングとアノテーションパイプラインを導入する。
因果フローマッチング変換器は、音声、パートナー動作、感情、提案された行動制御に基づいて、パートナー認識された目標運動を学習する。
我々はSTEERをさらに光現実的なアバターパイプラインに埋め込むために、トラックされたパラメトリックな動きから学習されたマッピングをそのアバター駆動空間に拡張する。
これにより、基礎となるアバターモデルを再訓練することなく、高忠実度ガウスヘッドアバターの制御可能なアニメーションが可能になる。
STEERは近年、動きの質、ダイナミクス、多様性を基礎として、パートナーの結合に競争力を持ち、対話的なライブデプロイメントとともに視線、頭リズム、感情の編集を可能にしている。
コードとデータセットのアノテーションをWebページに公開しています。
関連論文リスト
- SARAH: Spatially Aware Real-time Agentic Humans [58.32612596034656]
ストリーミングVRヘッドセット上に展開可能な空間認識型対話動作のための,初のリアルタイム完全因果的手法を提案する。
ユーザの位置とダイアディックな音声を考慮に入れたアプローチでは,エージェントの向きをユーザに応じて調整しながら,ジェスチャーを音声と整列させる全体動作を生成する。
実写VRシステムに対する我々のアプローチを検証し,空間認識型対話エージェントをリアルタイム展開に適用する。
論文 参考訳(メタデータ) (2026-02-20T18:59:35Z) - JoyAvatar: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning [18.72712280434528]
JoyAvatarは長時間のアバタービデオを生成することができるフレームワークである。
そこで本研究では,モデルに固有のテキスト制御性を持たせるための,ツイン教師強化トレーニングアルゴリズムを提案する。
トレーニング中、マルチモーダル条件の強度を動的に調整する。
論文 参考訳(メタデータ) (2026-01-31T13:00:57Z) - Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation [71.38488610271247]
トーキングヘッド生成は、仮想コミュニケーションとコンテンツ生成のための静的ポートレートから、ライフスタイルのアバターを生成する。
現在のモデルは、真の対話的なコミュニケーションの感覚をまだ伝えていない。
本研究では,対話型ヘッドアバター生成のための新しいフレームワークであるAvatar Forcingを提案する。
論文 参考訳(メタデータ) (2026-01-02T11:58:48Z) - AvatarSync: Rethinking Talking-Head Animation through Phoneme-Guided Autoregressive Perspective [15.69417162113696]
AvatarSyncは音素表現の自己回帰フレームワークであり、単一の参照画像からリアルなトーキングヘッドアニメーションを生成する。
AvatarSyncは,視覚的忠実度,時間的整合性,計算効率において,既存のトーキングヘッドアニメーション手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-09-15T15:34:02Z) - HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis [90.74616208952791]
HM-Talkerは、高忠実で時間的コヒーレントな話しヘッドを生成するための新しいフレームワークである。
AUs(Action Units)は、解剖学的に定義された顔面の筋肉の動きと、音素と視覚の相違を最小限に抑える暗黙的な特徴を使用する。
論文 参考訳(メタデータ) (2025-08-14T12:01:52Z) - Playmate: Flexible Control of Portrait Animation via 3D-Implicit Space Guided Diffusion [6.677873152109559]
そこで我々は,より生き生きとした表情と話し声を生成するために,新しい2段階学習フレームワークPlaymateを提案する。
最初の段階では、より正確な属性の切り離しを容易にするために、細かな設計のモーションデカップリングモジュールとともに、非結合な3次元表現を導入する。
第2段階では、感情制御情報を潜在空間にエンコードする感情制御モジュールを導入し、感情のきめ細かい制御を可能にし、所望の感情で会話ビデオを生成する能力を実現する。
論文 参考訳(メタデータ) (2025-02-11T02:53:48Z) - InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation [39.235962838952624]
本稿では,感情表現型2Dアバターを生成するための新しいテキスト誘導手法を提案する。
我々のフレームワークであるInstructAvatarは、自然言語インタフェースを利用して感情やアバターの顔の動きを制御します。
実験結果から,InstructAvatarは両条件とも良好に一致した結果が得られた。
論文 参考訳(メタデータ) (2024-05-24T17:53:54Z) - Audio- and Gaze-driven Facial Animation of Codec Avatars [149.0094713268313]
音声および/またはアイトラッキングを用いて,コーデックアバターをリアルタイムにアニメーション化するための最初のアプローチについて述べる。
私たちのゴールは、重要な社会的シグナルを示す個人間の表現力のある会話を表示することです。
論文 参考訳(メタデータ) (2020-08-11T22:28:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。