論文の概要: EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions
- arxiv url: http://arxiv.org/abs/2607.02674v1
- Date: Thu, 02 Jul 2026 18:10:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.389418
- Title: EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions
- Title(参考訳): EmoteGPT:自然言語による3次元顔表現
- Abstract要約: Txt2Emoteは,微粒なテキストアノテーションを用いた多種多様な3次元表情のベンチマークである。
マルチモーダル大言語モデルに基づくテキストから3Dの表現フレームワークであるEmoteGPTを提案する。
我々は、大規模画像から3DMMデータへのトレーニングを増強することで、EmoteGPTをさらに改善し、最先端のテキストから3D顔合成手法を克服する。
- 参考スコア(独自算出の注目度): 67.8321457457786
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Precise control of 3D facial expressions from text is crucial for virtual avatars, animation, and human-computer interaction, yet existing text-to-3D methods jointly generate identity, expression, and texture, making fine-grained expression control difficult. We instead formulate text-driven expression synthesis as a regression problem in the disentangled parameter space of a 3D Morphable Model (3DMM). This setting, however, requires paired data linking detailed language to precise expression parameters, which are missing from existing resources. To fill this gap, we introduce Txt2Emote, a benchmark of diverse 3D facial expressions with fine-grained textual annotations obtained from GPT-4o and a high-fidelity face tracker, providing both explicit descriptions detailing facial features and implicit descriptions referencing the situational context behind the expression. Leveraging this dataset, we present EmoteGPT, a text-to-3D expression framework based on a Multimodal Large Language Model (MLLM) with a dedicated <Expr> token to semantically ground expression representations, which are then decoded into 3DMM parameters. We further improve EmoteGPT by augmenting training with large-scale image-to-3DMM data, enabling it to surpass state-of-the-art text-to-3D face synthesis methods on emotion recognition metrics and in perceived expressiveness. Integrated into avatar pipelines, our method enables photorealistic and stylized 3D avatars, as well as expressive 3D-consistent 2D face synthesis from textual input.
- Abstract(参考訳): テキストからの3D表情の精密制御は、仮想アバター、アニメーション、人間とコンピュータの相互作用において重要であるが、既存のテキストから3Dの手法は、アイデンティティ、表現、テクスチャを共同で生成し、きめ細かい表現制御を困難にしている。
代わりに、3次元Morphable Model(3DMM)の非交叉パラメータ空間における回帰問題としてテキスト駆動型表現合成を定式化する。
しかし、この設定では、既存のリソースから欠落している正確な表現パラメータに詳細な言語をリンクするペアデータが必要である。
このギャップを埋めるために、GPT-4oから得られた細粒度テキストアノテーションを用いた多様な3次元表情のベンチマークであるTxt2Emoteと、顔の特徴を詳述した明示的な記述と、その表現の背後にある状況を参照した暗黙的な記述の両方を提供する高忠実な顔追跡装置を紹介する。
このデータセットを利用すると、EmoteGPTはMLLM(Multimodal Large Language Model)をベースとしたテキストから3Dの表現フレームワークであり、セマンティックグラウンド表現に専用の<Expr>トークンを持ち、3DMMパラメータにデコードされる。
我々は、大規模画像から3DMMデータへのトレーニングを増強し、感情認識のメトリクスと知覚表現性に関する最先端のテキストから3Dの顔合成手法を克服することで、EmoteGPTをさらに改善する。
提案手法は,アバターパイプラインに統合され,フォトリアリスティックでスタイリングされた3Dアバターと,テキスト入力による表現的3D一貫性の2D顔合成を可能にする。
関連論文リスト
- High-Fidelity 3D Facial Avatar Synthesis with Controllable Fine-Grained Expressions [83.73866089033585]
本稿では,テクスチャ編集のための事前学習型3D-Aware GANモデルの潜在コードとメッシュ編集のための駆動型3DMMモデルの表現コードの両方を同時に精製して,新しいアプローチを提案する。
デュアルマッパーを最適化するために,CLIPをベースとした目的関数をターゲットとするテキスト誘導最適化手法を提案する。
論文 参考訳(メタデータ) (2026-03-16T03:25:10Z) - When Words Smile: Generating Diverse Emotional Facial Expressions from Text [77.1867389815291]
本稿では,感情動態に着目したエンドツーエンドのテキスト対表現モデルを提案する。
我々のモデルは連続的な潜伏空間における表情の変動を学習し、多様な、流動的で、感情的に一貫性のある表現を生成する。
論文 参考訳(メタデータ) (2024-12-03T15:39:05Z) - Emo3D: Metric and Benchmarking Dataset for 3D Facial Expression Generation from Emotion Description [3.52270271101496]
Emo3Dは、人間の感情の幅広い範囲にまたがる広範な「テキスト画像表現データセット」である。
我々は多種多様なテキスト記述を生成し、感情表現の幅広い範囲を捉えやすくする。
エモ3D」はアニメーションデザイン、バーチャルリアリティ、感情的な人間とコンピュータのインタラクションに優れた応用がある。
論文 参考訳(メタデータ) (2024-10-02T21:31:24Z) - EmoVOCA: Speech-Driven Emotional 3D Talking Heads [12.161006152509653]
EmoVOCAと呼ばれる合成データセットを作成するための革新的なデータ駆動手法を提案する。
次に,3次元顔,音声ファイル,感情ラベル,強度値を入力として受け入れる感情的3次元音声ヘッドジェネレータを設計,訓練し,顔の表情特性で音声同期唇の動きをアニメーション化することを学ぶ。
論文 参考訳(メタデータ) (2024-03-19T16:33:26Z) - Control3D: Towards Controllable Text-to-3D Generation [107.81136630589263]
本稿では,手書きスケッチ,すなわちコントロール3Dについてテキストから3D生成条件を提案する。
2次元条件付き拡散モデル(ControlNet)を再構成し、NeRFとしてパラメータ化された3次元シーンの学習を誘導する。
合成3Dシーン上での描画画像のスケッチを直接推定するために,事前学習可能なフォト・ツー・スケッチ・モデルを利用する。
論文 参考訳(メタデータ) (2023-11-09T15:50:32Z) - Towards High-Fidelity Text-Guided 3D Face Generation and Manipulation
Using only Images [105.92311979305065]
TG-3DFaceは、よりリアルで美的な3D顔を生成し、ラテント3Dよりも9%のマルチビュー一貫性(MVIC)を高めている。
TG-3DFaceによって生成された描画顔画像は、テキストから2Dの顔/画像生成モデルよりも高いFIDとCLIPスコアを達成する。
論文 参考訳(メタデータ) (2023-08-31T14:26:33Z) - TADA! Text to Animatable Digital Avatars [57.52707683788961]
TADAはテキスト記述を取り込み、高品質な幾何学とライフスタイルのテクスチャを備えた表現力のある3Dアバターを生産する。
我々は3次元変位とテクスチャマップを備えたSMPL-Xから最適化可能な高分解能ボディモデルを導出した。
我々は、生成した文字の正規表現とRGB画像をレンダリングし、SDSトレーニングプロセスにおけるそれらの潜伏埋め込みを利用する。
論文 参考訳(メタデータ) (2023-08-21T17:59:10Z) - Guide3D: Create 3D Avatars from Text and Image Guidance [55.71306021041785]
Guide3Dは拡散モデルに基づく3Dアバター生成のためのテキスト・画像誘導生成モデルである。
我々のフレームワークは、トポロジカルかつ構造的に正しい幾何と高分解能なテクスチャを生成する。
論文 参考訳(メタデータ) (2023-08-18T17:55:47Z) - High-Fidelity 3D Face Generation from Natural Language Descriptions [12.22081892575208]
本論では,1) 記述的テキストアノテーションによる高品質な3次元顔データ不足,2) 記述的言語空間と形状・外観空間との複雑なマッピング関係について論じる。
Describe3Dデータセットは、テキストから3Dの顔生成タスクのためのきめ細かいテキスト記述を備えた最初の大規模データセットである。
まず, 具体的記述と一致する3次元顔を生成するための2段階のフレームワークを提案し, 抽象的記述を用いて3次元形状とテクスチャ空間のパラメータを最適化し, 3次元顔モデルを洗練する。
論文 参考訳(メタデータ) (2023-05-05T06:10:15Z) - Next3D: Generative Neural Texture Rasterization for 3D-Aware Head
Avatars [36.4402388864691]
3D-Aware Generative Adversarial Network (GANs) は, 単一視点2D画像のコレクションのみを用いて, 高忠実かつ多視点の顔画像を合成する。
最近の研究は、3D Morphable Face Model (3DMM) を用いて、生成放射場における変形を明示的または暗黙的に記述している。
本研究では,非構造化2次元画像から生成的,高品質,かつ3D一貫性のある顔アバターの教師なし学習のための新しい3D GANフレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-21T06:40:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。