論文の概要: RAGMesh with FaME-G2E: Long-Form Text-Driven 3D Face Generation and Editing
- arxiv url: http://arxiv.org/abs/2608.09186v1
- Date: Mon, 10 Aug 2026 06:55:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.109434
- Title: RAGMesh with FaME-G2E: Long-Form Text-Driven 3D Face Generation and Editing
- Title(参考訳): FaME-G2EによるRAGMesh: テキスト駆動型3D顔生成と編集
- Abstract要約: RAGMeshは、テキスト関連幾何学的先行情報を利用して高忠実度顔合成と編集を改善する検索強化フレームワークである。
FaME-G2E実験により, RAGMeshは局所的幾何学的精度, テキスト誘導制御性, 局所的編集精度, 推論効率において, 最先端手法よりも優れた性能を示した。
- 参考スコア(独自算出の注目度): 25.687502829670393
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-driven 3D face generation and editing remains challenging due to the difficulty of translating long-form descriptions into fine-grained facial geometry. Existing methods primarily align global textual semantics with facial structures but often struggle to capture subtle local deformations, such as eyebrow tension, cheek contraction, and asymmetric mouth motions, resulting in limited geometric fidelity and editing precision. To facilitate fine-grained text-driven facial modeling, we first construct FaME-G2E, a large-scale multimodal dataset containing detailed text--mesh annotations and paired text--blendshape samples for unified 3D facial generation and editing. Based on this dataset, we propose RAGMesh, a retrieval-augmented framework that leverages text-correlated geometric priors to improve high-fidelity facial synthesis and editing. Specifically, the Multi-Scale Retrieval Fusion (MSRF) module retrieves semantically consistent global and regional facial priors and fuses them in the blendshape space, suppressing conflicting local deformations while preserving coherent deformation patterns. Furthermore, we introduce Adaptive RAG-guided Supervision (AdaRAGS), a region-aware constraint that explicitly aligns textual semantics with corresponding facial regions, enhancing regional controllability and editing accuracy. Extensive experiments on FaME-G2E demonstrate that RAGMesh achieves superior performance over state-of-the-art methods in local geometric accuracy, text-guided controllability, regional editing precision, and inference efficiency. Video demo is available at https://youtu.be/Yr0_XkpWcNk, and the source code and dataset will be released upon paper acceptance.
- Abstract(参考訳): テキスト駆動の3D顔生成と編集は、長文記述をきめ細かな顔形状に変換するのが難しいため、依然として困難である。
既存の手法は主に、グローバルなテキスト意味論を顔の構造と整合させるが、斑点の緊張、頬の収縮、非対称な口の動きといった微妙な局所的な変形を捉えるのに苦慮し、幾何学的忠実さと編集精度が制限される。
まず、詳細なテキスト・メシュ・アノテーションとペア・テキスト・ブレンドシェープ・サンプルを含む大規模なマルチモーダル・データセットであるFaME-G2Eを構築し、3次元顔生成と編集を行う。
このデータセットに基づいて,テキスト関連幾何学的先行情報を利用して高忠実度顔合成と編集を改善する検索拡張フレームワークRAGMeshを提案する。
具体的には、MSRF(Multi-Scale Retrieval Fusion)モジュールは、意味論的に一貫したグローバルな顔と地域的な顔の先行を抽出し、それらをブレンドシェープ空間に融合させ、コヒーレントな変形パターンを保持しながら、矛盾する局所的な変形を抑制する。
さらに,Adaptive RAG-guided Supervision (AdaRAGS)を導入し,テキストの意味を対応する顔領域と明示的に整合させ,地域制御性と編集精度を向上させる。
FaME-G2Eの大規模実験により, RAGMeshは局所的幾何学的精度, テキスト誘導制御性, 局所的編集精度, 推論効率において, 最先端手法よりも優れた性能を示した。
ビデオデモはhttps://youtu.be/Yr0_XkpWcNkで公開されている。
関連論文リスト
- CoT-Edit: Let CoT Guide Instruction Video Editing [13.600094788792633]
本稿では,意味的意図と空間的実行を橋渡しする計画ガイド-編集フレームワークを提案する。
我々のフレームワークでは、Chain-of-Thought(CoT)強化マルチモーダル言語モデル(MLLM)がプランナーとして機能する。
これらの空間的先行は、ボックス条件のマスクジェネレータを誘導し、不明瞭なグローバル検索を局所的でコンテキスト対応の洗練に変換する。
論文 参考訳(メタデータ) (2026-08-02T09:20:15Z) - VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction [59.303842406260124]
VGGT-Editはテキスト条件のネイティブ3Dシーン編集のためのフィードフォワードフレームワークである。
本研究では,奥行き同期テキストインジェクションを導入し,意味的指導をバックボーンの空間的ポーズと整合させる。
VGGT-Editは2Dリフトベースラインを大幅に上回り、よりシャープなオブジェクトの詳細、より強力なマルチビュー一貫性、ほぼインスタントな推論速度を生み出している。
論文 参考訳(メタデータ) (2026-05-14T17:59:04Z) - TransSplat: Unbalanced Semantic Transport for Language-Driven 3DGS Editing [9.002007453825486]
言語駆動型3DGS編集を多視点アンバランスなセマンティックトランスポート問題として定式化するTransSplatを提案する。
具体的には、可視ガウスとビュー固有の編集プロトタイプとの対応性を確立する。
さらに、クロスビュー共有の標準3D編集フィールドを復元し、統一された3D外観更新をガイドする。
論文 参考訳(メタデータ) (2026-04-21T15:25:50Z) - THOM: Generating Physically Plausible Hand-Object Meshes From Text [44.69476210110844]
テキストからの3Dハンドオブジェクトインタラクション(HOIs)の生成は,ロボットの器用な把握とVR/ARコンテンツ生成に不可欠である。
我々は、テンプレートオブジェクトメッシュを必要とせずに、フォトリアリスティックで物理的に可視な3D HOIメッシュを生成する、トレーニング不要のフレームワークであるTHOMを紹介した。
THOMは、テキストアライメント、視覚リアリズム、相互作用の可視性の観点から、最先端の手法を一貫して超越している。
論文 参考訳(メタデータ) (2026-04-03T05:17:12Z) - High-Fidelity 3D Facial Avatar Synthesis with Controllable Fine-Grained Expressions [83.73866089033585]
本稿では,テクスチャ編集のための事前学習型3D-Aware GANモデルの潜在コードとメッシュ編集のための駆動型3DMMモデルの表現コードの両方を同時に精製して,新しいアプローチを提案する。
デュアルマッパーを最適化するために,CLIPをベースとした目的関数をターゲットとするテキスト誘導最適化手法を提案する。
論文 参考訳(メタデータ) (2026-03-16T03:25:10Z) - Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors [67.22744959435708]
3Dセマンティックパーシングは2Dに比べて性能が劣ることが多く、3D空間内でのターゲット操作がより困難になり、編集の忠実さが制限される。
本稿では,2次元拡散編集を利用して各ビューの修正領域を正確に同定し,次に3次元ローカライゼーションのための逆レンダリングを行う。
実験により,提案手法は最新技術の性能を実現し,最大4倍のスピードアップを実現した。
論文 参考訳(メタデータ) (2025-07-07T19:15:43Z) - Revealing Directions for Text-guided 3D Face Editing [52.85632020601518]
3次元顔編集はマルチメディアにおいて重要な課題であり、様々な制御信号間での3次元顔モデルの操作を目的としている。
任意の属性記述に基づく3次元顔の生成と操作のためのテキスト汎用アプローチであるFace Clanを提案する。
本手法は,ユーザがテキスト記述で興味のある領域を直感的にカスタマイズできる,正確に制御可能な操作方法を提供する。
論文 参考訳(メタデータ) (2024-10-07T12:04:39Z) - MaTe3D: Mask-guided Text-based 3D-aware Portrait Editing [61.014328598895524]
textbfMaTe3D:マスク誘導型テキストベースの3D画像編集を提案する。
SDFに基づく新しい3Dジェネレータは,SDFと密度の整合性損失により局所的およびグローバルな表現を学習する。
幾何とテクスチャの条件蒸留(CDGT)は視覚的曖昧さを軽減し、テクスチャと幾何学のミスマッチを避ける。
論文 参考訳(メタデータ) (2023-12-12T03:04:08Z) - Text-Guided 3D Face Synthesis -- From Generation to Editing [53.86765812392627]
顔生成から編集までの統一的なテキスト誘導フレームワークを提案する。
我々は、RGBおよびYUV空間のテクスチャ品質を高めるために、微調整されたテクスチャ拡散モデルを用いている。
整合性を維持しつつ編集効率を向上させるための自己誘導整合性ウェイト戦略を提案する。
論文 参考訳(メタデータ) (2023-12-01T06:36:23Z) - FASTER: A Font-Agnostic Scene Text Editing and Rendering Framework [19.564048493848272]
STE(Scene Text Editing)は、画像中の既存のテキストの変更を主な目的とする、難しい研究課題である。
既存のスタイル変換ベースのアプローチでは、複雑な画像背景、多様なフォント属性、テキスト内の様々な単語長によるサブパー編集性能が示されている。
フォントに依存しない新しいシーンテキスト編集・レンダリングフレームワークであるFASTERを提案し,任意のスタイルや場所のテキストを同時に生成する。
論文 参考訳(メタデータ) (2023-08-05T15:54:06Z) - LC-NeRF: Local Controllable Face Generation in Neural Randiance Field [55.54131820411912]
LC-NeRFは、ローカルリージョンジェネレータモジュールと空間認識融合モジュールで構成される。
本手法は,最先端の顔編集法よりも局所的な編集が優れている。
また,テキスト駆動型顔画像編集など,下流のタスクでもよく機能する。
論文 参考訳(メタデータ) (2023-02-19T05:50:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。