論文の概要: A Large-scale Evaluation of Text-guided Models for Facial Editing
- arxiv url: http://arxiv.org/abs/2608.28802v1
- Date: Fri, 28 Aug 2026 19:12:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.752692
- Title: A Large-scale Evaluation of Text-guided Models for Facial Editing
- Title(参考訳): 顔編集のためのテキスト誘導モデルの大規模評価
- Abstract要約: Generative Adversarial Networks (GANs) と 3D Morphable Models (3DMMs) は顔編集に広く利用されている。
顔編集属性の最大のコレクションであるFace-Edit-Attributesを紹介します。
その結果、ほとんどのモデルでは髪やアクセサリーの編集がうまく行なっていたが、編集に苦労していたことが判明した。
- 参考スコア(独自算出の注目度): 15.087504809019526
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Facial appearance editing powers popular applications like FaceApp and Photoshop. Generative Adversarial Networks (GANs) and 3D Morphable Models (3DMMs) have been widely used for facial editing. GANs can perform varied facial edits (e.g., changing hair color, hairstyle), but often produce unstable edits. 3DMMs produce stable edits, but can only alter pose and facial expression. Recently, text-guided diffusion models like Nano Banana have become popular for image editing. Text-guided models are a compelling alternative to GANs and 3DMMs since they can produce both stable and varied image edits. While text-guided models have been widely tested for whole-scene edits (e.g., ``make the woman play a guitar''), they have not been comprehensively tested for facial editing. We conducted the first large-scale evaluation ($\sim1$M images evaluated) of six popular text-guided models on a sequential facial editing task. We present Face-Edit-Attributes, the largest collection of $169$ facial editing attributes focused on hair, accessories, and pose edits. We compared model performance using two popular celebrity face datasets: CelebA and CelebSET. Our results show that most models performed hair and accessory edits well, but struggled with editing pose. All models over-edit (e.g., changing hair color when asked only to change the hairstyle). We also evaluated demographic biases in each model. Our results show surprising biases in overediting: almost all models created more overedits for dark-skinned male faces and old faces. The code and data for our results (including our repository of $\sim 1$M images) can be accessed \href{https://github.com/rahul1801/Face-Edit-Bench}{\textcolor{blue}{here}}.
- Abstract(参考訳): 顔の外観編集は、FaceAppやPhotoshopなどの人気アプリケーションに使われている。
Generative Adversarial Networks (GANs) と 3D Morphable Models (3DMMs) は顔編集に広く利用されている。
GANはさまざまな顔の編集(例えば髪の色を変える、髪型を変える)を行うことができるが、不安定な編集を行うことが多い。
3DMMは安定した編集を行うが、ポーズや表情だけを変えることができる。
近年,Nano Bananaのようなテキスト誘導拡散モデルが画像編集に人気になっている。
テキスト誘導モデルは、安定した画像編集と多様な画像編集の両方を生成できるため、GANや3DMMに代わる魅力的な代替品である。
テキスト誘導モデルは、全シーン編集(例:『ギターを弾く女性』)のために広くテストされているが、顔編集には包括的にテストされていない。
顔の連続的編集作業において、6つの人気テキスト誘導モデルの大規模な評価(\sim1$M画像の評価)を行った。
Face-Edit-Attributesは、髪、アクセサリー、ポーズの編集に焦点を当てた169ドルの顔編集属性の最大のコレクションです。
CelebAとCelebSETの2つの有名顔データセットを用いてモデル性能を比較した。
その結果、ほとんどのモデルでは髪やアクセサリーの編集がうまく行なっていたが、編集に苦労していたことが判明した。
すべてのモデルがオーバーエジット(例えば、髪型を変えるだけで髪の色を変える)。
また、各モデルにおける人口統計バイアスを評価した。
ほぼすべてのモデルが、浅黒い肌の男性顔と古い顔に過剰な編集を施したのです。
結果のコードとデータ($\sim 1$M イメージのリポジトリを含む)は \href{https://github.com/rahul1801/Face-Edit-Bench}{\textcolor{blue}{here}} にアクセスできる。
関連論文リスト
- PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing [13.257954925321835]
本稿では主に,運転映像に基づく表情のみのポートレート・ビデオ・パフォーマンス編集の課題について考察する。
本稿では,既存の映画やアニメーションの演出をリキャストする多目的な表現専用ビデオ編集手法PerformRecastを提案する。
本手法は,運転映像に忠実な高品質な結果が得られ,制御性と効率性の両方において既存手法よりも優れていた。
論文 参考訳(メタデータ) (2026-03-20T08:14:56Z) - Efficient Few-shot Identity Preserving Attribute Editing for 3D-aware Deep Generative Models [0.6091702876917279]
顔の同一性を保存することは、照明の修正、眼鏡の追加・削除、顔の老化、髪型の編集、表現の修正などを可能にする生成タスクである。
本稿では,最近の3次元認識深部生成モデルと2次元画像編集技術の進歩に基づく手法を提案する。
論文 参考訳(メタデータ) (2025-10-21T04:27:46Z) - Understanding Generative AI Capabilities in Everyday Image Editing Tasks [52.812515570607296]
Redditコミュニティで過去12年間(2013-2025)に行われた83万件のリクエストを分析し、305万件のPSRウィザード編集を収集した。
人間の評価によると、最高のAIエディターによって要求の約33%が満たされる。
AIエディタは、よりオープンなタスクよりも正確な編集を必要とする、創造性の低い要求に対して、パフォーマンスが悪くなる。
論文 参考訳(メタデータ) (2025-05-22T03:35:15Z) - Fundamental Problems With Model Editing: How Should Rational Belief Revision Work in LLMs? [61.68363765350178]
本稿では,モデル編集問題の標準的な定式化を批判し,モデル編集研究のための形式的テストベッドを提案する。
まず,(1) 問題の定義,(2) ベンチマークの開発,(3) LLM がそもそも編集可能な信念を持っていることを前提として,モデル編集における12のオープンな問題について述べる。
次に、Wikidataに基づくモデル編集のための半合成データセットを導入し、理想化されたベイズエージェントによって与えられるラベルに対する編集を評価する。
論文 参考訳(メタデータ) (2024-06-27T17:33:03Z) - "Flex Tape Can't Fix That": Bias and Misinformation in Edited Language Models [17.77377809345631]
モデル編集手法は,編集後のモデルバイアスを予期せず増幅する方法について検討する。
具体的には、人種、地理的起源、性別などの人口特性に関するバイアスに焦点を当てる。
編集されたモデルは、アジア、アフリカ、および南米の被験者の属性に対する信頼性が低下するにつれて、様々な程度にバイアスのかかる行動を示す。
論文 参考訳(メタデータ) (2024-02-29T23:11:55Z) - Real-time 3D-aware Portrait Editing from a Single Image [111.27169315556444]
3DPEは、参照画像やテキスト記述など、与えられたプロンプトに従って顔画像を編集することができる。
軽量モジュールは、3Dポートレートジェネレータとテキスト・ツー・イメージ・モデルから蒸留される。
論文 参考訳(メタデータ) (2024-02-21T18:36:26Z) - Text-Guided Generation and Editing of Compositional 3D Avatars [59.584042376006316]
私たちのゴールは、テキスト記述だけで髪とアクセサリーを備えたリアルな3D顔アバターを作ることです。
既存の方法はリアリズムを欠いているか、非現実的な形状を作り出すか、編集をサポートしていないかのいずれかである。
論文 参考訳(メタデータ) (2023-09-13T17:59:56Z) - Editing 3D Scenes via Text Prompts without Retraining [80.57814031701744]
DN2Nはテキスト駆動編集方式であり、普遍的な編集機能を備えたNeRFモデルの直接取得を可能にする。
本手法では,2次元画像のテキストベース編集モデルを用いて3次元シーン画像の編集を行う。
本手法は,外観編集,天気変化,材質変化,スタイル伝達など,複数種類の編集を行う。
論文 参考訳(メタデータ) (2023-09-10T02:31:50Z) - Memory-Based Model Editing at Scale [102.28475739907498]
既存のモデルエディタは、編集対象のスコープを正確にモデル化するのに苦労する。
SERAC(Retrieval-Augmented Counterfactal Model)を用いた半パラメトリック編集を提案する。
SERACは、編集を明示的なメモリに格納し、必要に応じてベースモデルの予測を変更できるように、それらを推論することを学ぶ。
論文 参考訳(メタデータ) (2022-06-13T23:40:34Z) - $\ extit{FacialFilmroll}$: High-resolution multi-shot video editing [5.9023145053442105]
$textitFacialFilmroll$は、空間的にかつ時間的に一貫した顔の編集を1つまたは複数のショットで行うソリューションである。
近年,モノクロビデオに3次元顔モデルを適用し,モザイクの質を向上する手法が提案されている。
論文 参考訳(メタデータ) (2021-10-05T15:51:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。