論文の概要: Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews
- arxiv url: http://arxiv.org/abs/2608.02841v1
- Date: Mon, 03 Aug 2026 19:57:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.938793
- Title: Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews
- Title(参考訳): ローカライズ, 美容しない:コスメティック手術のプレビューのための画像編集APIのクライアント側制御
- Abstract要約: 編集を1つの領域にまとめる既存の方法は、モデルの内部にアクセスする必要がある。
クライアント側だけで、どの程度コントロールできるのかを尋ねます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ask a commercial image editor to preview a cosmetic procedure and it will often change more of the face than the request names: a nose edit can also smooth skin or alter lighting. Existing methods for confining an edit to one region require access to the model's internals, which a public editing API does not expose. We ask how much control is possible from the client side alone. In a pilot benchmark, six commercial editing configurations and one mask-based inpainting model perform facelift-style jaw-neck and rhinoplasty edits at three levels of client-side control: the prompt alone; cutting the edited region out of the response and pasting it back onto the original photograph through a landmark-derived mask (a masked composite); and asking the model itself to inpaint inside the mask where supported. Of 210 attempted edits, 196 could be scored. ArcFace cosine measures identity preservation; a CIELAB pixel-change ratio measures how much change lands inside the requested region rather than a protected facial zone. On the 12 frontal faces the regional metric could score, the masked composite improved localization over the paired prompt-only output by a median of 0.446 (95% face-clustered bootstrap interval 0.421-0.457) while changing the requested region about as much. Editors differed in edit strength versus identity retention, and the one inpainting model we tested did not beat the simple composite. Against each face's input-to-postoperative baseline, no editor moved its outputs closer to the postoperative photograph in identity-embedding terms. This is a study of control, not clinical accuracy: no surgeons rated the outputs, and each condition was generated once. Within that scope, keeping a surgical preview inside its intended region needs no access to the model; a mask and composite on the client enforce it across every editor tested, at low provider cost.
- Abstract(参考訳): 商業用画像エディターに化粧品のプロシージャのプレビューを依頼すると、鼻の編集はスムーズで、照明も変更できる。
編集をひとつのリージョンにまとめる既存の方法は、公開編集APIが公開していないモデルの内部へのアクセスを必要とする。
クライアント側だけで、どの程度コントロールできるのかを尋ねます。
パイロットベンチマークでは、6つの商業的な編集構成と1つのマスクベースの塗布モデルにより、3段階のクライアント側制御:プロンプト単独、編集された領域をカットし、ランドマーク由来のマスク(マスク付き複合体)を介して元の写真に貼り付け、モデル自体が支持されたマスクの内部に塗布するよう依頼する。
210件の編集が試みられ、196件が採点された。
ArcFace cosineはアイデンティティの保存を計測し、CIELABピクセル変更比は、保護された顔ゾーンではなく、要求された領域内にどれだけの変化があるかを測定する。
前部12面の測度では、マスク付き複合材料は、要求された領域をほぼ変更しながら、対のプロンプトのみの出力に対して0.446(95%の顔クラスターブートストラップ間隔0.421-0.457)で局所化を改善した。
編集者は編集強度とアイデンティティ保持率に差があり、テストした1つの塗り絵モデルは単純な合成に勝たなかった。
各顔のインプット・ツー・オペティションベースラインに対して, 同一性埋め込み条件下では, 術後写真に近いアウトプットの移動は認められなかった。
これは、臨床的な正確性ではなく、コントロールの研究であり、どの外科医もアウトプットを評価せず、それぞれの状態が一度だけ生成された。
その範囲内では、意図した領域内で外科的プレビューを保ちながら、モデルにアクセスする必要はない。
関連論文リスト
- Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation [0.0]
局所的な生成編集には局所的な評価が必要である。
ローカライズされた編集では、顔認証のメトリクスではなく、編集領域の忠実度で進捗を測定する必要がある。
論文 参考訳(メタデータ) (2026-06-26T22:13:20Z) - Masked Generative Transformer Is What You Need for Image Editing [91.7627902312967]
拡散モデルは、編集された領域を周囲のコンテキストと絡み合わせることで、変更が持続するべき領域に伝播する。
本稿では,局所化トークン予測パラダイムが意図した領域の変更を自然に限定するMasked Generative Transformers (MGTs)を活用することによって,根本的に異なるアプローチを提案する。
本稿では,MGTベースの編集フレームワークであるEditMGTについて紹介する。
論文 参考訳(メタデータ) (2026-05-11T17:05:52Z) - Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing [28.295031615161136]
大規模な拡散変換器 (DiT) はグローバルな編集命令に従っているが、常に非関連領域に局所的な編集をリークする。
そこで我々はAdaptEditを紹介した。AdaptEditは、訓練された命令と地域対応のアダプタフレームワークである。
AdaptEditは最先端の結果を達成し、マスクフリーとオラクルマスクのベースラインを同時に上回る。
論文 参考訳(メタデータ) (2026-04-26T15:28:02Z) - SpotEdit: Selective Region Editing in Diffusion Transformers [66.44912649206553]
SpotEditは、修正されたリージョンのみを選択的に更新する、トレーニング不要な拡散編集フレームワークである。
不要な計算を削減し、未修正領域で高い忠実性を維持することにより、SpotEditは効率よく正確な画像編集を実現する。
論文 参考訳(メタデータ) (2025-12-26T14:59:41Z) - FFaceNeRF: Few-shot Face Editing in Neural Radiance Fields [4.599829659954009]
マスクを用いた最近の3次元顔編集法は、NeRF(Neural Radiance Fields)を利用して高品質な編集画像を生成する。
我々は,マスクレイアウトの固定化によるユーザ制御の制限を克服する,NeRFベースの顔編集技術であるFFaceNeRFを提案する。
論文 参考訳(メタデータ) (2025-03-21T12:24:58Z) - Edit Away and My Face Will not Stay: Personal Biometric Defense against Malicious Generative Editing [19.94455452402954]
FaceLockは、敵の摂動を最適化して生体情報を破壊または著しく変更する、ポートレート保護の新しいアプローチである。
我々の研究はバイオメトリック・ディフェンスを推進し、画像編集におけるプライバシー保護の実践の基礎を定めている。
論文 参考訳(メタデータ) (2024-11-25T18:59:03Z) - Face Mask Removal with Region-attentive Face Inpainting [0.7433327915285965]
本研究では,顔のマスク部分の復元・再構成を行う生成顔インペイント法を提案する。
提案手法は,空間情報損失を軽減するため,M-CSAM (M-scale Channel-Spatial Attention Module) を含む。
我々は、CelebAデータセットから5種類のマスクを組み込むことで、独自のMasked-Facesデータセットを合成する。
論文 参考訳(メタデータ) (2024-09-10T20:10:11Z) - Zero-shot Image Editing with Reference Imitation [50.75310094611476]
我々は、ユーザーがより便利に創造性を発揮できるように、模倣編集と呼ばれる新しい形態の編集を提示する。
ビデオクリップから2つのフレームをランダムに選択し、あるフレームのいくつかの領域をマスクし、他のフレームからの情報を用いてマスクされた領域を復元する、MimicBrushと呼ばれる生成学習フレームワークを提案する。
各種試験事例における本手法の有効性を実験的に示すとともに,既存手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-06-11T17:59:51Z) - LIME: Localized Image Editing via Attention Regularization in Diffusion Models [69.33072075580483]
本稿では拡散モデルにおける局所化画像編集のためのLIMEを提案する。
LIMEは、ユーザが指定した関心領域(RoI)や追加のテキスト入力を必要としない。
そこで本研究では,RoIにおける非関係なクロスアテンションスコアをデノナイジングステップ中にペナライズし,局所的な編集を確実にする新しいクロスアテンション正規化手法を提案する。
論文 参考訳(メタデータ) (2023-12-14T18:59:59Z) - LC-NeRF: Local Controllable Face Generation in Neural Randiance Field [55.54131820411912]
LC-NeRFは、ローカルリージョンジェネレータモジュールと空間認識融合モジュールで構成される。
本手法は,最先端の顔編集法よりも局所的な編集が優れている。
また,テキスト駆動型顔画像編集など,下流のタスクでもよく機能する。
論文 参考訳(メタデータ) (2023-02-19T05:50:08Z) - Perceptually Validated Precise Local Editing for Facial Action Units
with StyleGAN [3.8149289266694466]
顔のセマンティックな操作に広く用いられているStyleGANに基づくソリューションを構築した。
そこで本研究では,潜在空間における編集を行うための単純な戦略が,特定のアクションユニット間の不要な結合をもたらすことを示す。
23名の被験者による知覚実験により局所的編集法の有効性を検証した。
論文 参考訳(メタデータ) (2021-07-26T12:21:37Z) - PIE: Portrait Image Embedding for Semantic Control [82.69061225574774]
本稿では,StyleGANの潜在空間に実際の肖像画を埋め込むための最初のアプローチを提案する。
トレーニング済みのニューラルネットワークであるStyleRigは、3D形態素顔モデルの制御空間をGANの潜在空間にマッピングする。
アイデンティティエネルギー保存用語は、顔の整合性を維持しながら空間的コヒーレントな編集を可能にする。
論文 参考訳(メタデータ) (2020-09-20T17:53:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。