論文の概要: SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation
- arxiv url: http://arxiv.org/abs/2607.29367v1
- Date: Fri, 31 Jul 2026 12:52:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.714216
- Title: SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation
- Title(参考訳): SatEdit: VLM-Guided Segment Annotationによるマスクによる画像編集
- Abstract要約: マスク条件の衛星画像編集フレームワークであるSatEditを導入する。
我々は、SODA-A由来の1014歳と822の検証対象アノテーションを含むデータセット上で、高解像度の画像編集バックボーンをLoRAで微調整する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Satellite image editing requires spatially precise object-level control, but supervised editing datasets for overhead imagery are costly to build because object masks, semantic labels, and paired edits are rarely available at scale. We introduce SatEdit, a mask-conditioned satellite image editing framework that constructs training supervision from unlabeled imagery. SatEdit proposes object masks with a seg- mentation foundation model, assigns semantic la- bels to sampled segments with a Vision-Language Model, and applies lightweight human verification before generating paired addition and removal exam- ples through mask-guided inpainting. We fine-tune a high-resolution image editing backbone with LoRA on a SODA-A-derived dataset containing 1,014 im- ages and 852 verified object annotations across 91 classes. In controlled comparisons with open- source and proprietary image editing models, SatE- dit achieves the highest aggregate masked-region se- mantic alignment, with a CLIP score of 0.6322 and CLIP delta of 0.0726, while preserving the surround- ing scene qualitatively. These results suggest that VLM-assisted segment annotation is a practical route to data-efficient, spatially controllable satellite image editing.
- Abstract(参考訳): 衛星画像の編集には空間的に正確なオブジェクトレベル制御が必要であるが、オブジェクトマスク、セマンティックラベル、ペア編集が大規模に利用できないため、オーバヘッド画像の編集データセットを教師付きで作成するにはコストがかかる。
マスク条件の衛星画像編集フレームワークであるSatEditを導入する。
SatEditは、セグメント基礎モデルを用いたオブジェクトマスクを提案し、Vision-Language Modelを用いてサンプルセグメントにセマンティック・ラ・ベルを割り当て、マスク誘導塗布によるペア追加および除去試験の実施前に軽量な人間の検証を適用する。
91のクラスで1,014歳と822の検証対象アノテーションを含むSODA-A由来のデータセット上で,高解像度画像編集バックボーンをLoRAで微調整する。
SatE- ditは、オープンソースおよびプロプライエタリな画像編集モデルとの制御された比較において、CLIPスコアが0.6322、CLIPデルタが0.0726で、マスク付き領域のセマンティックアライメントが最も高い。
以上の結果から,VLMを用いたセグメントアノテーションは,データ効率・空間制御可能な衛星画像編集のための実用的な方法であることが示唆された。
関連論文リスト
- SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization [64.6372217552272]
公開編集データセットには、IMLトレーニングサンプルと構造的に同一(オリジナル、編集)のペアが数百万個含まれており、ピクセルレベルのマスクのみが欠如している。
本稿では,視覚基盤のバックボーンにおいて意味・特徴の相違を行うSIGMAを提案する。
1.1M IMLトレーニングセットを生成し、5つのデータセットに対して+18.34%のF1で6つの多様な検出器を改善する。
論文 参考訳(メタデータ) (2026-05-27T03:55:13Z) - Masked Generative Transformer Is What You Need for Image Editing [91.7627902312967]
拡散モデルは、編集された領域を周囲のコンテキストと絡み合わせることで、変更が持続するべき領域に伝播する。
本稿では,局所化トークン予測パラダイムが意図した領域の変更を自然に限定するMasked Generative Transformers (MGTs)を活用することによって,根本的に異なるアプローチを提案する。
本稿では,MGTベースの編集フレームワークであるEditMGTについて紹介する。
論文 参考訳(メタデータ) (2026-05-11T17:05:52Z) - MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion [9.149799210311468]
編集領域をより正確に識別するためにMADiffモデルを提案する。
Atention-Enhanced Diffusion Model は編集サイズを強化するために提案されている。
提案手法は,編集領域のマスクを正確に予測し,ファッション画像編集における編集サイズを大幅に向上させることができる。
論文 参考訳(メタデータ) (2024-12-28T07:34:49Z) - BrushEdit: All-In-One Image Inpainting and Editing [76.93556996538398]
BrushEditは、インペイントベースの命令誘導画像編集パラダイムである。
本研究では,MLLMとデュアルブランチ画像の描画モデルを統合することで,自由形式の命令編集を可能にするシステムを提案する。
本フレームワークは,MLLMとインパインティングモデルを効果的に組み合わせ,7つの指標で優れた性能を実現する。
論文 参考訳(メタデータ) (2024-12-13T17:58:06Z) - SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image Editing [42.23117201457898]
本稿では,大規模言語モデル(LLM)とText2生成モデルを統合し,グラフベースの画像編集を行う新しいフレームワークを提案する。
本フレームワークは,編集精度とシーン美学の観点から,既存の画像編集手法を著しく上回っている。
論文 参考訳(メタデータ) (2024-10-15T17:40:48Z) - iEdit: Localised Text-guided Image Editing with Weak Supervision [53.082196061014734]
テキスト誘導画像編集のための新しい学習法を提案する。
ソースイメージに条件付けされた画像とテキスト編集プロンプトを生成する。
画像の忠実度、CLIPアライメントスコア、および生成された画像と実際の画像の両方を定性的に編集する点において、画像に対して好ましい結果を示す。
論文 参考訳(メタデータ) (2023-05-10T07:39:14Z) - EditGAN: High-Precision Semantic Image Editing [120.49401527771067]
EditGANは高品質で高精度なセマンティック画像編集のための新しい手法である。
EditGANは前例のない細部と自由度で画像を操作可能であることを示す。
また、複数の編集を組み合わせることも簡単で、EditGANのトレーニングデータ以外の編集も可能になります。
論文 参考訳(メタデータ) (2021-11-04T22:36:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。