論文の概要: SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision
- arxiv url: http://arxiv.org/abs/2608.09097v1
- Date: Mon, 10 Aug 2026 03:50:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.074987
- Title: SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision
- Title(参考訳): SI-Edit:Pixel-Level精度で局所画像編集を指導するSketch-Instruction
- Authors: Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie,
- Abstract要約: 命令誘導ローカルスケッチ編集に特化して設計された高品質なデータセットである**SI-Data**を紹介する。
意味的命令と正確な幾何学的制約を統合する*SI-Edit*という協調的なフレームワークを提案する。
SI-Editはスケッチベースの画像編集のベースラインよりも信頼性の高い構造制御を提供する。
- 参考スコア(独自算出の注目度): 10.498146915766027
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite rapid advances in generative models, achieving pixel-level precision in sketch-based image editing remains a persistent challenge, particularly for fine-grained local deformations. This gap stems primarily from the critical shortage of high-quality, publicly available benchmark datasets that jointly provide geometric constraints and semantic instructions. To address this issue, we first introduce **SI-Data**, a high-quality dataset specifically designed for instruction-guided local sketch editing. We develop an automated pipeline leveraging Multimodal Large Language Models (MLLMs) to synthesize comprehensive quadruplets comprising original images, local geometric sketches, semantic instructions, and corresponding edited images. By providing both reliable spatial anchors and explicit semantic intent, SI-Data uniquely enables collaborative spatial-semantic learning. Building upon this, we propose a collaborative framework called **SI-Edit** that integrates semantic instructions with precise geometric constraints. Furthermore, to address the lack of standardized evaluation, we establish a comprehensive set of metrics designed to measure both structural fidelity (e.g., sketch-to-edge alignment) and semantic adherence. Experimental results demonstrate that SI-Edit provides more reliable structural control than baselines for sketch-based image editing, and achieves precise, pixel-level local refinements aligned with user intent. The data and code are released on the [project page](https://github.com/ywxsuperstar/SIEdit).
- Abstract(参考訳): 生成モデルの急速な進歩にもかかわらず、スケッチベースの画像編集においてピクセルレベルの精度を達成することは、特にきめ細かい局所的な変形に対して、永続的な課題である。
このギャップは主に、幾何学的制約と意味的な指示を共同で提供する高品質で公開可能なベンチマークデータセットの欠如に起因している。
この問題に対処するために、まず**SI-Data**を導入します。
我々は,マルチモーダル大言語モデル(MLLM)を利用して,原画像,局所幾何学的スケッチ,意味的命令,対応する編集画像からなる包括的四重項を合成する自動パイプラインを開発した。
信頼性の高い空間アンカーと明示的な意味的意図を提供することにより、SI-Dataは、一意に協調的な空間意味学習を可能にする。
そこで我々は,*SI-Edit**という協調的なフレームワークを提案する。
さらに、標準化された評価の欠如に対処するため、構造的忠実度(例えば、スケッチ・ツー・エッジのアライメント)とセマンティック・アライメント(セマンティック・アライメント)の両方を測定するために設計された、包括的なメトリクスのセットを確立する。
実験の結果,SI-Editはスケッチベースの画像編集のベースラインよりも信頼性の高い構造制御を提供し,ユーザの意図に合わせた正確な画素レベルの局所改善を実現することがわかった。
データとコードは[プロジェクトページ](https://github.com/ywxsuperstar/SIEdit)でリリースされます。
関連論文リスト
- CoT-Edit: Let CoT Guide Instruction Video Editing [13.600094788792633]
本稿では,意味的意図と空間的実行を橋渡しする計画ガイド-編集フレームワークを提案する。
我々のフレームワークでは、Chain-of-Thought(CoT)強化マルチモーダル言語モデル(MLLM)がプランナーとして機能する。
これらの空間的先行は、ボックス条件のマスクジェネレータを誘導し、不明瞭なグローバル検索を局所的でコンテキスト対応の洗練に変換する。
論文 参考訳(メタデータ) (2026-08-02T09:20:15Z) - StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation [72.84181869780627]
StructDiffは、単一画像生成のための単一スケール拡散モデルに基づく生成フレームワークである。
3次元位置符号化(PE)を空間的先行として組み込んでおり、生成されたオブジェクトの位置、スケール、局所的な詳細を柔軟に制御することができる。
また、テキスト誘導画像生成、画像編集、アウトペインティング、ペイント・ツー・イメージ合成など、下流タスクにも幅広い適用性を示す。
論文 参考訳(メタデータ) (2026-04-14T10:55:43Z) - SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing [85.49998134609665]
画像空間編集は幾何学的な変換を行い、オブジェクトのレイアウトやカメラの視点を正確に制御できる。
現在のモデルはきめ細かい空間操作には不十分であり、専用のアセスメントスイートを動機付けている。
本研究では,空間編集を評価する完全ベンチマークであるSpatialEdit-Benchを紹介する。
制御可能なブレンダーパイプラインで生成された合成データセットであるSpatialEdit-500kを構築した。
論文 参考訳(メタデータ) (2026-04-06T17:54:42Z) - Seeing the Unseen: Mask-Driven Positional Encoding and Strip-Convolution Context Modeling for Cross-View Object Geo-Localization [8.559240391514063]
クロスビューオブジェクトジオローカライゼーションは、クロスビューマッチングによる高精度オブジェクトローカライゼーションを可能にする。
既存の手法はキーポイントに基づく位置符号化に依存しており、オブジェクトの形状情報を無視しながら2次元座標のみをキャプチャする。
空間座標と物体シルエットの両方を捕捉するために分割マスクを利用するマスクベースの位置符号化方式を提案する。
EDGeoは、堅牢なクロスビューオブジェクトジオローカライズのためのエンドツーエンドフレームワークである。
論文 参考訳(メタデータ) (2025-10-23T06:07:07Z) - PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing [6.102786823233576]
ローカライズされた被写体駆動画像編集は、ユーザが指定したオブジェクトをシームレスにターゲットシーンに統合することを目的としている。
PosBridgeは、カスタムオブジェクトを挿入するための効率的で柔軟なフレームワークである。
PosBridgeは、構造整合性、外観の忠実さ、計算効率において、主流のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-08-24T11:09:01Z) - Image Editing As Programs with Diffusion Models [69.05164729625052]
本稿では,Diffusion Transformer (DiT) アーキテクチャ上に構築された統合画像編集フレームワークである IEAP (Image Editing As Programs) を紹介する。
IEAPは、複雑な編集命令を原子操作のシーケンスに分解して、リダミストレンズによる命令編集にアプローチする。
我々のフレームワークは、特に複雑なマルチステップ命令に対して、より優れた精度とセマンティック忠実度を提供する。
論文 参考訳(メタデータ) (2025-06-04T16:57:24Z) - Preserve or Modify? Context-Aware Evaluation for Balancing Preservation and Modification in Text-Guided Image Editing [26.086806549826058]
テキスト誘導画像編集は、対象のテキストに基づいて修正を実装しながら、ソース画像の中核要素の保存を求める。
既存のメトリクスは、全く異なるソースイメージとターゲットテキストのペアに対して、同じ評価基準を無差別に適用する、文脈の盲点問題を持つ。
保存・修正の側面を適応的にコーディネートする文脈対応メトリックであるAugCLIPを提案する。
論文 参考訳(メタデータ) (2024-10-15T08:12:54Z) - InverseMeetInsert: Robust Real Image Editing via Geometric Accumulation Inversion in Guided Diffusion Models [20.90990477016161]
GEO(Geometry-Inverse-Meet-Pixel-Insert,略してGeometry-Meet-Pixel-Insert)は、非常に多用途な画像編集技術である。
本手法では,テキストプロンプトと画像プロンプトをシームレスに統合し,多種多様な正確な編集結果を得る。
論文 参考訳(メタデータ) (2024-09-18T06:43:40Z) - SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form
Layout-to-Image Generation [68.42476385214785]
本稿では,レイアウトから派生した特徴写像を用いた空間意味マップガイド(SSMG)拡散モデルを提案する。
SSMGは,従来の研究に比べて空間的,意味的な制御性に優れた生成品質を実現する。
また,RSA(Relation-Sensitive Attention)機構とLSA(Location-Sensitive Attention)機構を提案する。
論文 参考訳(メタデータ) (2023-08-20T04:09:12Z) - iEdit: Localised Text-guided Image Editing with Weak Supervision [53.082196061014734]
テキスト誘導画像編集のための新しい学習法を提案する。
ソースイメージに条件付けされた画像とテキスト編集プロンプトを生成する。
画像の忠実度、CLIPアライメントスコア、および生成された画像と実際の画像の両方を定性的に編集する点において、画像に対して好ましい結果を示す。
論文 参考訳(メタデータ) (2023-05-10T07:39:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。