論文の概要: Beyond Plausibility: Verifiable Fine-Grained Image Editing on Structured Assets
- arxiv url: http://arxiv.org/abs/2610.04381v1
- Date: Sat, 03 Oct 2026 08:48:13 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:06:19.459555
- Title: Beyond Plausibility: Verifiable Fine-Grained Image Editing on Structured Assets
- Title(参考訳): 可視性を超えて:構造化アセット上での細粒度画像編集の検証
- Abstract要約: 本稿では, 決定論的, 4軸評価を併用した, 現実的な構造化資産を対象とする, きめ細かな, 命令忠実な画像編集のためのベンチマークを提案する。
制御されたソースコード編集は、正確なターゲット画像、ピクセルレベルの編集マスク、明示的な編集仕様を出力しながら、元の視覚的コンテキストを保存する。
最強のモデルでさえ、フルクレジットには程遠いことが分かっています。
- 参考スコア(独自算出の注目度): 21.31237367377913
- License:
- Abstract: Fine-grained image editing requires more than producing a visually plausible result: an editor must execute the requested attribute change precisely while leaving everything else intact. However, existing benchmarks leave a critical gap between realism and verifiability: benchmarks built on realistic images typically rely on human or vision--language model judgments, while deterministic evaluation has largely focused on synthetic shape canvases, with application-oriented extensions primarily limited to charts. This makes it difficult to determine precisely how much of a requested edit was executed, where unintended changes occurred, and whether small differences between models reflect genuine editing capability or evaluator uncertainty. To bridge this gap, we present VeriEdit-Bench, a benchmark for fine-grained, instruction-faithful image editing across realistic structured assets with deterministic, four-axis evaluation. Its 1,740 cases are compiled from the source code of 153 Scalable Vector Graphics (SVG) graphics, charts, web interfaces, and presentation slides. Controlled source-code edits preserve the original visual context while yielding exact target images, pixel-level edit masks, and explicit edit specifications, enabling reproducible scoring along four axes: edit fidelity, preservation, localization, and magnitude. Evaluating eleven editors, we find that even the strongest model remains far from full credit; rankings for the same recoloring operation reverse between charts and SVG graphics; and outputs with similar pixel-accuracy profiles can still differ substantially in localization and change magnitude. This decomposition yields graded, verifiable feedback and exposes model-specific capability and failure profiles that holistic scores or evaluator-dependent judgments may obscure.
- Abstract(参考訳): きめ細かい画像編集には、視覚的に妥当な結果を生成する以上のものが必要である:エディタは要求された属性の変更を正確に実行し、他の全てをそのままにしておく必要がある。
しかし、既存のベンチマークはリアリズムと検証可能性の間に重要なギャップを残している: 現実的な画像の上に構築されたベンチマークは、一般的に人間または視覚言語によるモデル判断に依存し、決定論的評価は、主にチャートに限られる、合成形状のキャンバスに主に焦点を当てている。
これにより、要求された編集のどれだけが実行されたか、意図しない変更が発生したか、モデルの小さな違いが真の編集能力や評価の不確実性を反映しているかを正確に判断することが困難になる。
このギャップを埋めるために、我々は、決定論的、4軸評価を伴う現実的な構造化資産全体にわたるきめ細かな、命令に忠実な画像編集のためのベンチマークであるVeriEdit-Benchを提案する。
1,740のケースは、153のスケーラブルベクターグラフィックス(SVG)グラフィックス、チャート、Webインターフェース、プレゼンテーションスライドのソースコードからコンパイルされる。
制御されたソースコード編集は、正確なターゲット画像、ピクセルレベルの編集マスク、明示的な編集仕様を出力しながら、元の視覚的コンテキストを保存する。
11個のエディターを評価したところ、最強モデルでさえフルクレジットには遠く及ばず、グラフとSVGグラフィックの間で同じリカラー操作のランクが逆転し、同様の画素精度プロファイルを持つ出力は、ローカライズや変更の規模で大きく異なることが判明した。
この分解は、グレードされた検証可能なフィードバックをもたらし、モデル固有の能力と失敗プロファイルを公開し、全体論的なスコアや評価者に依存した判断が曖昧になる可能性がある。
関連論文リスト
- PaintBench: Deterministic Evaluation of Precise Visual Editing [50.50559031686293]
PaintBenchは20の基本的なビジュアル編集操作のベンチマークである。
11の画像編集モデル全体では、全体的なパフォーマンスが低く、現在の最高パフォーマンスの業界リーダーは17.1%に過ぎなかった。
詳細なベンチマーク診断では、オブジェクト数、背景の複雑さ、色スキーム、編集領域サイズなどのシーン変動によって生じるパフォーマンス劣化が示されている。
論文 参考訳(メタデータ) (2026-05-29T16:01:14Z) - EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement [76.76247443244293]
EditRefinerは、編集後の修正を人間のような認識・推論・行動評価ループとして再構成するエージェントフレームワークである。
歪み、診断精度、人間の知覚アライメントにおいて、最先端の手法を一貫して上回る。
論文 参考訳(メタデータ) (2026-05-08T09:05:08Z) - Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach [48.01137214342501]
テキスト誘導画像編集手法の体系的評価のためのベンチマークであるTIEditを紹介する。
信頼性の高い主観的評価を得るために、20人の専門家が採用され、307,200人の主観的評価が得られる。
さらに,隠蔽表現の中間層探索により編集品質を推定するLCMベースの評価器であるEditProbeを提案する。
論文 参考訳(メタデータ) (2026-03-20T09:05:10Z) - Charts Are Not Images: On the Challenges of Scientific Chart Editing [66.38730113476677]
textitFigEditは、3万以上のサンプルからなる科学的フィギュア編集のベンチマークである。
私たちのベンチマークでは、ピクセルレベルの操作の重大な制限が示されています。
textitFigEdit をリリースすることにより,構造対応図形編集の体系的な進歩の実現を目指す。
論文 参考訳(メタデータ) (2025-11-30T06:13:48Z) - LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing [0.276240219662896]
トレーニング不要で効率的な画像編集手法であるLOREを紹介する。
LOREは逆ノイズを直接最適化し、既存のアプローチの一般化と制御可能性の限界に対処する。
実験の結果,LOREはセマンティックアライメント,画像品質,背景忠実度において,強いベースラインを著しく上回ることがわかった。
論文 参考訳(メタデータ) (2025-08-05T06:45:04Z) - Preserve or Modify? Context-Aware Evaluation for Balancing Preservation and Modification in Text-Guided Image Editing [26.086806549826058]
テキスト誘導画像編集は、対象のテキストに基づいて修正を実装しながら、ソース画像の中核要素の保存を求める。
既存のメトリクスは、全く異なるソースイメージとターゲットテキストのペアに対して、同じ評価基準を無差別に適用する、文脈の盲点問題を持つ。
保存・修正の側面を適応的にコーディネートする文脈対応メトリックであるAugCLIPを提案する。
論文 参考訳(メタデータ) (2024-10-15T08:12:54Z) - Enjoy Your Editing: Controllable GANs for Image Editing via Latent Space
Navigation [136.53288628437355]
コントロール可能なセマンティックイメージ編集により、ユーザーはクリック数回で画像属性全体を変更できる。
現在のアプローチでは、絡み合った属性編集、グローバルなイメージアイデンティティの変更、フォトリアリズムの低下に悩まされることが多い。
本稿では,主に定性評価に焦点を当てた先行研究とは異なり,制御可能な編集性能を測定するための定量的評価手法を提案する。
論文 参考訳(メタデータ) (2021-02-01T21:38:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。