論文の概要: GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- arxiv url: http://arxiv.org/abs/2607.00920v1
- Date: Wed, 01 Jul 2026 13:23:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.900844
- Title: GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- Title(参考訳): GMO-E$^2$DIT:Eコマース画像のための接地型マルチオペレーション編集
- Authors: Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li,
- Abstract要約: 実世界のeコマース画像編集には、グローバルリプライよりも複数の、ローカライズされた、監査可能な操作が必要となることが多い。
既存のワンショットエディタは、意図の解決、空間的接地、合成を1ステップに分割する。
GMO-E$2$DITは、視覚言語モデル(VLM)とマスク条件の画像エディタを結合して構成されたマルチターンタスク補完に取り組むエージェント編集フレームワークである。
- 参考スコア(独自算出の注目度): 16.213122519512932
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world e-commerce image editing often requires multiple, localized, and auditable operations rather than global restyling. This compositional nature poses a dual challenge: models must precisely apply all requested edits to the correct regions while preserving unmodified content, even under ambiguous instructions. Existing one-shot editors conflate intent resolution, spatial grounding, and synthesis into a single step, frequently resulting in partial execution failures, which is unacceptable for commercial scenarios. To address this, we introduce GMO-E$^2$DIT, an agentic editing framework that couples a Vision-Language Model (VLM) with a mask-conditioned image editor to tackle structured multi-turn task completion. Given an underspecified instruction, the VLM agent constructs a region-grounded edit agenda, effectively decoupling cognitive reasoning from generative rendering. The framework then executes sub-programs via operation-aware masks and references, utilizing a reflection-driven loop to inspect intermediate results and determine the subsequent state. This iterative mechanism reliably preserves safe partial progress, retries unfinished operations, and recovers from errors. Furthermore, we develop a unified data pipeline providing aligned supervision for planning, execution, and reflection, alongside EComEditBench, a comprehensive benchmark for instruction-driven evaluation. Extensive experiments demonstrate that GMO-E$^2$DIT achieves competitive performance compared to strong closed-source models, yielding superior instruction accuracy and edit fidelity over existing baselines.
- Abstract(参考訳): 実世界のeコマース画像編集には、グローバルリプライよりも複数の、ローカライズされた、監査可能な操作が必要となることが多い。
モデルは、曖昧な指示の下でも、修正されていないコンテンツを保存しながら、要求された全ての編集を正しい領域に正確に適用する必要がある。
既存のワンショットエディタは、意図の解決、空間的な接地、合成を単一のステップに分割し、商業シナリオでは受け入れられない部分的な実行障害を頻繁に発生させる。
GMO-E$^2$DITは、視覚言語モデル(VLM)とマスク条件の画像エディタを結合して構成されたマルチターンタスク補完に取り組むエージェント編集フレームワークである。
未特定の命令が与えられた後、VLMエージェントは領域的な編集アジェンダを構築し、認知的推論と生成的レンダリングを効果的に分離する。
その後、フレームワークは操作認識マスクと参照を通じてサブプログラムを実行し、リフレクション駆動ループを使用して中間結果を検査し、その後の状態を決定する。
この反復的なメカニズムは、安全な部分的な進捗を確実に保存し、未完了の操作を再試行し、エラーから回復する。
さらに,計画,実行,リフレクションの調整を行う統一データパイプラインと,命令駆動評価の総合ベンチマークであるEComEditBenchを開発した。
GMO-E$^2$DITは、強いクローズドソースモデルと比較して競争性能が向上し、命令精度が向上し、既存のベースラインよりも忠実に編集できることを示した。
関連論文リスト
- CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences [51.86576932800981]
CV-Arenaは、プロの規模でこの能力を評価するために設計されたオープンベンチマークである。
CV-Arenaは16の命令ベースの視覚タスクタイプにまたがる12Kの高解像度実像命令ペアを含んでいる。
我々は,計画,編集,検証を組み合わせた軽量エージェントモデルCV-Agentを開発した。
論文 参考訳(メタデータ) (2026-05-30T23:37:55Z) - SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent [17.74253780030394]
SWE-Editは、コード編集を2つの特別なサブエージェントに分解する。
SWE-bench Verifiedでは、SWE-Editは推論コストを17.9%削減し、解決率を2.1%改善する。
論文 参考訳(メタデータ) (2026-04-28T20:35:09Z) - Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions [27.891822809255682]
本稿では,基本モデルを変更することなく,編集性能を向上させる適応型タスク修正フレームワークを提案する。
私たちのキーとなるアイデアは、元のイメージインストラクションペアをMLLMエージェントによって動的に決定され実行される一連の操作に変換することです。
論文 参考訳(メタデータ) (2026-04-17T10:17:22Z) - CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator [8.901958956012072]
条件付き画像編集は、厳密な構造制御を必要とするシナリオにおいて不可欠である。
ほとんどのアプローチは単一ステップ生成に依存します。
我々は、条件付き編集を品質に配慮したフィードバック駆動プロセスとして再構成する構造化マルチエージェントフレームワーク、textbfCAMEOを提案する。
論文 参考訳(メタデータ) (2026-04-03T16:27:02Z) - IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection [40.21337735524356]
IMAGAgentは、"plan-execute-reflect"クローズドループメカニズムに基づいたマルチターン画像編集エージェントフレームワークである。
命令解析、ツールスケジューリング、および統一パイプライン内の適応補正の深いシナジーを実現する。
構築した textbfMTEditBench と MagicBrush データセットによる実験により,IMAGAgent が既存の手法よりもはるかに優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-02-12T02:37:38Z) - CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning [98.98349220451216]
CoEditor++は、編集を"編集する方法"と"編集方法"に分解する、トレーニング不要のフレームワークである。
我々は,CoEditor++が編集タスクと編集タスクの両方において,最先端のパフォーマンスを実現することを示す。
以上の結果から,認知中心型画像編集の可能性が示唆された。
論文 参考訳(メタデータ) (2026-01-31T12:20:46Z) - UniREditBench: A Unified Reasoning-based Image Editing Benchmark [52.54256348710893]
この研究は、推論に基づく画像編集評価のための統一ベンチマークUniREditBenchを提案する。
精巧にキュレートされた2,700個のサンプルからなり、8つの一次次元と18のサブ次元にわたる実世界シナリオとゲーム世界のシナリオをカバーしている。
このデータセットにBagelを微調整し、UniREdit-Bagelを開発した。
論文 参考訳(メタデータ) (2025-11-03T07:24:57Z) - EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing [170.71134330650796]
EdiVal-Agentは、命令ベースの画像編集のためのオブジェクト指向評価フレームワークである。
標準のシングルターンだけでなく、マルチターンの命令ベースの編集を精度良く評価するように設計されている。
EdiVal-Benchは、インコンテキスト、フローマッチング、拡散パラダイムにまたがる9つの命令タイプと13の最先端編集モデルをカバーするベンチマークである。
論文 参考訳(メタデータ) (2025-09-16T17:45:39Z) - An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing [5.192553173010677]
RefineEdit-Agentは、複雑で反復的でコンテキスト対応の画像編集のための、新しい、トレーニング不要なインテリジェントエージェントフレームワークである。
我々のフレームワークは、LVI駆動のインストラクションとシーン理解モジュール、多レベル編集プランナー、反復画像編集モジュール、LVLM駆動のフィードバックと評価ループから構成されている。
論文 参考訳(メタデータ) (2025-08-24T16:28:18Z) - Image Editing As Programs with Diffusion Models [69.05164729625052]
本稿では,Diffusion Transformer (DiT) アーキテクチャ上に構築された統合画像編集フレームワークである IEAP (Image Editing As Programs) を紹介する。
IEAPは、複雑な編集命令を原子操作のシーケンスに分解して、リダミストレンズによる命令編集にアプローチする。
我々のフレームワークは、特に複雑なマルチステップ命令に対して、より優れた精度とセマンティック忠実度を提供する。
論文 参考訳(メタデータ) (2025-06-04T16:57:24Z) - What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models [88.398085358514]
DICEは、原画像と編集画像の局所的な差異を検出するために設計されたモデルである。
自己監督、塗布ネットワークからの蒸留、全監督を利用する戦略を用いて訓練されている。
DICEは一貫性のある編集を効果的に識別し、異なる編集モデルによって生成された画像を人間の判断と強く相関して効果的に評価する。
論文 参考訳(メタデータ) (2025-05-26T18:00:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。