論文の概要: CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
- arxiv url: http://arxiv.org/abs/2607.05465v1
- Date: Mon, 06 Jul 2026 04:57:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.270695
- Title: CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
- Title(参考訳): CanvasAgent:ビジュアルツールオーケストレーションによる複雑なイメージ生成と編集を実現する
- Authors: Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang,
- Abstract要約: CanvasCraftは、複雑な画像の作成と編集のための大規模マルチモーダル・ツール・データセットである。
また,マルチターンインタラクションによる異種視覚ツールのオーケストレーションを学習するマルチモーダルエージェントCanvasAgentについても紹介する。
- 参考スコア(独自算出の注目度): 11.992882604393003
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Complex image creation and editing often require more than a single generation or editing model. A user request may involve synthesizing images, localizing objects, segmenting regions, editing selected content, compositing intermediate assets, reading text, and enhancing the final result. Such tasks shift multimodal agents from perception-augmented reasoning to manipulation-centered visual creation, where tools must actively transform visual states rather than merely inspect them. However, existing multimodal tool-use agents are mostly optimized for perception, search, or domain-specific editing, and lack large-scale supervision for executable image-creation trajectories. In this paper, we introduce CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and \textbf{CanvasAgent}, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction. CanvasCraft contains 140K fully annotated executable trajectories and 10K RL task specifications. CanvasAgent is first trained with SFT to learn executable reasoning-action trajectories, and is then optimized with GRPO using a hybrid reward that combines outcome- and process-level signals. During rollout, CanvasAgent inspects intermediate results, tracks visual assets, and adapts tool decisions to the evolving visual state. Experiments evaluate both final image quality and trajectory behavior, demonstrating the effectiveness of CanvasAgent and the proposed dataset for complex multi-tool image creation workflows.
- Abstract(参考訳): 複雑な画像の作成と編集は、しばしば1世代以上の編集モデルを必要とする。
ユーザ要求には、画像の合成、オブジェクトのローカライズ、セグメント化、選択されたコンテンツの編集、中間資産の合成、テキストの読み込み、最終的な結果の強化が含まれる。
このようなタスクは、マルチモーダルエージェントを知覚を増強した推論から、操作中心の視覚生成へとシフトさせる。
しかし、既存のマルチモーダル・ツール・ユース・エージェントは、主に知覚、検索、ドメイン固有の編集に最適化されており、実行可能画像生成トラジェクトリに対する大規模な監督が欠如している。
本稿では、複雑な画像の作成と編集のための大規模マルチモーダルツール使用データセットであるCanvasCraftと、マルチターンインタラクションによる異種視覚ツールのオーケストレーションを学習するツール拡張マルチモーダルエージェントである‘textbf{CanvasAgent}を紹介する。
CanvasCraftには140Kの完全な注釈付き実行可能なトラジェクトリと10K RLタスク仕様が含まれている。
CanvasAgentはまずSFTで学習し、結果とプロセスレベルの信号を組み合わせたハイブリッド報酬を用いてGRPOで最適化される。
CanvasAgentはロールアウト中に中間結果を検査し、ビジュアルアセットを追跡し、ツールの決定を進化する視覚状態に適応させる。
画像の最終的な品質と軌道の挙動を評価し、CanvasAgentと複雑なマルチツール画像生成ワークフローのためのデータセットの有効性を実証した。
関連論文リスト
- IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment [16.199788035961564]
我々は、パラメータ化されたツールを明示的かつ解釈可能なアクション空間で操作することを学ぶ対話型画像編集エージェントIEAを提案する。
IEAは3段階のマルチタスクパイプラインを通じて訓練される: 蒸留された専門家編集のSFT、類似性の改善、ツール有用性、意図の要約のための報奨付きGRPO、(3)画像編集、精細化、ユーザ意図の要約を共同でマスターするための大規模合成微調整。
論文 参考訳(メタデータ) (2026-06-06T07:11:08Z) - coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation [48.027946344020314]
対話型多エージェント対話フレームワークであるcoDrawAgentsを提案する。
インタプリタは、直接テキスト・ツー・イメージ・パスとレイアウト対応マルチエージェント・プロセスとを判定する。
Plannerは、進化する視覚的コンテキストで決定を下しながら、同じセマンティック優先レベルを持つオブジェクトのレイアウトを提案する。
Checkerは空間的一貫性と属性アライメントを検証することで、明示的なエラー訂正機構を導入する。
Painterはイメージをステップごとに合成し、新しく計画されたオブジェクトをキャンバスに組み込んで、その後のイテレーションに対してよりリッチなコンテキストを提供する。
論文 参考訳(メタデータ) (2026-03-13T09:32:06Z) - IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection [40.21337735524356]
IMAGAgentは、"plan-execute-reflect"クローズドループメカニズムに基づいたマルチターン画像編集エージェントフレームワークである。
命令解析、ツールスケジューリング、および統一パイプライン内の適応補正の深いシナジーを実現する。
構築した textbfMTEditBench と MagicBrush データセットによる実験により,IMAGAgent が既存の手法よりもはるかに優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-02-12T02:37:38Z) - Training Multi-Image Vision Agents via End2End Reinforcement Learning [51.81337984526068]
我々は、エンドツーエンドの強化学習によって訓練されたオープンソースの視覚エージェントであるIMAgentを提案する。
マルチエージェントシステムを利用することで、困難かつ視覚的にリッチなマルチイメージQAペアを生成する。
我々は、視覚的反射と確認のための2つの特別なツールを開発し、モデルが積極的に画像コンテンツに注意を向けることを可能にする。
論文 参考訳(メタデータ) (2025-12-05T10:02:38Z) - PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images [58.73779101355669]
PixelCraftは、高忠実度画像処理と、構造化画像に対する柔軟な視覚的推論のための、新しいマルチエージェントシステムである。
この基盤の上に構築されたPixelCraftは、ツールの選択、エージェントの議論、自己批判といった3段階の動的なワークフローを通じて、視覚的推論を容易にする。
論文 参考訳(メタデータ) (2025-09-29T17:59:49Z) - Marmot: Object-Level Self-Correction via Multi-Agent Reasoning [55.74860093731475]
Marmotは、マルチオブジェクトの自己修正にマルチエージェント推論を活用する、新しくて一般化可能なフレームワークである。
Marmotは、画像生成タスクにおけるオブジェクトカウント、属性割り当て、空間関係の精度を大幅に改善する。
論文 参考訳(メタデータ) (2025-04-10T16:54:28Z) - Group Diffusion Transformers are Unsupervised Multitask Learners [49.288489286276146]
GDT(Group Diffusion Transformers)は、多様な視覚生成タスクを統合する新しいフレームワークである。
GDTは、画像間で自己注意トークンを連結することにより、最小限のアーキテクチャ変更で拡散トランスフォーマーを構築する。
我々は、30の視覚生成タスクに200以上の命令を割り当てたベンチマークでGDTを評価した。
論文 参考訳(メタデータ) (2024-10-19T07:53:15Z) - Divide and Conquer: Language Models can Plan and Self-Correct for
Compositional Text-to-Image Generation [72.6168579583414]
CompAgentは、大規模な言語モデル(LLM)エージェントをコアとして、コンポジションテキスト・画像生成のためのトレーニング不要のアプローチである。
提案手法は,オープンワールド合成T2I生成のための総合的なベンチマークであるT2I-CompBenchに対して10%以上の改善を達成している。
論文 参考訳(メタデータ) (2024-01-28T16:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。