論文の概要: ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
- arxiv url: http://arxiv.org/abs/2608.04436v1
- Date: Wed, 05 Aug 2026 04:26:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.722914
- Title: ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
- Title(参考訳): ToolArtist: エージェント画像生成のための統一マルチモーダルモデルを用いたツール
- Authors: Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan,
- Abstract要約: ToolArtistは、Unified Multimodal Model (UMM) の後のトレーニングによって得られる完全なエージェント画像生成モデルである
ToolArtistは1つの統一ポリシー内で推論、外部ツールの使用、ネイティブ画像生成をオーケストレーションする。
実験によると、エージェントポリシーの下にオープンワールドイメージ生成プロセス全体を配置することは、固定パイプラインによるアプローチよりも一貫して優れている。
- 参考スコア(独自算出の注目度): 57.673228074553414
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image (T2I) models can produce visually compelling images, yet they remain limited on open-world tasks that require complex semantic understanding, multi-step reasoning, and the integration of external world knowledge. Existing efforts introduce agent capabilities into image generation, but they either prescribe a fixed workflow or place only a subset of the open-world image generation process under agent control. Consequently, reasoning, tool invocation, and image generation are not coordinated by a single policy. We propose ToolArtist, a fully agentic image generation model obtained by post-training a Unified Multimodal Model (UMM). ToolArtist dynamically orchestrates reasoning, external tool use, and native image generation within one unified policy. During Supervised Fine-Tuning (SFT), we equip a teacher agent with search tools alongside an image-generation tool. We then convert the collected trajectories into a UMM compatible format, where the image-generation tool is concealed while the resulting generated images are retained. During Reinforcement Learning (RL), we develop an agentic RL infrastructure for UMMs and introduce Reason-Act-Draw GRPO (RAD-GRPO), which uses complementary intent and quality rewards to jointly optimize the model. Experiments show that placing the entire open-world image-generation process under an agent policy consistently outperforms approaches with fixed pipelines or only partially agent-controlled components. We release the training data and the complete post-training infrastructure.
- Abstract(参考訳): テキスト・ツー・イメージ(T2I)モデルは視覚的に魅力的なイメージを生成できるが、複雑な意味理解、多段階推論、外部世界の知識の統合を必要とするオープンワールドのタスクに制限される。
既存の取り組みでは、イメージ生成にエージェント機能を導入しているが、固定されたワークフローを規定するか、エージェントコントロールの下でオープンワールド画像生成プロセスのサブセットのみを配置する。
その結果、推論、ツール呼び出し、画像生成は単一のポリシーで調整されない。
本稿では,統一マルチモーダルモデル(UMM)の訓練後得られた,完全なエージェント画像生成モデルであるToolArtistを提案する。
ToolArtistは,ひとつの統一ポリシ内で推論,外部ツール使用,ネイティブイメージ生成を動的にオーケストレーションする。
Supervised Fine-Tuning (SFT) では,教師エージェントに画像生成ツールとともに検索ツールを装備する。
そして、収集した軌跡をUMM互換のフォーマットに変換し、生成した画像を保持しながら画像生成ツールを隠蔽する。
強化学習(Reinforcement Learning, RL)において,UMMのためのエージェントRLインフラストラクチャを開発し,補足的意図と品質報酬を用いてモデルを協調的に最適化するReason-Act-Draw GRPO(RAD-GRPO)を導入する。
実験により、オープンワールド画像生成プロセス全体をエージェントポリシーの下に配置すると、固定パイプラインや部分的にエージェント制御されたコンポーネントによるアプローチよりも一貫してパフォーマンスが向上することが示された。
トレーニングデータとトレーニング後の完全なインフラストラクチャをリリースします。
関連論文リスト
- CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration [11.992882604393003]
CanvasCraftは、複雑な画像の作成と編集のための大規模マルチモーダル・ツール・データセットである。
また,マルチターンインタラクションによる異種視覚ツールのオーケストレーションを学習するマルチモーダルエージェントCanvasAgentについても紹介する。
論文 参考訳(メタデータ) (2026-07-06T04:57:18Z) - Training Multi-Image Vision Agents via End2End Reinforcement Learning [51.81337984526068]
我々は、エンドツーエンドの強化学習によって訓練されたオープンソースの視覚エージェントであるIMAgentを提案する。
マルチエージェントシステムを利用することで、困難かつ視覚的にリッチなマルチイメージQAペアを生成する。
我々は、視覚的反射と確認のための2つの特別なツールを開発し、モデルが積極的に画像コンテンツに注意を向けることを可能にする。
論文 参考訳(メタデータ) (2025-12-05T10:02:38Z) - ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation [49.01601313084479]
ImAgentは、推論、生成、自己評価を統合するトレーニングフリーの統一マルチモーダルエージェントである。
画像生成と編集タスクの実験は、ImAgentがバックボーンよりも一貫して改善していることを示している。
論文 参考訳(メタデータ) (2025-11-14T17:00:29Z) - GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing [60.09562648953926]
GenArtistは、マルチモーダル大言語モデル(MLLM)エージェントによって調整された統合画像生成および編集システムである。
ツールライブラリに既存のモデルを包括的に統合し,ツールの選択と実行にエージェントを利用する。
実験により、GenArtistは様々な生成および編集タスクを実行でき、最先端のパフォーマンスを達成できることが示された。
論文 参考訳(メタデータ) (2024-07-08T04:30:53Z) - Divide and Conquer: Language Models can Plan and Self-Correct for
Compositional Text-to-Image Generation [72.6168579583414]
CompAgentは、大規模な言語モデル(LLM)エージェントをコアとして、コンポジションテキスト・画像生成のためのトレーニング不要のアプローチである。
提案手法は,オープンワールド合成T2I生成のための総合的なベンチマークであるT2I-CompBenchに対して10%以上の改善を達成している。
論文 参考訳(メタデータ) (2024-01-28T16:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。