論文の概要: Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- arxiv url: http://arxiv.org/abs/2606.26907v1
- Date: Thu, 25 Jun 2026 11:40:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.259461
- Title: Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- Title(参考訳): Qwen-Image-Agent: リアルタイム画像生成におけるコンテキストギャップのブリッジ
- Authors: Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu,
- Abstract要約: 提案するQwen-Image-Agentは,計画,理由,探索,記憶,フィードバックをコンテキスト中心の方法で統合した統合エージェントフレームワークである。
Qwen-Image-Agentはユーザ入力を部分的コンテキストとして扱い、コンテキスト認識計画とコンテキストグラウンディングを通じて生成コンテキストを段階的に構築する。
IA-Bench, Mindbench, WISE-Verified の実験により, Qwen-Image-Agent は強いベースラインを上回り,最先端のパフォーマンスを達成することが示された。
- 参考スコア(独自算出の注目度): 70.60638032720748
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While text-to-image (T2I) models have achieved remarkable progress, they struggle with real-world requests that are often underspecified, implicit, or dependent on up-to-date knowledge. We identify this challenge as the Context Gap: the mismatch between the user context and the sufficient generation context for T2I models. To bridge this gap, we propose Qwen-Image-Agent, a unified agentic framework that integrates plan, reason, search, memory and feedback in a context-centric manner. Qwen-Image-Agent treats user input as partial context and progressively constructs the generation context through Context-Aware Planning and Context Grounding. Specifically, Context-Aware Planning identifies missing context and plans how it should be acquired and used, while Context Grounding gathers this context from reason, search, memory, and feedback. To evaluate agentic image generation, we further introduce Image Agent Bench (IA-Bench), a benchmark covering four core image agent capabilities: Plan, Reason, Search, and Memory. Experiments on IA-Bench, Mindbench and WISE-Verified show that Qwen-Image-Agent outperforms strong baselines and achieves state-of-the-art performance.
- Abstract(参考訳): テキスト・トゥ・イメージ(T2I)モデルは目覚ましい進歩を遂げているが、しばしば過小評価され、暗黙的であり、最新の知識に依存している現実世界の要求に苦慮している。
ユーザコンテキストとT2Iモデルの十分な生成コンテキストとのミスマッチである。
このギャップを埋めるために,計画,理由,探索,記憶,フィードバックをコンテキスト中心の方法で統合する統合エージェントフレームワークであるQwen-Image-Agentを提案する。
Qwen-Image-Agentはユーザ入力を部分的コンテキストとして扱い、コンテキスト認識計画とコンテキストグラウンディングを通じて生成コンテキストを段階的に構築する。
具体的には、コンテキスト認識計画(Context-Aware Planning)は、欠落したコンテキストを特定し、その取得と使用方法を計画する一方で、Context Groundingは、理由、検索、メモリ、フィードバックからこのコンテキストを収集する。
エージェント画像生成の評価には、Plan, Reason, Search, Memoryの4つのコアイメージエージェント機能をカバーするベンチマークであるイメージエージェントベンチ(IA-Bench)も導入する。
IA-Bench, Mindbench, WISE-Verified の実験により, Qwen-Image-Agent は強いベースラインを上回り,最先端のパフォーマンスを達成することが示された。
関連論文リスト
- ImageAuditor: Membership Inference Attack against Image-based Retrieval-Augmented Generation [9.64120050798558]
画像ベース Retrieval-Augmented Generation (IRAG) は、外部データベースから取得した参照画像にフリーズジェネレータを条件とする。
これらのデータベースは不透明でウェブスクラップなので、著作権保持者は特定の画像が写っているかどうかを検査する方法が必要である。
IRAGに適した最初のMIAであるImageAuditorを導入し、各攻撃クエリを検索セグメントと抽出セグメントに分解する。
論文 参考訳(メタデータ) (2026-06-02T09:03:56Z) - In-Context LoRA for Diffusion Transformers [49.288489286276146]
テキスト・ツー・イメージのDiTは、チューニングなしでテキスト内生成を効果的に行うことができることを示す。
我々は、我々のモデル In-Context LoRA (IC-LoRA) を命名する。
我々のパイプラインは、プロンプトにより忠実な高忠実度画像セットを生成する。
論文 参考訳(メタデータ) (2024-10-31T09:45:00Z) - Divide and Conquer: Language Models can Plan and Self-Correct for
Compositional Text-to-Image Generation [72.6168579583414]
CompAgentは、大規模な言語モデル(LLM)エージェントをコアとして、コンポジションテキスト・画像生成のためのトレーニング不要のアプローチである。
提案手法は,オープンワールド合成T2I生成のための総合的なベンチマークであるT2I-CompBenchに対して10%以上の改善を達成している。
論文 参考訳(メタデータ) (2024-01-28T16:18:39Z) - Context Diffusion: In-Context Aware Image Generation [27.63447546705641]
コンテキスト拡散(Context Diffusion)は、画像生成モデルがコンテキストで提示された視覚的な例から学ぶことを可能にする拡散ベースのフレームワークである。
我々の実験と人的評価は、コンテキスト拡散がドメイン内タスクとドメイン外タスクの両方で優れていることを示している。
論文 参考訳(メタデータ) (2023-12-06T16:19:51Z) - OpenLEAF: Open-Domain Interleaved Image-Text Generation and Evaluation [151.57313182844936]
本稿では,大規模言語モデル(LLM)と事前学習されたテキスト・ツー・イメージ(T2I)モデル,すなわちOpenLEAFに基づく新たなインターリーブ生成フレームワークを提案する。
まず,大規模マルチモーダルモデル(LMM)を用いて,オープンドメインのインターリーブ画像-テキストシーケンスのエンティティとスタイルのコンピテンシーを評価することを提案する。
論文 参考訳(メタデータ) (2023-10-11T17:58:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。