Fugu-MT 論文翻訳(概要): Qwen-Image-2.0 Technical Report

論文の概要: Qwen-Image-2.0 Technical Report

arxiv url: http://arxiv.org/abs/2605.10730v1
Date: Mon, 11 May 2026 15:34:56 GMT
ステータス: 翻訳完了
システム内更新日: 2026-05-12 23:28:50.945321
Title: Qwen-Image-2.0 Technical Report
Title（参考訳）: Qwen-Image-2.0テクニカルレポート
Authors: Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xionghui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, Zhizhi Cai,
Abstract要約: Qwen-Image-2.0は、Omni対応の画像生成基盤モデルである。単一のフレームワーク内で高忠実度生成と正確な画像編集を統一する。 Qwen-Image-2.0 は、生成と編集の両方において、以前の Qwen-Image モデルを大幅に上回っている。
参考スコア（独自算出の注目度）: 121.60016333754231
License: http://creativecommons.org/licenses/by/4.0/
Abstract: We present Qwen-Image-2.0, an omni-capable image generation foundation model that unifies high-fidelity generation and precise image editing within a single framework. Despite recent progress, existing models still struggle with ultra-long text rendering, multilingual typography, high-resolution photorealism, robust instruction following, and efficient deployment, especially in text-rich and compositionally complex scenarios. Qwen-Image-2.0 addresses these challenges by coupling Qwen3-VL as the condition encoder with a Multimodal Diffusion Transformer for joint condition-target modeling, supported by large-scale data curation and a customized multi-stage training pipeline. This enables strong multimodal understanding while preserving flexible generation and editing capabilities. The model supports instructions of up to 1K tokens for generating text-rich content such as slides, posters, infographics, and comics, while significantly improving multilingual text fidelity and typography. It also enhances photorealistic generation with richer details, more realistic textures, and coherent lighting, and follows complex prompts more reliably across diverse styles. Extensive human evaluations show that Qwen-Image-2.0 substantially outperforms previous Qwen-Image models in both generation and editing, marking a step toward more general, reliable, and practical image generation foundation models.
Abstract（参考訳）: Qwen-Image-2.0は、単一のフレームワーク内で高忠実度生成と正確な画像編集を統一する、オールニ対応の画像生成基盤モデルである。近年の進歩にもかかわらず、既存のモデルはテキストレンダリング、多言語タイポグラフィー、高解像度のフォトリアリズム、ロバストなインストラクション追従、効率的な展開、特にテキストリッチで複雑なシナリオで苦戦している。 Qwen-Image-2.0は、Qwen3-VLを条件エンコーダとして結合し、大規模データキュレーションとカスタマイズされたマルチステージトレーニングパイプラインをサポートする、ジョイント条件-ターゲットモデリングのためのマルチモーダル拡散変換器を提供する。これにより、柔軟な生成と編集機能を保持しながら、強力なマルチモーダル理解が可能になる。このモデルは、スライド、ポスター、インフォグラフィック、コミックなどのテキストリッチなコンテンツを生成するための最大1Kトークンの命令をサポートし、多言語テキストの忠実度とタイポグラフィーを大幅に改善する。また、よりリッチなディテール、よりリアルなテクスチャ、コヒーレントな照明でフォトリアリスティック・ジェネレーションを強化し、多様なスタイルでより確実に複雑なプロンプトに従う。 Qwen-Image-2.0は、画像生成と編集の両方において、従来のQwen-Imageモデルよりも大幅に優れており、より汎用的で信頼性があり、実用的な画像生成基盤モデルへの一歩であることを示している。

論文の概要: Qwen-Image-2.0 Technical Report

関連論文リスト