論文の概要: Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
- arxiv url: http://arxiv.org/abs/2606.30054v1
- Date: Mon, 29 Jun 2026 09:45:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.170917
- Title: Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
- Title(参考訳): 自由形インターリーブテキスト画像生成のための一元化マルチモーダルモデル
- Authors: Chonghuinan Wang, Zhikai Chen, Chunwei Wang, Yecong Wan, Junwei Yang, Zhixin Wang, Wei Zhang, Jiaqi Xu, Renjing Pei, Xiaohe Wu, Fan Li, Wangmeng Zuo,
- Abstract要約: 我々は、高品質で自由形式のインターリーブなテキスト画像生成を可能にする高度な統合マルチモーダルパラダイムであるILLUME-Xを紹介する。
ILLUME-Xは、(i)インターリーブされたテキストイメージ生成に最適化された拡張トレーニングデータパイプライン、(ii)フリー長のマルチモーダルトークンシーケンスのための自己適応的な目標を持つプログレッシブトレーニング戦略、(iii)インターリーブされたテキストイメージシーケンスのための客観的かつ包括的な評価方法ILScoreの3つの主要なコンポーネントから構成される。
- 参考スコア(独自算出の注目度): 65.04930747239537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The advancement of generative AI models capable of producing text and image marks a critical step forward in the realm of multimodal intelligence, particularly for tasks involving the interleaving of both modalities. To advance this intelligence to the next stage, it is crucial for models to autonomously generate free-form interleaved text-image sequences. In this paper, we introduce ILLUME-X, an advanced unified multimodal paradigm that enables high-quality, free-form interleaved text-image generation by improving multimodal data efficiency and stabilizing the multimodal training process. ILLUME-X comprises three key components: (i) an expanded training data pipeline optimized for interleaved text-image generation, (ii) a progressive training strategy with self-adaptive objectives for free-length multimodal token sequences, and (iii) an objective and comprehensive evaluation method ILScore for interleaved text-image sequences. Notably, our ILLUME-X outperforms previous unified models across multiple interleaved text-image generation tasks like style transfer, image decomposition and storytelling.
- Abstract(参考訳): テキストと画像を生成することができる生成AIモデルの進歩は、特に両方のモダリティのインターリーブに関わるタスクにおいて、マルチモーダルインテリジェンスの領域における重要な一歩である。
このインテリジェンスを次の段階に進めるためには、モデルが自律的にフリーフォームのインターリーブされたテキストイメージシーケンスを生成することが不可欠である。
本稿では、マルチモーダルデータ効率を改善し、マルチモーダルトレーニングプロセスを安定化することにより、高品質で自由形式のインターリーブテキスト画像生成を可能にする高度な統合マルチモーダルパラダイムであるILLUME-Xを紹介する。
ILLUME-X は3つの重要なコンポーネントから構成される。
(i)インターリーブテキスト画像生成に最適化された拡張トレーニングデータパイプライン。
(二)自由長マルチモーダルトークンシークエンスに対する自己適応的目標をもつ進歩的トレーニング戦略及び
三 インターリーブされたテキスト画像系列のための客観的かつ総合的な評価方法、ISScore。
特に、私たちのILLUME-Xは、スタイル転送、画像分解、ストーリーテリングといった複数のインターリーブされたテキスト画像生成タスクにおいて、以前の統一モデルよりも優れています。
関連論文リスト
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization [35.14373974143734]
既存の統一モデルにおいて,この能力を解放するための強化学習に基づくポストトレーニング戦略を提案する。
提案手法は,1つの復号軌道内でのテキスト生成と画像生成を共同でモデル化し,新たなハイブリッド報酬で最適化する。
MMIEとInterleavedBenchの実験により,マルチモーダルインターリーブド生成の品質とコヒーレンスを大幅に向上させることが実証された。
論文 参考訳(メタデータ) (2026-03-10T11:49:20Z) - Unified Text-Image Generation with Weakness-Targeted Post-Training [57.956648078400775]
テキストと画像を共同で生成する統一マルチモーダル生成アーキテクチャは、最近、テキスト・ツー・イメージ(T2I)合成の有望な方向として登場した。
この研究は、モデルがテキスト推論から視覚合成へ自律的に遷移する、完全に統一されたテキスト画像生成を実現するためのポストトレーニングを探求する。
論文 参考訳(メタデータ) (2026-01-07T19:19:44Z) - Query-Kontext: An Unified Multimodal Model for Image Generation and Editing [53.765351127477224]
統一マルチモーダルモデル(UMM)はテキスト・ツー・イメージ生成(T2I)と編集(TI2I)において顕著な性能を示した。
本稿では,マルチモーダル入力から符号化されたセマンティックキューと粗粒度画像条件からなるマルチモーダルコンテクス」を用いて,VLMと拡散モデルをブリッジする新しいアプローチであるQuery-Kontextを紹介する。
実験により,本手法は強い統一ベースラインと一致し,いくつかのケースにおいてタスク固有の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2025-09-30T17:59:46Z) - MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models [30.494968865008513]
最近のテキスト・ツー・イメージモデルは、正確な視覚制御、マルチモーダル入力のバランス、複雑な画像生成のための広範な訓練を必要とする。
自己回帰型マルチモーダル画像生成のための効率的なマルチモーダルコンディショニングのための新しいフレームワークであるMENTORを提案する。
本手法は,拡散法に比べて画像再構成精度,タスク適応性,トレーニング効率の向上を実現している。
論文 参考訳(メタデータ) (2025-07-13T10:52:59Z) - BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset [140.1967962502411]
本稿では,拡散変換器を用いて意味的にリッチなCLIP画像特徴を生成する手法を提案する。
画像理解のための統合モデルファーストトレーニングと画像生成のための逐次事前学習戦略は、実用的な利点をもたらす。
革新的なモデル設計、トレーニングレシピ、データセットに基づいて、最先端の統一マルチモーダルモデルのスイートであるBLIP3-oを開発します。
論文 参考訳(メタデータ) (2025-05-14T17:11:07Z) - Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation [54.588082888166504]
我々は、因果アプローチを通じてインターリーブされたマルチモーダル生成を可能にする統一的なフレームワークであるMogaoを提案する。
Mogooは、Deep-fusion設計、デュアルビジョンエンコーダ、インターリーブされた回転位置埋め込み、マルチモーダル分類器フリーガイダンスなど、アーキテクチャ設計における重要な技術的改善のセットを統合している。
実験により,モガオはマルチモーダル理解とテキスト・ツー・イメージ生成において最先端の性能を発揮するとともに,高品質でコヒーレントなインターリーブ・アウトプットの創出にも優れていることが示された。
論文 参考訳(メタデータ) (2025-05-08T17:58:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。