Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
Abstractの概要
ILLUME-Xは、テキストと画像が任意の順序で出現可能な、自由形式のインターリーブ(交差配置)されたテキスト・画像生成のために設計された統合マルチモーダルモデルである。本論文では、そのアプローチを3つの主要な要素、すなわち、厳選された10万サンプルのインターリーブ学習パイプライン、可変長のマルチモーダルトークン列に対する自己適応型目的関数を用いた段階的学習戦略、およびILScoreと呼ばれる専用の評価フレームワークにあるとしている。アーキテクチャ面では、このモデルはモダリティ固有の処理とインターリーブアテンションメカニズムを備えた共有Transformer設計を用いており、テキスト生成、画像合成、およびモダリティの遷移を共同でサポートする。実験では、インターリーブ生成と標準的なテキストから画像への生成の両方を評価し、従来の統合モデルや選定された商用またはエージェントベースのシステムとの比較を行っている。
新規性
本論文の主な特徴は、自由形式のN対Mのインターリーブされたテキスト・画像生成を、データキュレーション、学習、評価における連携した進歩によってサポートされる統合されたモデリング問題として扱おうとしている点である。また、画像とテキストのアライメント、単一画像の品質、シーケンスの一貫性、およびテキストの品質にわたってインターリーブされたシーケンスを評価するために特別に構成された指標であるILScoreも導入している。
成果
ISG-Benchにおいて、ILLUME-Xは平均スコア6.26を報告しており、著者らはこれを統合モデルの中で最高水準(SOTA)であり、エージェントベースのISG-AGENTシステムと同等であるとしている。提案されたILScore指標では最高の総合スコア5.34を獲得し、5.33のEmu 3.5を僅差で上回った。また、このモデルは画像あたりの推論時間をEmu 3.5よりも大幅に短縮しながら、GenEvalでの総合0.85、DPG-Benchでの総合86.38を含む、強力なテキストからの画像生成結果も報告している。
論文の注目点
- ILLUME-Xは、10万サンプルのインターリーブデータキュレーションパイプラインと段階的なマルチモーダル学習を組み合わせることで、自由形式のテキスト・画像シーケンス生成を改善する。
- 本手法は、統合されたTransformerフレームワーク内で任意のモダリティの遷移を処理するために、インターリーブアテンションと分類器なしガイダンス(classifier-free guidance)の適応を導入している。
- 評価における貢献であるILScoreは、従来のベンチマーク手法よりも包括的にインターリーブ生成を測定するよう設計されており、実験ではインターリーブ生成とテキストから画像への生成の両方のベンチマークにおいて、競争力のある、またはトップクラスの性能を示している。
参考リンク
- arXiv: https://arxiv.org/abs/2606.30054v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2606.30054v1
- Hugging Face Papers: https://huggingface.co/papers/2606.30054
- GitHub: https://github.com/ChonghuinanWang/ILLUME-X