論文の概要: Exploring the Performance Frontier of Compact Unified Image Generation Models
- arxiv url: http://arxiv.org/abs/2608.20334v2
- Date: Fri, 21 Aug 2026 15:55:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.006416
- Title: Exploring the Performance Frontier of Compact Unified Image Generation Models
- Title(参考訳): 小型統一画像生成モデルの性能フロンティアの探索
- Abstract要約: Swift-Imageは、テキストから画像生成、シングルイメージ編集、マルチイメージ編集のためのコンパクトな統一モデルである。
Swift-Imageは、6Bパラメータと243KのGPUトレーニング時間しか持たない、評価済みのオープンソースモデルの中で、リードアグリゲーションパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 24.485980902368706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Swift-Image, a compact unified model for text-to-image generation, single-image editing, and multi-image editing. Our goal is to explore how far a relatively small visual generator can be pushed through systematic training engineering under a constrained computational budget. Swift-Image adopts an efficient 6B single-stream DiT and a progressive training pipeline that evolves from broad semantic coverage to higher resolution, stronger visual quality, and unified generation-editing supervision. For post-training, we employ parallel expert reinforcement learning followed by multi-teacher on-policy distillation to alleviate interference among heterogeneous objectives. We further decouple high-level reasoning from pixel-level rendering with a Prompt Enhancer that translates user requests into generator-aligned visual specifications. For efficient deployment, structural pruning and few-step distillation produce 3B and accelerated variants. Swift-Image achieves leading aggregate performance among evaluated open-source models with only 6B parameters and 243K GPU training hours; the compressed 3B model incurs nearly no loss, while few-step distillation further improves aggregate editing performance with substantially fewer sampling steps. Our study also summarizes practical lessons for architecture, data curriculum, post-training, prompt enhancement, and model compression.
- Abstract(参考訳): 我々は,テキスト・画像生成,単一画像編集,複数画像編集のためのコンパクト統一モデルであるSwift-Imageを提案する。
我々のゴールは、比較的小さなビジュアルジェネレータが、制約された計算予算の下で体系的なトレーニングエンジニアリングによって、いかに遠くまで押し上げられるかを探ることである。
Swift-Imageは効率的な6BシングルストリームDiTとプログレッシブトレーニングパイプラインを採用しており、広いセマンティックカバレッジからより高い解像度、より強力な視覚的品質、統一された生成編集監視まで進化している。
ポストトレーニングでは,多種多様な目的間の干渉を軽減するために,並列専門家強化学習と複数教師のオンライン蒸留を併用した。
さらに、ユーザ要求をジェネレータに準拠したビジュアル仕様に変換するPrompt Enhancerを用いて、ピクセルレベルのレンダリングから高レベルの推論を分離する。
効率的な展開のために、構造的な刈り取りと数段階の蒸留は、3Bと加速された変種を生産する。
Swift-Imageは6Bパラメータと243KのGPUトレーニング時間しか持たない評価済みのオープンソースモデルにおいて、主要なアグリゲーションパフォーマンスを実現している。
また, アーキテクチャ, データカリキュラム, ポストトレーニング, 即時強化, モデル圧縮に関する実践的な教訓を要約した。
関連論文リスト
- Nucleus-Image: Sparse MoE for Image Generation [5.769753912757775]
我々はGenEval, DPG-Bench, OneIG-Benchの先頭モデルを超えるテキスト・画像生成モデルを提案する。
Nucleus-Imageはスパース・ミックス・オブ・エキスパート(MoE)拡散変圧器アーキテクチャを採用している。
我々は,700万枚の画像にまたがる1.5Bの高品質トレーニングペアからなる大規模トレーニングコーパスを構築した。
論文 参考訳(メタデータ) (2026-04-14T00:43:23Z) - DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing [67.77471070868852]
DeepGen 1.0は、画像生成と編集のための軽量な5B統一モデルである。
わずか5000万のサンプルでトレーニングされており、WISEでは80BのHunyuan Imageを28%、UniREditBenchでは27BのQwen-Image-Editを37%上回っている。
トレーニングコード、ウェイト、データセットをオープンソース化することで、統合マルチモーダルリサーチを民主化する、効率的で高性能な代替手段を提供します。
論文 参考訳(メタデータ) (2026-02-12T17:44:24Z) - Policy Optimized Text-to-Image Pipeline Design [73.9633527029941]
本稿では,テキスト・ツー・イメージ生成のための新しい強化学習フレームワークを提案する。
提案手法は、まず、画像品質のスコアをインタプリタ-ワークフローの組み合わせから直接予測できる報奨モデルのアンサンブルを訓練する。
次に、最初の語彙学習とGRPOに基づく最適化という2段階のトレーニング戦略を実装した。
論文 参考訳(メタデータ) (2025-05-27T17:50:47Z) - BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset [140.1967962502411]
本稿では,拡散変換器を用いて意味的にリッチなCLIP画像特徴を生成する手法を提案する。
画像理解のための統合モデルファーストトレーニングと画像生成のための逐次事前学習戦略は、実用的な利点をもたらす。
革新的なモデル設計、トレーニングレシピ、データセットに基づいて、最先端の統一マルチモーダルモデルのスイートであるBLIP3-oを開発します。
論文 参考訳(メタデータ) (2025-05-14T17:11:07Z) - E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation [69.72194342962615]
拡散モデルからGANを蒸留するプロセスは、より効率的にできるのか?
まず、一般化された特徴を持つベースGANモデルを構築し、微調整により異なる概念に適応し、スクラッチからトレーニングの必要性を排除した。
第2に,ベースモデル全体の微調整を行うのではなく,低ランク適応(LoRA)を簡易かつ効果的なランク探索プロセスで行う。
第3に、微調整に必要な最小限のデータ量を調査し、トレーニング時間を短縮する。
論文 参考訳(メタデータ) (2024-01-11T18:59:14Z) - SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score Distillation [1.5892730797514436]
テキストと画像の拡散モデルは、しばしば遅い反復的なサンプリングプロセスに悩まされる。
我々は$textbfSwiftBrush$という新しいイメージフリー蒸留方式を提案する。
SwiftBrushは、COCO-30Kベンチマークで、$textbf16.67$のFIDスコアと$textbf0.29$のCLIPスコアを達成している。
論文 参考訳(メタデータ) (2023-12-08T18:44:09Z) - Efficient-3DiM: Learning a Generalizable Single-image Novel-view
Synthesizer in One Day [63.96075838322437]
シングルイメージのノベルビューシンセサイザーを学習するためのフレームワークを提案する。
当社のフレームワークは,トレーニング時間を10日以内から1日未満に短縮することが可能です。
論文 参考訳(メタデータ) (2023-10-04T17:57:07Z) - Pre-Trained Image Processing Transformer [95.93031793337613]
我々は、新しい事前学習モデル、すなわち、画像処理変換器(IPT)を開発する。
本稿では、よく知られたImageNetベンチマークを用いて、大量の画像ペアを生成する。
IPTモデルは、これらの画像をマルチヘッドとマルチテールでトレーニングする。
論文 参考訳(メタデータ) (2020-12-01T09:42:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。