論文の概要: Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
- arxiv url: http://arxiv.org/abs/2607.19064v2
- Date: Wed, 22 Jul 2026 15:23:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 14:36:03.348489
- Title: Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
- Title(参考訳): Mage-Flow: 画像生成と編集のための効率的なネイティブ解決基盤モデル
- Abstract要約: Mage-Flowは、4Bスケールのコンパクトな生成スタックで、効率的なテキスト・画像生成と命令ベースの画像編集を行う。
Stackは、Mage-VAE、軽量な高忠実な潜在トークンライザ、Native-Resolution Multi-Resolution Diffusion Transformerという2つの共同設計コンポーネントで構成されている。
生成と編集の両方にBase, RL-アライメント, およびTurboの変種を組み込んだ完全モデルファミリを開発した。
- 参考スコア(独自算出の注目度): 57.690762576837045
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-scale visual generators are increasingly capable but costly to train, fine-tune, and deploy. We introduce Mage-Flow, a compact 4B-scale generative stack for efficient text-to-image generation and instruction-based image editing. The stack is built from two co-designed components: Mage-VAE, a lightweight high-fidelity latent tokenizer, and a Native-Resolution Multimodal Diffusion Transformer trained with rectified flow matching. Mage-VAE uses one-step diffusion-style encoding and decoding with anchor-latent regularization, preserving the reconstruction quality of strong public VAEs while reducing tokenization cost by more than an order of magnitude. Together with native-resolution packing and stack-level CUDA kernel fusion, the stack supports flexible-resolution training and improves end-to-end training throughput by about $2.5\times$. Built on this foundation, we develop a complete model family with Base, RL-aligned, and Turbo variants for both generation and editing. Diffusion-NFT improves prompt following, text rendering, aesthetic quality, and editing fidelity, while few-step distillation with adversarial perceptual guidance produces 4-step Turbo models for low-latency inference. Despite its compact scale, Mage-Flow and Mage-Flow-Edit achieves competitive performance across standard generation and editing benchmarks. More importantly, the Turbo variants make high-resolution generation and editing practical for interactive use: at $1024^2$ resolution on a single NVIDIA A100 GPU, Mage-Flow-Turbo generates an image in 0.59s, and Mage-Flow-Edit-Turbo edits an image in 1.02s, while maintaining a small memory footprint. These results show that careful tokenizer--backbone--system co-design can deliver strong high-resolution generation and editing within an efficient 4B model family.
- Abstract(参考訳): 大規模なビジュアルジェネレータは、ますます有能になるが、訓練、微調整、展開に費用がかかる。
Mage-Flowは、4Bスケールのコンパクトな生成スタックで、効率的なテキスト・画像生成と命令ベースの画像編集を行う。
スタックは2つの共同設計されたコンポーネントから構築されている。Mage-VAE、軽量な高忠実な潜在トークン、Native-Resolution Multimodal Diffusion Transformer、修正フローマッチングでトレーニングされたNative-Resolution Multimodal Diffusion Transformerである。
Mage-VAEは1ステップの拡散方式の符号化とアンカー遅延正規化による復号を使用し、トークン化コストを1桁以上削減しつつ、強力なパブリックなVAEの再構築品質を保っている。
ネイティブレゾリューションパッキングとスタックレベルのCUDAカーネルの融合とともに、スタックはフレキシブルレゾリューショントレーニングをサポートし、エンドツーエンドのトレーニングスループットを約2.5\times$で改善する。
この基盤の上に構築され、生成と編集の両方のためのBase、RL-アライメント、およびTurboの変種を備えた完全なモデルファミリを開発する。
拡散-NFTは、プロンプト追従、テキストレンダリング、審美的品質、編集忠実度を改善し、対角誘導による数ステップ蒸留は低遅延推論のための4ステップターボモデルを生成する。
コンパクトなスケールにもかかわらず、Mage-FlowとMage-Flow-Editは標準生成および編集ベンチマーク間で競合するパフォーマンスを実現している。
NVIDIA A100 GPUの解像度が1024^2で、Mage-Flow-Turboは0.59sで画像を生成し、Mage-Flow-Edit-Turboは1.02sで画像を編集し、メモリフットプリントは小さい。
これらの結果から、4Bモデルファミリ内での高分解能な生成と編集が可能であることが示唆された。
関連論文リスト
- HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer [104.09730595701468]
画素空間拡散変換器を用いた統合生成基盤モデルであるHiDream-O1-Imageを提案する。
HiDream-O1-Imageは、原画像ピクセル、テキストトークン、タスク固有の条件を単一の共有トークン空間にマッピングすることにより、マルチモーダル入力の構造的統一を実現する。
実験により、HiDream-O1-Imageは、テキスト・ツー・イメージ生成、命令ベースの編集、主観的パーソナライゼーションなど、さまざまな世代のタスクに優れることが示された。
論文 参考訳(メタデータ) (2026-05-11T17:59:09Z) - Nucleus-Image: Sparse MoE for Image Generation [5.769753912757775]
我々はGenEval, DPG-Bench, OneIG-Benchの先頭モデルを超えるテキスト・画像生成モデルを提案する。
Nucleus-Imageはスパース・ミックス・オブ・エキスパート(MoE)拡散変圧器アーキテクチャを採用している。
我々は,700万枚の画像にまたがる1.5Bの高品質トレーニングペアからなる大規模トレーニングコーパスを構築した。
論文 参考訳(メタデータ) (2026-04-14T00:43:23Z) - DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing [67.77471070868852]
DeepGen 1.0は、画像生成と編集のための軽量な5B統一モデルである。
わずか5000万のサンプルでトレーニングされており、WISEでは80BのHunyuan Imageを28%、UniREditBenchでは27BのQwen-Image-Editを37%上回っている。
トレーニングコード、ウェイト、データセットをオープンソース化することで、統合マルチモーダルリサーチを民主化する、効率的で高性能な代替手段を提供します。
論文 参考訳(メタデータ) (2026-02-12T17:44:24Z) - VIBE: Visual Instruction Based Editor [60.21587335143115]
本稿では,高速な命令に基づく画像編集パイプラインを提案する。
パイプラインはImgEditとGEditベンチマークで評価される。
BF16ではNVIDIA H100で最大2K解像度で編集画像を生成するが、追加の推論最適化や蒸留は行わない。
論文 参考訳(メタデータ) (2026-01-05T16:17:20Z) - E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources [12.244453688491731]
E-MMDiT(Efficient Multimodal Diffusion Transformer)は、高速画像合成のための304Mパラメータしか持たない、効率的で軽量なマルチモーダル拡散モデルである。
AMD MI300X GPUの1ノードで1.5日で2500万の公開データをトレーニングした512px生成のモデルは、GenEvalで0.66に達し、GRPOのようなポストトレーニング手法で簡単に0.72に達する。
論文 参考訳(メタデータ) (2025-10-31T03:13:08Z) - Home-made Diffusion Model from Scratch to Hatch [0.9383683724544296]
ホームメイド拡散モデル(Home-made Diffusion Model, HDM)は、消費者向けハードウェアのトレーニングに最適化された、効率的かつ強力なテキスト-画像拡散モデルである。
HDMは競争力のある1024x1024世代の品質を実現し、トレーニングコストは535-620ドルと極めて低い。
論文 参考訳(メタデータ) (2025-09-07T14:21:57Z) - Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing [53.197392152109636]
DIM-T2I(Draw-In-Mind:Draw-In-Mind:DIM)と、GPT-4oが生成した233Kのチェーン・オブ・シンジケーションからなるDIM-Edit(DIM-Edit)という2つの補完的なサブセットからなるデータセットを紹介し、画像編集のための明示的な設計青写真として機能する。
DIM-4.6B-T2I/Edit は ImgEdit や GEdit-Bench のベンチマークにおいて、UniWorld-V1 や Step1X-Edit など、はるかに大きなモデルよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-09-02T06:06:52Z) - FlowDCN: Exploring DCN-like Architectures for Fast Image Generation with Arbitrary Resolution [33.07779971446476]
任意の解像度で高画質画像を効率よく生成できる、純粋に畳み込みに基づく生成モデルであるFlowDCNを提案する。
FlowDCNは256Times256$ ImageNet Benchmarkと同等の解像度外挿結果で最先端の4.30 sFIDを実現している。
FlowDCNはスケーラブルで柔軟な画像合成のための有望なソリューションであると考えています。
論文 参考訳(メタデータ) (2024-10-30T02:48:50Z) - SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers [41.79064227895747]
Sanaは4096$times$4096解像度までの画像を生成できるテキスト・ツー・イメージのフレームワークである。
Sanaは、高解像度で高品質な画像を、強力なテキストイメージアライメントで驚くほど高速に合成し、ラップトップGPUにデプロイすることができる。
論文 参考訳(メタデータ) (2024-10-14T15:36:42Z) - Latent Space Editing in Transformer-Based Flow Matching [53.75073756305241]
Flow Matching with a transformer backboneはスケーラブルで高品質な生成モデリングの可能性を秘めている。
編集スペースである$u$-spaceを導入し、制御可能で、蓄積可能で、構成可能な方法で操作できる。
最後に,テキストプロンプトを用いた微粒でニュアンスな編集を実現するための,単純かつ強力な手法を提案する。
論文 参考訳(メタデータ) (2023-12-17T21:49:59Z) - Dual-former: Hybrid Self-attention Transformer for Efficient Image
Restoration [6.611849560359801]
本稿では,自己アテンションモジュールの強力なグローバルモデリング能力と,全体のアーキテクチャにおける畳み込みの局所モデリング能力を組み合わせたDual-formerを提案する。
実験により、Dual-formerはIndoorデータセットの最先端MAXIM法よりも1.91dBのゲインを達成していることが示された。
単一画像のデライニングでは、わずか21.5%のGFLOPを持つ5つのデータセットの平均結果に対して、SOTA法を0.1dB PSNRで上回っている。
論文 参考訳(メタデータ) (2022-10-03T16:39:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。