論文の概要: MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
- arxiv url: http://arxiv.org/abs/2606.26016v1
- Date: Wed, 24 Jun 2026 16:37:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.397174
- Title: MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
- Title(参考訳): MIMFlow: エンド・ツー・エンド画像生成のための正規化フローによるマスク付き画像モデリングの統合
- Abstract要約: Masked Image Modeling (MIM) は表現学習に優れていますが、生成パイプラインへの統合は、大部分がモジュール化され、相容れないままです。
我々は、潜在意味論、画素再構成、生成フローを共同で最適化する統合エンドツーエンドフレームワークであるMIMFlowを提案する。
- 参考スコア(独自算出の注目度): 29.57000468788334
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Normalizing Flows (NFs) are powerful generative models capable of exact density estimation and sampling. However, their strict invertibility often forces the model to exhaust its capacity on low-level pixel details, hindering the capture of high-level semantic structures. While Masked Image Modeling (MIM) has excelled in representation learning, its integration into generative pipelines has remained largely modular and disjointed. In this paper, we propose MIMFlow, a unified end-to-end framework that jointly optimizes latent semantics, pixel reconstruction, and generative flow. By employing a VAE encoder to infer semantic latent from masked images, MIMFlow achieves a principled decoupling of the generative task: the Normalizing Flow focuses on modeling a simplified, low-frequency semantic manifold, while a specialized decoder handles high-frequency synthesis. This design effectively resolves the inherent capacity bottleneck of NFs, allowing the model to prioritize global structural coherence over redundant noise. Empirical results on ImageNet 256$\times$256 show that MIMFlow-L reaches 71.3\% linear probing accuracy and an FID of 2.50. Despite using only 128 tokens (50\% fewer than standard models), it yields a 32.8\% performance gain over similar-scale NF baselines. Our code is available at https://github.com/MCG-NJU/MIMFlow.
- Abstract(参考訳): 正規化フロー(NF)は、正確な密度推定とサンプリングが可能な強力な生成モデルである。
しかし、その厳密な可逆性は、しばしば、高レベルのセマンティック構造を捉えるのを妨げるために、低レベルのピクセルの詳細にその能力を使い果たさざるを得ない。
Masked Image Modeling (MIM) は表現学習に長けているが、生成パイプラインへの統合はモジュラー化と解離がほとんどである。
本稿では、潜在意味論、画素再構成、生成フローを協調的に最適化する統合エンドツーエンドフレームワークであるMIMFlowを提案する。
マスク付き画像からセマンティックレイトを推論するためにVAEエンコーダを用いることで、MIMFlowは生成タスクの原則的なデカップリングを実現している。
この設計は、NFの固有の容量ボトルネックを効果的に解決し、冗長ノイズよりもグローバルな構造的コヒーレンスを優先することができる。
ImageNet 256$\times$256の実証結果は、MIMFlow-Lが71.3\%の線形探査精度とFIDが2.50であることを示している。
128トークン(標準モデルより50\%少ない)しか使用していないが、同様のスケールのNFベースラインよりも32.8\%のパフォーマンス向上を達成している。
私たちのコードはhttps://github.com/MCG-NJU/MIMFlow.comで公開されています。
関連論文リスト
- SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation [73.51436199324066]
正規化フロー(NF)は、正確な確率と決定論的非可逆サンプリングを提供するが、大規模な画像生成のための拡散モデルに遅れを取っている。
低次元意味空間にコンパクトな高次元RAE特徴にセマンティック表現(SRC)を導入するSRC-Flowを提案する。
SRC-Flowは、計算不要なガイダンスの下で、gFIDスコア1.65と2.07で、フローメソッド間の最先端の生成品質を実現する。
論文 参考訳(メタデータ) (2026-05-18T12:03:41Z) - Asymmetric Flow Models [35.8386911591457]
本稿では,データ予測を全次元に保ちながら低ランク部分空間に雑音予測を制限したランク非対称な速度パラメータ化を提案する。
AsymFlowは、ネットワークアーキテクチャやトレーニング/サンプリング手順を変更することなく、全次元の速度を解析的に回復する。
FLUX.2 klein 9B から微調整された画素 AsymFlow モデルにより,画素空間のテキスト・画像生成技術が新たに確立されたことを示す。
論文 参考訳(メタデータ) (2026-05-13T03:58:01Z) - STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation [56.964292897565024]
自己回帰正規化フローを示し,LLMと同じ因果マスク,KV-cache機構,左右構造を共有する。
我々は、画像生成およびマルチモーダル理解ベンチマークにおける強力な性能を示し、統合マルチモーダルモデリングの基盤として自己回帰フローを検証した。
論文 参考訳(メタデータ) (2026-05-08T17:14:43Z) - Normalizing Flows with Iterative Denoising [32.9706166699763]
フロー生成モデルの正規化に,反復的TARFlow(iTARFlow)を導入する。
iTARFlowは、トレーニング中に完全なエンドツーエンド、可能性ベースの目標を維持している。
これは、64、128、256ピクセルのImageNet解像度で競合するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-21T22:52:26Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - Gaussian Mixture Flow Matching Models [63.092956669059824]
拡散モデルは正規分布をガウス平均として近似し,その平均を推定する一方,フローマッチングモデルはガウス平均をフロー速度としてパラメータ化する。
離散化誤差による数段階のサンプリングでは性能が低下し、分類器フリーガイダンス(CFG)では過飽和色が生じる傾向にある。
本稿では,CFGの過飽和問題を緩和し,画像生成品質を向上する新しい確率的ガイダンス手法を提案する。
論文 参考訳(メタデータ) (2025-04-07T17:59:42Z) - Normalizing Flows are Capable Generative Models [48.31226028595099]
TarFlowはシンプルでスケーラブルなアーキテクチャで、高性能なNFモデルを実現する。
エンドツーエンドのトレーニングは簡単で、ピクセルを直接モデリングして生成することができる。
TarFlowは、画像の確率推定に新たな最先端結果を設定し、以前のベストメソッドを大きなマージンで上回る。
論文 参考訳(メタデータ) (2024-12-09T09:28:06Z) - Boundary-aware Decoupled Flow Networks for Realistic Extreme Rescaling [49.215957313126324]
Invertible rescaling Network (IRN) やgenerative adversarial Network (GAN) などを含む最近の生成手法は、画像再スケーリングにおいて例外的な性能を示した。
しかし、IRNベースの手法は過度に滑らかな結果を生成する傾向にあり、一方、GANベースの手法は偽の細部を容易に生成する。
本稿では,現実的かつ視覚的に満足な結果を生成するために,境界対応デカップリングフローネットワーク(BDFlow)を提案する。
論文 参考訳(メタデータ) (2024-05-05T14:05:33Z) - Normalizing Flows with Multi-Scale Autoregressive Priors [131.895570212956]
マルチスケール自己回帰前処理(mAR)を通した遅延空間におけるチャネルワイド依存性を導入する。
我々のmARは、分割結合フロー層(mAR-SCF)を持つモデルに先立って、複雑なマルチモーダルデータの依存関係をよりよく捉えます。
我々は,mAR-SCFにより画像生成品質が向上し,FIDとインセプションのスコアは最先端のフローベースモデルと比較して向上したことを示す。
論文 参考訳(メタデータ) (2020-04-08T09:07:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。