論文の概要: Rethinking Pixel Mean Flows via Interval Denoiser
- arxiv url: http://arxiv.org/abs/2608.04818v1
- Date: Wed, 05 Aug 2026 13:22:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.936963
- Title: Rethinking Pixel Mean Flows via Interval Denoiser
- Title(参考訳): インターバルデノイザによる画素平均フローの再考
- Authors: Alexander Zaytsev, Dmitry Baranchuk, Alexander Korotin, Aibek Alanov,
- Abstract要約: 潜在自由生成のためのフレームワークであるInterval Denoiserを提案する。
その結果,FIDは1ステップ (1-NFE) で4.55, 2ステップ (2-NFE) で3.98であった。
- 参考スコア(独自算出の注目度): 95.11499828543344
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern diffusion and flow-based models are increasingly moving toward few-step, latent-free generation to bypass the computational overhead of multi-step sampling and the reconstruction bottlenecks of external autoencoders. We propose the Interval Denoiser, a theoretically rigorous framework for latent-free generation. Derived directly from the flow matching ODE, it establishes an exact analytical mapping for intermediate trajectory states. Unlike prior formulations, our prediction is shown to reside on a low-dimensional manifold across any time interval, making the regression tractable for a network operating directly on pixels. Furthermore, by avoiding empirical algebraic substitutions, our formulation correctly isolates the pure time derivative to prevent biased gradient evaluations and ensure exact first-order optimization. By analyzing this objective, we equip our framework with residual clipping and a time-sampling curriculum, enabling effective long-interval training and improving few-step performance. Trained from scratch on ImageNet 256x256, our model achieves an FID of 4.55 in one step (1-NFE) and 3.98 in two steps (2-NFE) without perceptual losses.
- Abstract(参考訳): 現代の拡散モデルとフローベースモデルは、マルチステップサンプリングの計算オーバーヘッドを回避し、外部オートエンコーダの再構成ボトルネックを回避するために、数ステップで遅延のない生成に向かってますます進んでいる。
我々は,遅延生成のための理論的に厳格なフレームワークであるインターバルデノイザを提案する。
フローマッチングODEから直接導出され、中間軌道状態の正確な解析的マッピングを確立する。
事前の定式化とは異なり、我々の予測は任意の時間間隔で低次元多様体上に存在することが示される。
さらに, 経験的代数置換を避けることにより, 偏りのある勾配評価を防止し, 厳密な一階最適化を保証するために, 純粋時間微分を正しく分離する。
この目的を解析することにより、我々のフレームワークに余分なクリッピングとタイムサンプリングのカリキュラムを組み、効果的な長期トレーニングを可能にし、数ステップのパフォーマンスを向上する。
ImageNet 256x256のスクラッチからトレーニングしたモデルでは,1ステップ(1-NFE)で4.55,2ステップ(2-NFE)で3.98のFIDを知覚的損失なく達成している。
関連論文リスト
- Perceptual Flow Matching for Few-Step Generative Modeling [64.26537634881244]
知覚フローマッチング(Perceptual Flow Matching)は、フローマッチングモデルにおいて、数ステップ生成のためのフレームワークである。
PFMは、適切な表現空間で教師される際に、高品質な数ステップジェネレータを生成する。
論文 参考訳(メタデータ) (2026-07-03T17:55:01Z) - Dual-End Consistency Model [41.982957134224904]
スロー反復サンプリングは拡散モデルとフローベース生成モデルの実践的展開において大きなボトルネックとなる。
本稿では,安定かつ効果的なトレーニングを実現するために,バイタルサブ軌道クラスタを選択するDual-End Consistency Model (DE-CM)を提案する。
提案手法は,ImageNet 256x256データセットの1ステップ生成において,最先端のFIDスコア1.70を達成し,既存のCMベースのワンステップアプローチよりも優れていた。
論文 参考訳(メタデータ) (2026-02-11T11:51:01Z) - FlowConsist: Make Your Flow Consistent with Real Trajectory [99.22869983378062]
現在の高速フロートレーニングパラダイムには,2つの根本的な問題がある,と我々は主張する。
ランダムにペアリングされたノイズデータサンプルから構築された条件付き速度は、系統的な軌跡ドリフトを導入する。
本研究では,高速フローにおける軌道整合性を実現するためのトレーニングフレームワークであるFlowConsistを提案する。
論文 参考訳(メタデータ) (2026-02-06T03:24:23Z) - Temporal Pair Consistency for Variance-Reduced Flow Matching [13.328987133593154]
TPC(Temporal Pair Consistency)は、同じ確率経路に沿ってペア化された時間ステップで速度予測を結合する軽量な分散還元原理である。
フローマッチング内で確立されたTPCは、複数の解像度でCIFAR-10とImageNetのサンプル品質と効率を改善する。
論文 参考訳(メタデータ) (2026-02-04T00:05:21Z) - Trajectory Consistency for One-Step Generation on Euler Mean Flows [24.038760671907024]
本研究では,フローベース生成フレームワークであるemphEuler Mean Flows (EMF)を提案する。
EMFは最小サンプリングコストで長距離軌道の整合性を実現する。
論文 参考訳(メタデータ) (2026-01-31T04:32:32Z) - Parallel Diffusion Solver via Residual Dirichlet Policy Optimization [88.7827307535107]
拡散モデル(DM)は、最先端の生成性能を達成したが、シーケンシャルなデノナイジング特性のため、高いサンプリング遅延に悩まされている。
既存のソルバベースの加速度法では、低次元の予算で画像品質が著しく低下することが多い。
本研究では,各ステップに複数の勾配並列評価を組み込んだ新しいODE解法であるEnsemble Parallel Directionsolvr(EPD-EPr)を提案する。
論文 参考訳(メタデータ) (2025-12-28T05:48:55Z) - MeanFlow Transformers with Representation Autoencoders [71.45823902973349]
MeanFlow(MF)は、ノイズからデータへのジャンプを直接学習することで、効率的な数ステップ生成を可能にする拡散動機付き生成モデルである。
我々は、表現オートエンコーダ(RAE)の潜在空間におけるMFの効率的なトレーニングとサンプリング手法を開発する。
1ステップのFIDが2.03であり,バニラMFの3.43を上回っ,GFLOPSのサンプリングを38%削減し,ImageNet 256のトレーニングコストを83%削減した。
論文 参考訳(メタデータ) (2025-11-17T06:17:08Z) - Flow-GRPO: Training Flow Matching Models via Online RL [80.62659379624867]
本稿では,オンライン政策強化学習をフローマッチングモデルに統合する最初の方法であるFlow-GRPOを提案する。
提案手法では,(1)決定論的正規微分方程式を同値な微分方程式に変換するODE-to-SDE変換と,(2)推論ステップの数を維持しながらトレーニングの段階を短縮するDenoising Reduction戦略の2つの主要な戦略を用いる。
論文 参考訳(メタデータ) (2025-05-08T17:58:45Z) - HyperFlow: Gradient-Free Emulation of Few-Shot Fine-Tuning [20.308785668386424]
計算勾配を使わずに勾配降下をエミュレートし,効率的なテスト時間適応を実現する手法を提案する。
具体的には、通常の微分方程式(ODE)のオイラー離散化として勾配降下を定式化し、タスク条件ドリフトを予測するために補助ネットワークを訓練する。
適応は単純な数値積分に還元され、補助ネットワークのわずかな前方通過しか必要としない。
論文 参考訳(メタデータ) (2025-04-21T03:04:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。