論文の概要: Energy-Guided Flow Matching
- arxiv url: http://arxiv.org/abs/2608.05811v2
- Date: Fri, 07 Aug 2026 08:39:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.127675
- Title: Energy-Guided Flow Matching
- Title(参考訳): エネルギー駆動型フローマッチング
- Abstract要約: Energy-Guided Flow Matchingは、移動終端による粗大な生成軌道を明示的にモデル化する。
EG-FMは、ImageNetのクラス条件画像生成タスクにおいて、エポックの少ない256$の256倍のFIDを一貫して達成している。
我々は、解像度512倍の512ドルの設定で生成タスクを継続し、40の高分解能適応エポックの後、FIDは1.58となる。
- 参考スコア(独自算出の注目度): 24.481504949563927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pixel-space generative models bypass lossy latent compression, yet necessitate joint learning of global structure and fine-grained details in a high-dimensional space. Standard flow matching interpolates noise toward a fixed clean-image endpoint, leaving the spectral evolution to be learned implicitly. In this paper, we introduce Energy-Guided Flow Matching(EG-FM) that explicitly models a coarse-to-fine generative trajectory by moving endpoint. Specifically, EG-FM replaces the fixed endpoint with a heat-kernel-filtered endpoint that evolves smoothly from low-frequency image to clean image. The fraction of high-frequency signal in moving endpoint is released by an image-specific energy-guided scheduling, leading to the re-targeting of velocity in flow matching. Our framework requires no adaptation of the backbone and training data, bringing negligible cost on the training and inference stages. In our experiment, EG-FM consistently achieves lower FID on the ImageNet class-conditional image generation task at $256 \times 256$ with fewer epochs, reaching an FID of 1.55 at 200 epochs and 1.45 at 600 epochs. We continue training the generation task on the setting of $512 \times 512$ resolution, yielding a FID of 1.58 after only 40 high-resolution adaptation epochs. Furthermore, we transfer EG-FM on text-to-image generation and achieve 0.85 on GenEval score and 83.9 on DPG-Bench. Code is available at https://github.com/ysng123/EG-FM.
- Abstract(参考訳): 画素空間生成モデルは、損失の少ない潜在圧縮をバイパスするが、大域構造と高次元空間におけるきめ細かい詳細を共同学習する必要がある。
標準的なフローマッチングは、ノイズを固定されたクリーンイメージエンドポイントに補間し、スペクトルの進化を暗黙的に学習する。
本稿では,移動終端による粗大な生成軌道を明示的にモデル化するEnergy-Guided Flow Matching(EG-FM)を提案する。
具体的には、EG-FMは固定されたエンドポイントを、低周波画像からクリーン画像へとスムーズに進化する熱カーネルフィルタリングエンドポイントに置き換える。
移動端における高周波信号の分画は、画像特異的なエネルギー誘導スケジューリングによって解放され、フローマッチングにおける速度の再ターゲット化につながる。
我々のフレームワークは、バックボーンとトレーニングデータの適応を必要としないので、トレーニングと推論の段階で無視できるコストをもたらします。
我々の実験では、EG-FMは、画像Netのクラス条件画像生成タスクにおいて、エポックが少ない256$$256で、200エポックが1.55、600エポックが1.45という低いFIDを一貫して達成している。
我々は,高分解能適応エポック40回でFIDが1.58となる512 \times 512$解像度の設定において,生成タスクのトレーニングを継続する。
さらに,テキスト対画像生成でEG-FMを転送し,GenEvalスコアで0.85,DPG-Benchで83.9を達成する。
コードはhttps://github.com/ysng123/EG-FMで入手できる。
関連論文リスト
- A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples [53.8898272536272]
画素空間拡散モデルは、生のピクセル上でエンドツーエンドのジェネレータを直接学習することを目的としている。
最近の研究は、代替の予測ターゲット、訓練目標、アーキテクチャによるピクセル拡散を改善している。
我々は、より安価で相補的な戦略があることを示します。textbfaフリーズ、事前訓練されたピクセル拡散モデルは、自身をガイドすることができます。
論文 参考訳(メタデータ) (2026-07-31T07:52:08Z) - WaiT for the Signal: Simple Frequency-Aware Flow-Matching [60.56691023057048]
本稿では,ウェーブレット対応画像変換器のWaiTについて紹介する。
ImageNet 512x512では、WaiTは1.43ピクセル空間のFIDを実現し、サンプリング計算を最大50%削減した。
我々の定式化はテクスチャの忠実度において最強の潜在空間モデルよりも優れており、高解像度のOpenImageやビデオ生成にシームレスにスケールする。
論文 参考訳(メタデータ) (2026-07-30T18:26:19Z) - Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry [64.61931485161833]
画像生成モデルは、基礎となるデータ多様体からデータポイントをサンプリングすることを目的としている。
データマニフォールド対応画像差分法(MIND)を提案する。
MINDは離散パッチトークン化を連続拡散モデルのスコア関数に統合する。
論文 参考訳(メタデータ) (2026-05-25T08:43:14Z) - FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion [15.557373713923306]
FrequencyBoosterは、フル周波数モデリング機能を備えたピクセル拡散を、禁忌のオーバーヘッドなしに促進するように設計された、新しいフレームワークである。
我々のモデルは320エポックで256倍256$の解像度で textbf1.60 の最先端 FID を実現する。
FrequencyBoosterは512倍の512ドルの解像度で、textbf1.69のFIDを獲得し、既存のピクセル空間と潜在空間の生成モデルを大幅に上回っている。
論文 参考訳(メタデータ) (2026-05-18T02:25:07Z) - Frequency-Aware Flow Matching for High-Quality Image Generation [40.59308529513355]
フローマッチングモデルは、現実的な画像生成のための強力なフレームワークとして登場した。
本稿では,周波数認識条件をフローマッチングフレームワークに明示的に組み込んだ周波数認識フローマッチングを提案する。
従来の拡散モデルDiTと流れマッチングモデルSiTをそれぞれ0.79FIDと0.58FIDに上回り、FID1.38の最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-16T21:00:41Z) - Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think [63.25744258438214]
REPAとその変種は、事前訓練されたモデルから外部の視覚表現を取り入れることで、拡散モデルのトレーニング課題を効果的に軽減する。
偏見推論過程全体において欠落している外部アライメントは、識別的表現の可能性を完全に活用するに足らないと我々は主張する。
本稿では,事前学習した基礎モデルから,低レベル画像ラテントを1つの高レベルクラストークンで絡み合わせるRepresentation Entanglement for Generation (REG)を提案する。
論文 参考訳(メタデータ) (2025-07-02T08:29:18Z) - StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation [52.56469577812338]
本稿では,インタラクティブな画像生成のためのリアルタイム拡散パイプラインStreamDiffusionを紹介する。
既存の拡散モデルは、テキストや画像プロンプトから画像を作成するのに適しているが、リアルタイムのインタラクションでは不足することが多い。
本稿では,従来のシーケンシャル・デノナイジングをデノナイジング・プロセスに変換する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-19T18:18:33Z) - Improved Transformer for High-Resolution GANs [69.42469272015481]
この課題に対処するために、Transformerに2つの重要な要素を紹介します。
実験で提案したHiTは、条件のないImageNetの31.87と2.95のFIDスコアをそれぞれ128×128$とFFHQの256×256$で達成していることを示す。
論文 参考訳(メタデータ) (2021-06-14T17:39:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。