論文の概要: BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation
- arxiv url: http://arxiv.org/abs/2603.24942v1
- Date: Thu, 26 Mar 2026 02:16:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.052104
- Title: BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation
- Title(参考訳): BiFM:Few-Step Image Editing and Generationのための双方向フローマッチング
- Authors: Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li,
- Abstract要約: BiFM(Bidirectional Flow Matching)は、単一のモデル内で生成と反転を共同で学習する統合フレームワークである。
BiFMは既存の数ステップのアプローチを一貫して上回り、優れたパフォーマンスと編集性を実現している。
- 参考スコア(独自算出の注目度): 48.679227622825806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent diffusion and flow matching models have demonstrated strong capabilities in image generation and editing by progressively removing noise through iterative sampling. While this enables flexible inversion for semantic-preserving edits, few-step sampling regimes suffer from poor forward process approximation, leading to degraded editing quality. Existing few-step inversion methods often rely on pretrained generators and auxiliary modules, limiting scalability and generalization across different architectures. To address these limitations, we propose BiFM (Bidirectional Flow Matching), a unified framework that jointly learns generation and inversion within a single model. BiFM directly estimates average velocity fields in both ``image $\to$ noise" and ``noise $\to$ image" directions, constrained by a shared instantaneous velocity field derived from either predefined schedules or pretrained multi-step diffusion models. Additionally, BiFM introduces a novel training strategy using continuous time-interval supervision, stabilized by a bidirectional consistency objective and a lightweight time-interval embedding. This bidirectional formulation also enables one-step inversion and can integrate seamlessly into popular diffusion and flow matching backbones. Across diverse image editing and generation tasks, BiFM consistently outperforms existing few-step approaches, achieving superior performance and editability.
- Abstract(参考訳): 近年の拡散・流れマッチングモデルでは,反復サンプリングによるノイズの段階的除去による画像生成・編集に強い効果が示されている。
これにより、セマンティック保存編集の柔軟な逆変換が可能になるが、数ステップのサンプリングレジームはプロセスの近似の貧弱さに悩まされ、編集品質が低下する。
既存の数ステップの反転法は、しばしば事前訓練されたジェネレータと補助モジュールに依存し、異なるアーキテクチャにわたるスケーラビリティと一般化を制限する。
これらの制約に対処するために,単一モデル内で生成と反転を共同で学習する統合フレームワークであるBiFM(Bidirectional Flow Matching)を提案する。
BiFM は ``image $\to$ noise" と ` ``noise $\to$ image" の方向で平均速度場を直接推定する。
さらに、BiFMは、双方向の一貫性目標と軽量な時間間隔埋め込みによって安定化された、連続時間間隔監視を用いた新しいトレーニング戦略を導入している。
この双方向の定式化は、ワンステップの逆転を可能にし、人気のある拡散とフローマッチングバックボーンにシームレスに統合することができる。
BiFMは多様な画像編集と生成タスクにまたがって、既存の数ステップのアプローチを一貫して上回り、優れたパフォーマンスと編集性を実現している。
関連論文リスト
- From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation [18.70033095161235]
Indicit Likelihood Estimation (IMLE) を用いて条件付きフローマッチングの専門家を高速な単一ステップの学生に蒸留する枠組みを提案する。
双方向のチャンファー距離は、モードカバレッジと忠実度の両方を促進する設定レベルの目的を提供する。
統合認識エンコーダは、さらに多視点RGB、深度、点雲、プロプレセプションを幾何学的認識表現に統合する。
論文 参考訳(メタデータ) (2026-03-10T09:30:05Z) - Fitting Image Diffusion Models on Video Datasets [30.688877034764474]
本稿では,連続ビデオフレームに存在する時間的帰納バイアスを利用して拡散訓練を改善する,シンプルで効果的なトレーニング戦略を提案する。
本手法はHandCoデータセット上で評価し,手動物体間相互作用が高密度時間的コヒーレンスを示す。
論文 参考訳(メタデータ) (2025-09-04T01:04:54Z) - Residual-based Efficient Bidirectional Diffusion Model for Image Dehazing and Haze Generation [17.043633726365233]
現在のディープデヘイズ法は、ヘイズフリー画像とヘイズフリー画像の翻訳能力に欠け、ヘイズ画像からヘイズを除去することのみに焦点を当てている。
本研究では, 残差に基づく効率的な双方向拡散モデル (RBDM) を提案し, 脱ハジングとヘイズ生成の両方の条件分布をモデル化する。
RBDMは,15ステップのサンプリングで,ヘイズフリー画像とヘイズ画像の双方向化を実現することに成功した。
論文 参考訳(メタデータ) (2025-08-15T01:00:15Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers [86.5541501589166]
DiffMoEはバッチレベルのグローバルトークンプールで、トレーニング中に専門家がグローバルトークンの配布にアクセスできるようにする。
ImageNetベンチマークの拡散モデル間での最先端のパフォーマンスを実現する。
このアプローチの有効性は、クラス条件生成を超えて、テキスト・ツー・イメージ生成のようなより困難なタスクにも及んでいる。
論文 参考訳(メタデータ) (2025-03-18T17:57:07Z) - Bidirectional Consistency Models [1.486435467709869]
拡散モデル(DM)は、ランダムなベクトルを反復的に認知することで、驚くほど高品質なサンプルを生成することができる。
DMはまた、確率フロー常微分方程式(PF ODE)に沿って後方に移動することにより、入力画像から雑音への逆変換も可能である。
論文 参考訳(メタデータ) (2024-03-26T18:40:36Z) - Straighter Flow Matching via a Diffusion-Based Coupling Prior [29.38872850098043]
フローマッチング(StraightFM)のストレートトラジェクトリを提案する。
分散レベル全体からの結合戦略でトラジェクトリを直線化する。
画素空間と潜伏空間の実験結果から、StraightFMは5段階以内で魅力的なサンプルが得られることが示された。
論文 参考訳(メタデータ) (2023-11-28T06:19:30Z) - One More Step: A Versatile Plug-and-Play Module for Rectifying Diffusion
Schedule Flaws and Enhancing Low-Frequency Controls [77.42510898755037]
One More Step (OMS) は、推論中に単純だが効果的なステップを付加したコンパクトネットワークである。
OMSは画像の忠実度を高め、トレーニングと推論の二分法を調和させ、元のモデルパラメータを保存する。
トレーニングが完了すると、同じ潜在ドメインを持つ様々な事前訓練された拡散モデルが同じOMSモジュールを共有することができる。
論文 参考訳(メタデータ) (2023-11-27T12:02:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。