論文の概要: Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models
- arxiv url: http://arxiv.org/abs/2603.22027v1
- Date: Mon, 23 Mar 2026 14:33:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.717251
- Title: Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models
- Title(参考訳): 推論による実世界の画像復元のチューニング:フローマッチングモデルのためのテスト時間スケーリングパラダイム
- Authors: Purui Bai, Junxian Duan, Pin Wang, Jinhua Hao, Ming Sun, Chao Zhou, Huaibo Huang,
- Abstract要約: ResFlow-Tunerは、最先端のフローマッチングモデルであるFLUX.1-devに基づく画像復元フレームワークである。
画像復元に適したトレーニング不要なテスト時間スケーリングパラダイムを提案する。
- 参考スコア(独自算出の注目度): 26.002982722748726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although diffusion-based real-world image restoration (Real-IR) has achieved remarkable progress, efficiently leveraging ultra-large-scale pre-trained text-to-image (T2I) models and fully exploiting their potential remain significant challenges. To address this issue, we propose ResFlow-Tuner, an image restoration framework based on the state-of-the-art flow matching model, FLUX.1-dev, which integrates unified multi-modal fusion (UMMF) with test-time scaling (TTS) to achieve unprecedented restoration performance. Our approach fully leverages the advantages of the Multi-Modal Diffusion Transformer (MM-DiT) architecture by encoding multi-modal conditions into a unified sequence that guides the synthesis of high-quality images. Furthermore, we introduce a training-free test-time scaling paradigm tailored for image restoration. During inference, this technique dynamically steers the denoising direction through feedback from a reward model (RM), thereby achieving significant performance gains with controllable computational overhead. Extensive experiments demonstrate that our method achieves state-of-the-art performance across multiple standard benchmarks. This work not only validates the powerful capabilities of the flow matching model in low-level vision tasks but, more importantly, proposes a novel and efficient inference-time scaling paradigm suitable for large pre-trained models.
- Abstract(参考訳): 拡散に基づく実世界の画像復元(Real-IR)は目覚ましい進歩を遂げているが、超大規模の事前訓練されたテキスト・ツー・イメージ(T2I)モデルを効率的に活用し、その可能性を完全に活用することは依然として大きな課題である。
本稿では,最新のフローマッチングモデルであるFLUX.1-devに基づく画像復元フレームワークResFlow-Tunerを提案する。
提案手法は,高画質画像の合成を導く統一シーケンスに多モード条件を符号化することで,MM-DiTアーキテクチャの利点をフル活用する。
さらに,画像復元に適したトレーニングフリーなテスト時間スケーリングパラダイムを導入する。
推論中、この手法は報酬モデル(RM)からのフィードバックを通じて動的に認知方向を操縦し、制御可能な計算オーバーヘッドで大幅な性能向上を達成する。
大規模な実験により,本手法は,複数の標準ベンチマークにおいて最先端の性能を達成できることが実証された。
この研究は、低レベル視覚タスクにおけるフローマッチングモデルの強力な能力を検証するだけでなく、より重要なことは、大規模な事前学習モデルに適した、新しく効率的な推論時間スケーリングパラダイムを提案することである。
関連論文リスト
- Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - Two-Stage Random Alternation Framework for One-Shot Pansharpening [12.385955231193675]
本稿では,任意のマルチスペクトル(MS)/パンクロマティック(PAN)ペアに対して,インスタンス固有の最適化を行う2段階ランダム交互化フレームワーク(TRA-PAN)を提案する。
TRA-PANは、縮小解像度画像からの強い監督制約とフル解像度画像の物理的特性を効果的に統合する。
実験の結果,TRA-PANは実世界のシナリオにおいて,定量的な測定値と視覚的品質において,最先端(SOTA)手法よりも優れていた。
論文 参考訳(メタデータ) (2025-05-10T09:26:22Z) - Frequency Autoregressive Image Generation with Continuous Tokens [31.833852108014312]
本稿では、周波数プログレッシブ自己回帰(textbfFAR)パラダイムを導入し、連続トークン化器を用いてFARをインスタンス化する。
我々は、ImageNetデータセットの総合的な実験を通して、FARの有効性を実証する。
論文 参考訳(メタデータ) (2025-03-07T10:34:04Z) - Efficient One-Step Diffusion Refinement for Snapshot Compressive Imaging [8.819370643243012]
Coded Aperture Snapshot Spectral Imaging (CASSI)は3次元マルチスペクトル画像(MSI)を撮影するための重要な技術である
現在の最先端の手法は、主にエンドツーエンドであり、高周波の詳細を再構築する際の制限に直面している。
本稿では,Snapshot Compressive Imagingのための自己教師型適応フレームワークにおいて,新しい1段階拡散確率モデルを提案する。
論文 参考訳(メタデータ) (2024-09-11T17:02:10Z) - Binarized Diffusion Model for Image Super-Resolution [61.963833405167875]
超圧縮アルゴリズムであるバイナリ化は、高度な拡散モデル(DM)を効果的に加速する可能性を提供する
既存の二項化法では性能が著しく低下する。
画像SRのための新しいバイナライズ拡散モデルBI-DiffSRを提案する。
論文 参考訳(メタデータ) (2024-06-09T10:30:25Z) - DiffSCI: Zero-Shot Snapshot Compressive Imaging via Iterative Spectral
Diffusion Model [18.25548360119976]
マルチスペクトル画像(MSI)におけるスナップショット圧縮画像(SCI)再構成の精度向上を目指した。
DiffSCIと呼ばれる新しいゼロショット拡散モデルを提案する。
我々は,DiffSCIが自己監督的,ゼロショット的アプローチよりも顕著な性能向上を示すことを示すため,広範囲な試験を行った。
論文 参考訳(メタデータ) (2023-11-19T20:27:14Z) - IRGen: Generative Modeling for Image Retrieval [82.62022344988993]
本稿では,画像検索を生成モデルの一種として再フレーミングする新しい手法を提案する。
我々は、イメージを意味単位の簡潔なシーケンスに変換するという技術的課題に対処するため、IRGenと呼ばれるモデルを開発した。
本モデルは,広範に使用されている3つの画像検索ベンチマークと200万件のデータセットに対して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2023-03-17T17:07:36Z) - Normalizing Flows with Multi-Scale Autoregressive Priors [131.895570212956]
マルチスケール自己回帰前処理(mAR)を通した遅延空間におけるチャネルワイド依存性を導入する。
我々のmARは、分割結合フロー層(mAR-SCF)を持つモデルに先立って、複雑なマルチモーダルデータの依存関係をよりよく捉えます。
我々は,mAR-SCFにより画像生成品質が向上し,FIDとインセプションのスコアは最先端のフローベースモデルと比較して向上したことを示す。
論文 参考訳(メタデータ) (2020-04-08T09:07:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。