論文の概要: MagnifiQ: Patch-aware Text Guided Progressive Upscaling for High-Resolution Image Restoration
- arxiv url: http://arxiv.org/abs/2608.14543v1
- Date: Fri, 14 Aug 2026 17:56:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.463918
- Title: MagnifiQ: Patch-aware Text Guided Progressive Upscaling for High-Resolution Image Restoration
- Title(参考訳): MagnifiQ:高解像度画像復元のためのプログレッシブアップスケーリングをガイドしたパッチ対応テキスト
- Authors: Mahesh Reddy, Yashesh Savani, Antoine Mercier, Hong Cai, Fatih Porikli, Guillaume Berger,
- Abstract要約: MagnifiQは画像復元フレームワークで、解像度をまたいだ画像を徐々にスケールアップし、復元する。
よりシャープなテクスチャとよりコヒーレントな4K結果を生成し、実用的なスピード品質のトレードオフを提供する。
- 参考スコア(独自算出の注目度): 44.73576056659987
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-resolution image restoration from degraded inputs is challenging because it must preserve global structural consistency while recovering fine-grained local details, especially at 4K resolution where direct diffusion-based restoration is computationally expensive and prone to repeated or inconsistent textures. In this work, we introduce MagnifiQ, an image restoration framework that progressively upscales and restores images across resolutions, e.g., from 1024x1024 to 4096x4096. Our approach leverages a pre-trained text-to-image diffusion model such as SDXL and adapts it for more scalable high-resolution inference by replacing its original self-attention layers with convolutional operations whose computational cost grows linearly with image resolution. We further propose a progressive upscaling strategy that iteratively restores images over multiple resolution stages, refining each intermediate output rather than directly hallucinating the final 4K image, thereby improving global coherence and reducing high-resolution artifacts. To enhance local details while controlling content drift, MagnifiQ uses patch-specific text prompts that provide spatially localized semantic guidance during restoration. Extensive experiments on synthetic and real-world degraded images show that MagnifiQ outperforms prior diffusion-based restoration methods in perceptual quality and human preference, producing sharper textures and more coherent 4K results while offering practical speed--quality trade-offs through its scalable backbone and progressive design.
- Abstract(参考訳): 劣化した入力からの高解像度画像復元は、特に直接拡散ベースの復元が計算コストが高く、繰り返しまたは一貫性のないテクスチャが生じる4K解像度において、微細な局所的な詳細を回復しながら、グローバルな構造的一貫性を維持する必要があるため、困難である。
本研究では,解像度1024x1024から4096x4096までの解像度で画像を段階的にアップスケールし,復元する画像復元フレームワークであるMagnifiQを紹介する。
本手法はSDXLのような事前学習されたテキスト・画像拡散モデルを利用して,従来の自己認識層を画像解像度とともに線形に増大する畳み込み演算に置き換えることで,よりスケーラブルな高解像度推論に適応する。
さらに,最終4K画像を直接幻覚させるのではなく,各中間出力を精製することにより,大域的コヒーレンスを向上し,高解像度のアーティファクトを低減できるプログレッシブ・アップスケーリング戦略を提案する。
コンテンツドリフトを制御しながら局所的な詳細を強化するために、MagnifiQはパッチ固有のテキストプロンプトを使用して、修復中に空間的に局所化されたセマンティックガイダンスを提供する。
合成および実世界の劣化画像に対する大規模な実験により、MagnifiQは従来の拡散に基づく復元手法よりも知覚的品質と人間の嗜好に優れ、よりシャープなテクスチャとよりコヒーレントな4K結果を生み出し、スケーラブルなバックボーンとプログレッシブデザインを通じて実用的なスピード品質のトレードオフを提供する。
関連論文リスト
- LSSGen: Leveraging Latent Space Scaling in Flow and Diffusion for Efficient Text to Image Generation [14.423622700472892]
合成を高速化するための一般的な戦略は、低分解能で早期に復調を行うことである。
ピクセル空間におけるダウンスケールとアップスケールの伝統的な手法は、しばしばアーティファクトや歪みをもたらす。
本稿では,bf遅延空間スケーリング生成(LSSGen)を提案する。
論文 参考訳(メタデータ) (2025-07-22T02:05:21Z) - Directing Mamba to Complex Textures: An Efficient Texture-Aware State Space Model for Image Restoration [75.51789992466183]
TAMAMbaIRは画像テクスチャの達成と性能と効率のトレードオフを同時に知覚する。
画像超解像, デラリニング, 低照度画像強調のためのベンチマーク実験により, TAMAMbaIRは高い効率で最先端の性能を達成できることを示した。
論文 参考訳(メタデータ) (2025-01-27T23:53:49Z) - Timestep-Aware Diffusion Model for Extreme Image Rescaling [47.89362819768323]
本稿では,時間認識拡散モデル(TADM)と呼ばれる,画像再スケーリングのための新しいフレームワークを提案する。
TADMは、事前訓練されたオートエンコーダの潜在空間で再スケーリング操作を行う。
これは、事前訓練されたテキスト・ツー・イメージ拡散モデルによって学習された強力な自然画像の先行を効果的に活用する。
論文 参考訳(メタデータ) (2024-08-17T09:51:42Z) - Diff-Restorer: Unleashing Visual Prompts for Diffusion-based Universal Image Restoration [19.87693298262894]
拡散モデルに基づく普遍的な画像復元手法であるDiff-Restorerを提案する。
我々は、事前学習された視覚言語モデルを用いて、劣化した画像から視覚的プロンプトを抽出する。
また、デグレーション対応デコーダを設計し、構造的補正を行い、潜在コードをピクセル領域に変換する。
論文 参考訳(メタデータ) (2024-07-04T05:01:10Z) - ResMaster: Mastering High-Resolution Image Generation via Structural and Fine-Grained Guidance [46.64836025290448]
ResMasterは、解像度制限を超えて高品質な画像を生成するために、解像度制限付き拡散モデルに権限を与える、トレーニング不要の方法である。
パッチ・バイ・パッチで高解像度画像を作成するための構造的かつきめ細かいガイダンスを提供する。
実験では、ResMasterが高解像度画像生成のための新しいベンチマークを設定し、有望な効率を示す。
論文 参考訳(メタデータ) (2024-06-24T09:28:21Z) - Spatially-Adaptive Image Restoration using Distortion-Guided Networks [51.89245800461537]
空間的に変化する劣化に苦しむ画像の復元のための学習ベースソリューションを提案する。
本研究では、歪み局所化情報を活用し、画像中の困難な領域に動的に適応するネットワーク設計であるSPAIRを提案する。
論文 参考訳(メタデータ) (2021-08-19T11:02:25Z) - Invertible Image Rescaling [118.2653765756915]
Invertible Rescaling Net (IRN) を開発した。
我々は、ダウンスケーリングプロセスにおいて、指定された分布に従う潜在変数を用いて、失われた情報の分布をキャプチャする。
論文 参考訳(メタデータ) (2020-05-12T09:55:53Z) - Gated Fusion Network for Degraded Image Super Resolution [78.67168802945069]
本稿では,基本特徴と回復特徴を別々に抽出する二分岐畳み込みニューラルネットワークを提案する。
特徴抽出ステップを2つのタスク非依存ストリームに分解することで、デュアルブランチモデルがトレーニングプロセスを容易にすることができる。
論文 参考訳(メタデータ) (2020-03-02T13:28:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。