論文の概要: VICR: Visual In-Context Restoration for Real-World Image Super-Resolution
- arxiv url: http://arxiv.org/abs/2606.00704v1
- Date: Sat, 30 May 2026 12:27:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.665008
- Title: VICR: Visual In-Context Restoration for Real-World Image Super-Resolution
- Title(参考訳): VICR: リアルタイム画像スーパーリゾリューションのための視覚的インコンテクスト復元
- Abstract要約: 画像補完としてReal-ISRを定式化するフレームワークであるVisual In-Context Restoration (VICR)を提案する。
VICRは、トレーニング可能なパラメータがわずか117Mの複数のReal-ISRベンチマークで、最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 6.277195520534762
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Real-world image super-resolution (Real-ISR) requires balancing structural fidelity to degraded observations with realistic detail synthesis. However, existing generative Real-ISR methods often rely on entangled conditioning mechanisms, leading to structural drift or semantically inconsistent details. To address this issue, we propose Visual In-Context Restoration (VICR), a Diffusion Transformer (DiT)-based framework that formulates Real-ISR as image completion. Specifically, we introduce a decoupled visual prior injection mechanism that derives local and global cues from the low-quality (LQ) image: local cues help recover image structures and support high-frequency detail synthesis, while global cues guide overall generation and promote semantic consistency. For ambiguous regions under severe degradation, VICR employs an inference-time agent to refine semantic prompts using visual evidence from the LQ input while keeping model parameters fixed. Experiments show that VICR achieves state-of-the-art performance across multiple Real-ISR benchmarks with only 127M trainable parameters.
- Abstract(参考訳): 実世界の超解像(Real-ISR)は、構造的忠実さと劣化した観測と現実的な詳細合成とのバランスを必要とする。
しかし、既存の生成的Real-ISR法は、しばしば絡み合った条件付け機構に依存し、構造的ドリフトや意味的に矛盾する詳細をもたらす。
この問題を解決するために,Diffusion Transformer (DiT) ベースのフレームワークである Visual In-Context Restoration (VICR) を提案する。
具体的には、低品質(LQ)画像から局所的および大域的キューを導出する分離された視覚的事前注入機構を導入し、局所的キューは画像構造を復元し、高頻度の詳細合成をサポートする一方、グローバル的キューは全体生成をガイドし、意味的一貫性を促進する。
深刻な劣化下での曖昧な領域では、VICRはモデルパラメータを固定しながらLQ入力からの視覚的証拠を用いて意味論的プロンプトを洗練するために推論時エージェントを使用する。
実験により、VICRはトレーニング可能なパラメータがわずか117Mの複数のReal-ISRベンチマークで最先端のパフォーマンスを達成することが示された。
関連論文リスト
- Disentangled Textual Priors for Diffusion-based Image Super-Resolution [41.71306518338786]
Image Super-Resolutionは、劣化した低解像度入力から高解像度画像を再構成することを目的としている。
既存のアプローチは、グローバルなレイアウトとローカルな詳細を混ぜ合わせた、絡み合った、あるいは粗い粒度の前のものに依存することが多い。
DTPSRは,2つの相補的な次元に絡み合ったテキストの先行処理を導入する新しい拡散型SRフレームワークである。
論文 参考訳(メタデータ) (2026-03-08T03:02:55Z) - Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution [79.35296000454694]
拡散に基づく超解像は、豊富な詳細を合成することができるが、合成ペアデータで訓練されたモデルは、現実世界のLR画像では失敗することが多い。
我々は,超解像を軌道レベルの優先最適化として定式化する報奨誘導拡散フレームワークであるBird-SRを提案する。
実世界のSRベンチマークの実験では、Bird-SRは知覚品質において最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-05T19:21:45Z) - Dual-domain Adaptation Networks for Realistic Image Super-resolution [81.34345637776408]
現実画像超解像(SR)は、現実世界の低解像度(LR)画像を高解像度(HR)画像に変換することに焦点を当てている。
現在の手法は、限られた現実世界のLR-HRデータと競合し、基本的な画像特徴の学習に影響を及ぼす。
我々は、シミュレーションされた画像SRモデルを実世界のデータセットに効率よく適応できる新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-11-21T12:57:23Z) - SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning [59.013863248600046]
本稿では,空間的に再焦点を絞ったテキストコンディショニングを推論時に洗練する超解像フレームワークを提案する。
第二に,非接地画素に対するテキストの影響を選択的に回避し,幻覚を防ぐ空間的自由誘導機構を導入する。
論文 参考訳(メタデータ) (2025-10-26T05:03:55Z) - Unsupervised Real-World Super-Resolution via Rectified Flow Degradation Modelling [16.485914675883972]
教師なしの現実世界の超解像(SR)は、複雑な未知の劣化分布のために重要な課題に直面している。
既存の手法では、合成低分解能(LR)と高分解能(HR)画像対から実世界のデータへの一般化に苦慮している。
実世界の劣化を効果的に捉え,モデル化するために,整流に基づく教師なし実世界のSR手法を提案する。
論文 参考訳(メタデータ) (2025-08-10T07:27:28Z) - Controllable Reference Guided Diffusion with Local Global Fusion for Real World Remote Sensing Image Super Resolution [9.658727475375565]
超解像技術は、リモートセンシング画像の空間分解能を高め、より効率的な大規模な地球観測アプリケーションを可能にする。
既存のRefSR手法は、クロスセンサーの解像度ギャップや重要な土地被覆の変化など、現実世界の複雑さに苦しむ。
実世界リモートセンシング画像SRのための新しい制御可能な参照誘導拡散モデルであるCRefDiffを提案する。
論文 参考訳(メタデータ) (2025-06-30T12:45:28Z) - DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models [9.109484087832058]
DiffRISは、RRSISタスクのための事前訓練されたテキスト-画像拡散モデルのセマンティック理解機能を利用する新しいフレームワークである。
我々のフレームワークは、文脈認識アダプタ(CP-adapter)とクロスモーダル推論デコーダ(PCMRD)の2つの重要なイノベーションを導入している。
論文 参考訳(メタデータ) (2025-06-23T02:38:56Z) - Unsupervised Image Super-Resolution Reconstruction Based on Real-World Degradation Patterns [4.977925450373957]
超解像再構成モデルのトレーニングのための新しいTripleGANフレームワークを提案する。
このフレームワークは、LR観測から実世界の劣化パターンを学習し、対応する劣化特性を持つデータセットを合成する。
本手法は, 過スムーズなアーティファクトを伴わずに, 鋭い復元を維持しながら, 定量的な測定値に明らかな利点を示す。
論文 参考訳(メタデータ) (2025-06-20T14:24:48Z) - Low-Res Leads the Way: Improving Generalization for Super-Resolution by
Self-Supervised Learning [45.13580581290495]
本研究は,SRモデルの現実の画像への適応性を高めるために,新しい"Low-Res Leads the Way"(LWay)トレーニングフレームワークを導入する。
提案手法では,低分解能(LR)再構成ネットワークを用いて,LR画像から劣化埋め込みを抽出し,LR再構成のための超解出力とマージする。
私たちのトレーニング体制は普遍的に互換性があり、ネットワークアーキテクチャの変更は不要です。
論文 参考訳(メタデータ) (2024-03-05T02:29:18Z) - ICF-SRSR: Invertible scale-Conditional Function for Self-Supervised
Real-world Single Image Super-Resolution [60.90817228730133]
単一画像超解像(SISR)は、与えられた低解像度(LR)画像を高解像度(HR)にアップサンプリングすることを目的とした課題である。
近年のアプローチは、単純化されたダウンサンプリング演算子によって劣化したシミュレーションLR画像に基づいて訓練されている。
Invertible Scale-Conditional Function (ICF) を提案する。これは入力画像をスケールし、異なるスケール条件で元の入力を復元する。
論文 参考訳(メタデータ) (2023-07-24T12:42:45Z) - Learning Detail-Structure Alternative Optimization for Blind
Super-Resolution [69.11604249813304]
そこで我々は,ブラインドSRに先立ってカーネルを曖昧にすることなく,再帰的な詳細構造代替最適化を実現する,有効かつカーネルフリーなネットワークDSSRを提案する。
DSSRでは、細部構造変調モジュール(DSMM)が構築され、画像の詳細と構造の相互作用と協調を利用する。
本手法は既存の手法に対して最先端の手法を実現する。
論文 参考訳(メタデータ) (2022-12-03T14:44:17Z) - Frequency Consistent Adaptation for Real World Super Resolution [64.91914552787668]
実シーンにスーパーリゾリューション(SR)法を適用する際に周波数領域の整合性を保証する新しい周波数一貫性適応(FCA)を提案する。
監視されていない画像から劣化カーネルを推定し、対応するLow-Resolution (LR)画像を生成する。
ドメイン一貫性のあるLR-HRペアに基づいて、容易に実装可能な畳み込みニューラルネットワーク(CNN)SRモデルを訓練する。
論文 参考訳(メタデータ) (2020-12-18T08:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。