論文の概要: AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution
- arxiv url: http://arxiv.org/abs/2607.00987v1
- Date: Wed, 01 Jul 2026 14:22:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.933384
- Title: AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution
- Title(参考訳): AVSR-Diff: 一時持続性任意スケールビデオ超解像におけるスケール非依存拡散前駆体
- Abstract要約: 拡散モデルは、かなり高度なビデオ超解像(VSR)を持つが、固定されたアップサンプリングスケールに大きく制約されている。
AVSR-Diff は,連続的な座標の描画からスケール・ア・ラテン・デノナイジングを分離する新しいデカップリングフレームワークである。
我々のフレームワークは、様々なスケールにわたる高周波の詳細と強い時間的安定性を一貫して保持し、最先端の任意のスケールのベースラインを超越している。
- 参考スコア(独自算出の注目度): 31.274516936914267
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models have significantly advanced video super-resolution (VSR) but remain largely constrained to fixed upsampling scales. Conversely, while coordinate-based arbitrary-scale VSR methods offer scale flexibility, they inherently suffer from severe over-smoothing at large scaling factors. Integrating generative priors with continuous decoding is promising but currently hindered by severe temporal flickering caused by the stochasticity of diffusion sampling. To address this, we propose AVSR-Diff (Arbitrary-scale Video Super-Resolution with Diffusion), a novel decoupled framework that separates scale-agnostic latent denoising from continuous coordinate rendering, effectively avoiding computationally heavy resolution-specific sampling. Our approach introduces a Temporally-Gated Feature Recurrence (TGFR) module to extract strictly aligned, temporally consistent latent priors. Furthermore, we design a continuous video VAE decoder incorporating a Scale-Aware Fourier Refinement (SAFR) module to dynamically adapt frequency components to any target scale. Extensive experiments demonstrate that AVSR-Diff consistently preserves high-frequency details and strong temporal stability across various scales, surpassing state-of-the-art arbitrary-scale baselines. Remarkably, our framework outperforms recent fixed-scale generative models even on their native resolution.
- Abstract(参考訳): 拡散モデルは、かなり高度なビデオ超解像(VSR)を持つが、固定されたアップサンプリングスケールに大きく制約されている。
逆に、座標ベースの任意のスケールのVSR法はスケールの柔軟性を提供するが、それらは本質的に大きなスケーリング要因において過度なオーバースムーシングに悩まされる。
連続的復号化による生成前駆体の統合は有望であるが, 拡散サンプリングの確率性によって引き起こされる重度の時間的フリッカリングを妨げている。
AVSR-Diff(Arbitrary-scale Video Super-Resolution with Diffusion)は,連続的な座標の描画からスケール非依存の潜伏を分離し,計算的に高解像度なサンプリングを効果的に回避する新しい分離されたフレームワークである。
提案手法では,時間的に一貫した遅延前処理を抽出するTGFR (Temporally-Gated Feature Recurrence) モジュールを導入する。
さらに,SAFR(Scale-Aware Fourier Refinement)モジュールを組み込んだ連続ビデオVAEデコーダを設計し,周波数成分を任意のスケールに動的に適用する。
広範囲な実験により、AVSR-Diffは様々なスケールにわたる高周波の詳細と強い時間的安定性を一貫して維持し、最先端の任意のスケールのベースラインを超えることが示されている。
注目すべきは、我々のフレームワークは、そのネイティブ解像度でさえ、最近の固定スケール生成モデルよりも優れています。
関連論文リスト
- ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models [52.648413887350195]
我々は,グローバルな反復,局所的な反復,詳細劣化を抑制するために,ステージアウェアのRoPEリマッピングを提案する。
また、分解能不変な正規化エントロピーを介して分散を定量化するエントロピー駆動適応アテンションを提案する。
本手法は, 構造コヒーレンスと細部忠実度の両方において, 先行分解能・分光法より常に優れる。
論文 参考訳(メタデータ) (2026-05-11T06:14:38Z) - GS-STVSR: Ultra-Efficient Continuous Spatio-Temporal Video Super-Resolution via 2D Gaussian Splatting [71.12303582606019]
Continuous Video Super-Resolution (C-STVSR) は、任意のスケールファクタによる動画の空間的・フレーム的レートの同時向上を目的としている。
2次元ガウシアンティング(2D-GS)に基づく超効率的なC-STVSRフレームワークであるGS-STVSRを提案する。
GS-STVSRは,すべてのベンチマークにおいて最先端の品質を実現していることを示す。
論文 参考訳(メタデータ) (2026-04-20T10:11:05Z) - Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features [51.5076190312734]
ビデオ超解法アプローチは、エラーの蓄積、空間的アーティファクト、知覚的品質と忠実さのトレードオフに悩まされる。
ビデオ超解像(DGAF-VSR)に適した特徴を持つ新しい誘導拡散モデルを提案する。
合成および実世界のデータセットの実験では、DGAF-VSRがVSRの重要な側面において最先端の手法を超越していることが示されている。
論文 参考訳(メタデータ) (2025-11-21T03:40:45Z) - Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events [71.2439653098351]
連続時空ビデオスーパーSTVSRは、高解像度で高フレームのビデオを任意の時間スケールで再構成する能力への関心が高まっている。
EvEnhancerは、イベントストリームにカプセル化された高時間および高ダイナミックレンジのユニークな特性を結合する新しいアプローチである。
提案手法は,OODスケールでの一般化性を維持しつつ,合成および実世界の両方のデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2025-10-04T15:23:07Z) - DiTVR: Zero-Shot Diffusion Transformer for Video Restoration [48.97196894658511]
DiTVRはゼロショットビデオ復元フレームワークで、拡散トランスフォーマーと軌跡を意識した注意と流れ一貫したサンプルを結合する。
我々の注意機構は、光流路に沿ってトークンを整列させ、特に時間力学に最も敏感な重要な層に重点を置いている。
フローガイドされたサンプリング装置は、低周波帯域にのみデータの一貫性を注入し、キャッシュを加速させながら高周波事前保存を行う。
論文 参考訳(メタデータ) (2025-08-11T09:54:45Z) - UltraVSR: Achieving Ultra-Realistic Video Super-Resolution with Efficient One-Step Diffusion Space [46.43409853027655]
拡散モデルは、現実的な画像の詳細を生成する大きな可能性を示している。
これらのモデルをビデオ超解像(VSR)に適応させることは、その性質と時間的モデリングの欠如により、依然として困難である。
我々は,超現実的で時間的に整合したVSRを,効率的なワンステップ拡散空間で実現するための新しいフレームワークであるUltraVSRを提案する。
論文 参考訳(メタデータ) (2025-05-26T13:19:27Z) - DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations [25.756755602342942]
本稿では,この学習負担を段階的学習を通じて体系的に分解するプログレッシブ・ラーニング・ストラテジー(PLS)を特徴とするDiffVSRを提案する。
我々のフレームワークには、追加のトレーニングオーバーヘッドを伴わずに競合時間一貫性を維持するILT(Interweaved Latent Transition)技術も組み込まれています。
論文 参考訳(メタデータ) (2025-01-17T10:53:03Z) - VRVVC: Variable-Rate NeRF-Based Volumetric Video Compression [59.14355576912495]
NeRFベースのビデオは、FVV(Photorealistic Free-Viewpoint Video)体験を提供することによって、ビジュアルメディアに革命をもたらした。
大量のデータボリュームは、ストレージと送信に重大な課題をもたらす。
ビデオ圧縮のための新しいエンドツーエンドの可変レートフレームワークであるVRVVCを提案する。
論文 参考訳(メタデータ) (2024-12-16T01:28:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。