論文の概要: MetaSR: Content-Adaptive Metadata Orchestration for Generative Super-Resolution
- arxiv url: http://arxiv.org/abs/2604.26244v1
- Date: Wed, 29 Apr 2026 02:58:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.233763
- Title: MetaSR: Content-Adaptive Metadata Orchestration for Generative Super-Resolution
- Title(参考訳): MetaSR: 生成超解法のためのコンテンツ適応型メタデータオーケストレーション
- Abstract要約: 生成超解像(SR)を,領域,ジャンル,セグメントによって内容や劣化が異なる実世界のシナリオで研究する。
既存のメタデータ誘導SR手法は、通常、固定条件設計を用いるが、これは有用なキューがコンテンツに依存し、送信予算が制限されている場合に最適である。
資源制約下でSRを誘導するためにタスク関連メタデータを選択・注入する拡散変換器(DiT)ベースのフレームワークであるMetaSRを提案する。
- 参考スコア(独自算出の注目度): 16.760486577703745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study generative super-resolution (SR) in real-world scenarios where content and degradations vary across domains, genres, and segments. For example, images and videos may alternate between text overlays, fast motion, smooth cartoons, and low-light faces, each benefiting from different forms of side information. Existing metadata-guided SR methods typically use a fixed conditioning design, which is suboptimal when useful cues are content dependent and transmission budgets are limited. We propose MetaSR, a Diffusion Transformer (DiT)-based framework that selects and injects task-relevant metadata to guide SR under resource constraints. Specifically, we use the DiT's own VAE and transformer backbone to fuse heterogeneous metadata, and adopt an efficient distillation strategy that enables one-step diffusion inference. Experiments across diverse content buckets and degradation regimes show that MetaSR outperforms reference solutions by up to 1.0~dB PSNR while achieving up to 50\% transmission bitrate saving at matched quality. We assess these gains under a rate--distortion optimization (RDO) framework that jointly accounts for sender-side bitrate and receiver/display quality metrics (e.g., PSNR and SSIM).
- Abstract(参考訳): 生成超解像(SR)を,領域,ジャンル,セグメントによって内容や劣化が異なる実世界のシナリオで研究する。
例えば、画像やビデオはテキストオーバーレイ、高速な動き、スムーズな漫画、低照度な顔とを交互に切り替えることができる。
既存のメタデータ誘導SR手法は、通常、固定条件設計を用いるが、これは有用なキューがコンテンツに依存し、送信予算が制限されている場合に最適である。
資源制約下でSRを誘導するためにタスク関連メタデータを選択・注入する拡散変換器(DiT)ベースのフレームワークであるMetaSRを提案する。
具体的には、DiT独自のVAEとトランスフォーマーバックボーンを使用して、異種メタデータを融合させ、ワンステップ拡散推論を可能にする効率的な蒸留戦略を採用する。
多様なコンテンツバケットと劣化機構の実験により、MetaSRは参照ソリューションを最大1.0〜dB PSNRで上回り、最大50%の送信ビットレートの保存を一致した品質で達成している。
我々は、送信側ビットレートと受信側/表示品質指標(例えば、PSNR、SSIM)を併用したレート歪み最適化(RDO)フレームワークでこれらの利得を評価する。
関連論文リスト
- Disentangled Textual Priors for Diffusion-based Image Super-Resolution [41.71306518338786]
Image Super-Resolutionは、劣化した低解像度入力から高解像度画像を再構成することを目的としている。
既存のアプローチは、グローバルなレイアウトとローカルな詳細を混ぜ合わせた、絡み合った、あるいは粗い粒度の前のものに依存することが多い。
DTPSRは,2つの相補的な次元に絡み合ったテキストの先行処理を導入する新しい拡散型SRフレームワークである。
論文 参考訳(メタデータ) (2026-03-08T03:02:55Z) - Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification [3.6907522136316975]
CMS Re-ID(Cross-Modality Ship Re-Identification)は、全天候の海上目標追跡を実現するために重要である。
モダリティギャップのブリッジ化におけるビジョン・ファンデーション・モデル(VFM)の可能性を探る。
ドメイン表現注入(Domain Representation Injection, DRI)と呼ばれる新しいPEFT戦略を提案する。
論文 参考訳(メタデータ) (2025-12-24T02:30:23Z) - RealRep: Generalized SDR-to-HDR Conversion via Attribute-Disentangled Representation Learning [51.19027658873778]
WCG(High-Dynamic-Range Wide-Color-Gamut)技術が普及し,標準ダイナミックレンジ(SDR)コンテンツをHDRに変換する必要性が高まっている。
既存の方法は固定トーンマッピング演算子に依存しており、現実世界のSDRコンテンツに存在する様々な外観や劣化を扱うのに苦労している。
本稿では,構成不整合表現の学習により頑健性を高める一般化されたSDR-to- attributeフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-12T08:08:58Z) - Optimal Transport Adapter Tuning for Bridging Modality Gaps in Few-Shot Remote Sensing Scene Classification [80.83325513157637]
Few-Shot Remote Sensing Scene Classification (FS-RSSC)は,限られたラベル付きサンプルを用いたリモートセンシング画像の分類の課題を示す。
理想的なプラトン表現空間を構築することを目的とした,OTAT(Optimal Transport Adapter Tuning)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-19T07:04:24Z) - Diffusion-Driven Semantic Communication for Generative Models with Bandwidth Constraints [66.63250537475973]
本稿では,帯域制限付き生成モデルのための,高度なVAEベースの圧縮を用いた拡散駆動型セマンティック通信フレームワークを提案する。
実験の結果,ピーク信号対雑音比 (PSNR) などの画素レベルの指標と,LPIPS (Learning Perceptual Image patch similarity) のような意味的指標が大幅に改善された。
論文 参考訳(メタデータ) (2024-07-26T02:34:25Z) - Improving the Stability and Efficiency of Diffusion Models for Content Consistent Super-Resolution [18.71638301931374]
画像超解像 (SR) 結果の視覚的品質を高めるために, 予め訓練した潜伏拡散モデル (DM) の生成先行が大きな可能性を示唆している。
本稿では、生成SR過程を2段階に分割し、DMを画像構造再構築に、GANを細かな細部改善に使用することを提案する。
トレーニングを済ませると、提案手法、すなわちコンテンツ一貫性超解像(CCSR)は、推論段階における異なる拡散ステップの柔軟な利用を可能にする。
論文 参考訳(メタデータ) (2023-12-30T10:22:59Z) - Progressive Learning with Visual Prompt Tuning for Variable-Rate Image
Compression [60.689646881479064]
本稿では,変圧器を用いた可変レート画像圧縮のためのプログレッシブラーニングパラダイムを提案する。
視覚的プロンプトチューニングにインスパイアされた私たちは,エンコーダ側とデコーダ側でそれぞれ入力画像と隠蔽特徴のプロンプトを抽出するためにLPMを使用する。
提案モデルでは, 速度歪み特性の観点から現行の可変画像法よりも優れ, スクラッチから訓練した最先端の固定画像圧縮法にアプローチする。
論文 参考訳(メタデータ) (2023-11-23T08:29:32Z) - Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation Transformer [60.31021888394358]
Unsupervised Domain Adaptation (UDA)は、現実世界の超解像(SR)における領域ギャップ問題に効果的に対処できる
本稿では,画像SR(SODA-SR)のためのSOurce-free Domain Adaptationフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-31T03:14:44Z) - Learning Detail-Structure Alternative Optimization for Blind
Super-Resolution [69.11604249813304]
そこで我々は,ブラインドSRに先立ってカーネルを曖昧にすることなく,再帰的な詳細構造代替最適化を実現する,有効かつカーネルフリーなネットワークDSSRを提案する。
DSSRでは、細部構造変調モジュール(DSMM)が構築され、画像の詳細と構造の相互作用と協調を利用する。
本手法は既存の手法に対して最先端の手法を実現する。
論文 参考訳(メタデータ) (2022-12-03T14:44:17Z) - Improving Super-Resolution Performance using Meta-Attention Layers [17.870338228921327]
畳み込みニューラルネットワーク(CNN)は多くの超解像(SR)と画像復元タスクで素晴らしい結果を得た。
SRのIll-posed性質は、複数の異なる劣化を経た画像を正確に超解き出すのを難しくする。
メタアテンション(メタアテンション)は、任意のSR CNNが関連する劣化パラメータで利用可能な情報を活用できるようにするメカニズムである。
論文 参考訳(メタデータ) (2021-10-27T09:20:21Z) - Conditional Meta-Network for Blind Super-Resolution with Multiple
Degradations [23.026779510800047]
単一画像スーパーリゾリューション(SISR)メソッドは、実際のシナリオで複数のデグレード効果でパフォーマンス低下を被る。
条件付きメタネットワークフレームワーク(CMDSRと命名)を初めて提案し、SRフレームワークが入力分布の変化に適応する方法を学ぶのに役立つ。
論文 参考訳(メタデータ) (2021-04-08T17:15:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。