論文の概要: Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution
- arxiv url: http://arxiv.org/abs/2607.09351v1
- Date: Fri, 10 Jul 2026 12:30:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.839804
- Title: Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution
- Title(参考訳): Simon-SR:テキスト強化超解法のための空間適応型変調と視覚プロンプト適応
- Authors: Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang,
- Abstract要約: SISR(Single Image Super-Resolution)は、低解像度入力から高品質な画像を再構成する。
学習可能なプロンプトを利用して,効率的なセマンティックマイニングとロバストなテキストイメージ融合を実現するマルチモーダルSISRフレームワークであるSimon-SRを提案する。
実験により、Simon-SRは最先端の手法を超え、PSNRでは0.50dB、SSIMでは0.0133、LPIPSでは0.0695の改善を達成した。
- 参考スコア(独自算出の注目度): 6.952226436598156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Single Image Super-Resolution (SISR) reconstructs high-quality images from low-resolution inputs. While recent multi-modal methods improve perceptual quality, they remain sensitive to erroneous priors and require expensive annotations. To address these issues, we propose Simon-SR, a multi-modal SISR framework leveraging learnable prompts for efficient semantic mining and robust text-image fusion. Our approach combines Contrastive Prompt Learning with Prompt-Guided Spatially Adaptive Refinement to enhance multi-modal alignment. Experiments demonstrate that Simon-SR surpasses state-of-the-art methods, achieving maximum improvements of 0.50 dB in PSNR, 0.0133 in SSIM, and 0.0695 in LPIPS. Code will be released.
- Abstract(参考訳): SISR(Single Image Super-Resolution)は、低解像度入力から高品質な画像を再構成する。
最近のマルチモーダル手法は知覚の質を向上させるが、誤った事前情報に敏感であり、高価なアノテーションを必要とする。
これらの課題に対処するために,学習可能なプロンプトを活用した多モードSISRフレームワークであるSimon-SRを提案する。
提案手法は,マルチモーダルアライメントを向上させるために,コントラスト・プロンプト学習とPrompt-Guided Spacely Adaptive Refinementを組み合わせる。
実験により、Simon-SRは最先端の手法を超え、PSNRでは0.50dB、SSIMでは0.0133、LPIPSでは0.0695の改善を達成した。
コードはリリースされる。
関連論文リスト
- CLIP-SR: Collaborative Linguistic and Image Processing for Super-Resolution [21.843398350371867]
畳み込みニューラルネットワーク(CNN)は、画像超解像(SR)を大幅に進歩させた
ほとんどのCNNベースのメソッドはピクセルベースの変換のみに依存しており、アーティファクトやぼやけにつながっている。
テキストのセマンティックスと視覚的特徴を統合するマルチモーダルなセマンティックエンハンスメントフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-16T09:50:09Z) - Exploiting Self-Supervised Constraints in Image Super-Resolution [72.35265021054471]
本稿では,SSC-SRと呼ばれる単一画像超解像のための新しい自己監督制約を提案する。
SSC-SRは、安定性を高めるために指数移動平均によって更新された二重非対称パラダイムとターゲットモデルを用いることで、画像の複雑さのばらつきに一意に対処する。
SSC-SRフレームワークはさまざまなベンチマークデータセットに対して,EDSR平均0.1dB,SwinIR平均0.06dBの大幅な拡張を実現している。
論文 参考訳(メタデータ) (2024-03-30T06:18:50Z) - Image Super-Resolution with Text Prompt Diffusion [118.023531454099]
画像SRにテキストプロンプトを導入し、劣化前の情報を提供する。
PromptSRは、最新のマルチモーダル大言語モデル(MLLM)を利用して、低解像度画像からプロンプトを生成する。
実験により、テキストプロンプトをSRに導入すると、合成画像と実世界の画像の両方で印象的な結果が得られることが示された。
論文 参考訳(メタデータ) (2023-11-24T05:11:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。