論文の概要: CUST: Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution
- arxiv url: http://arxiv.org/abs/2607.11088v1
- Date: Mon, 13 Jul 2026 04:56:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.332682
- Title: CUST: Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution
- Title(参考訳): CUST: 軽量画像超解像のためのクラスタ化単位レベル類似性変換器
- Abstract要約: クラスタ化単位レベル類似性変換器(CUST)は、グローバルおよびローカル情報を効率的に統合する新しいアーキテクチャである。
CUSTは各パッチを集約し、ローカルウィンドウの外側の広い領域の範囲内で同様のパッチに対処することを可能にする。
実験により,提案モデルが計算効率と復元性能の両立を実証した。
- 参考スコア(独自算出の注目度): 0.2538209532048866
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, Vision Transformer (ViT)-based models have exhibited remarkable performance in image super-resolution. However, the quadratic computational complexity of ViTs with respect to spatial resolution severely constrains their efficiency, leading to high latency and massive memory consumption. To alleviate this, various window-based attention mechanisms have been proposed; yet, they inherently compromise the long-range dependency modeling that is the primary advantage of ViTs. To overcome these limitations, we propose the Clustered Unit-level Similarity Transformer (CUST), a novel architecture that efficiently integrates global and local information. Specifically, CUST enables each patch to aggregate and attend to similar patches within a broadened regional scope outside its local window, thereby capturing extensive contextual understanding. Furthermore, it employs overlapping attention windows to capture local dependencies, while explicitly extracting high-frequency details by computing the residual difference between the original features and their downsampled-upsampled counterparts. Comprehensive experiments demonstrate that our proposed model achieves a practical balance between computational efficiency and restoration performance. It achieves a lower memory footprint and faster inference speed compared to recent global context or lightweight models under realistic constraints. Code is available at [https://github.com/jwgdmkj/CUST].
- Abstract(参考訳): 近年、ヴィジュアルトランスフォーマー(ViT)ベースのモデルでは、画像超解像の性能が著しく向上している。
しかし、空間分解能に対するViTの二次計算複雑性は、その効率を著しく制限し、高いレイテンシと大量のメモリ消費をもたらす。
これを軽減するために、様々なウィンドウベースの注意機構が提案されているが、それらは本質的にViTの主な利点である長距離依存性モデリングを損なう。
これらの制約を克服するために,グローバルおよびローカル情報を効率的に統合する新しいアーキテクチャであるClustered Unit-level similarity Transformer (CUST)を提案する。
具体的には、CUSTは各パッチを集約し、ローカルウィンドウの外側の広い領域の範囲内で類似のパッチをアグリゲートし、それによってコンテキストの理解を深めることを可能にする。
さらに、重複したアテンションウィンドウを用いて局所的な依存関係をキャプチャし、元の特徴とサンプリングされたサンプルの残差を計算することで、高周波の詳細を明示的に抽出する。
総合的な実験により,提案モデルが計算効率と復元性能の実際のバランスを達成できることが実証された。
現実的な制約下での最近のグローバルコンテキストや軽量モデルと比較して、メモリフットプリントの低減と推論速度の高速化を実現している。
コードは[https://github.com/jwgdmkj/CUST]で入手できる。
関連論文リスト
- When Simplicity Wins: Bottleneck-Aware Context Modeling for Lightweight Semantic Segmentation [58.325533783810016]
セマンティックセグメンテーションのための軽量で効果的なフレームワークSiConMoを提案する。
極めて低い計算予算では、ボトルネックは局所的およびグローバル的コンテキストを統合する上で最も効率的な段階である。
ADE20K、PASCALコンテキスト、Cityscapes、COCO-Stuffに関する実験では、SiConMoが最先端の精度と効率のトレードオフを達成することを示した。
論文 参考訳(メタデータ) (2026-08-19T14:47:07Z) - RepSFNet : A Single Fusion Network with Structural Reparameterization for Crowd Counting [6.895355763564631]
RepSFNetは、正確でリアルタイムな群衆推定のために設計された軽量アーキテクチャである。
RepSFNetは、最近の最先端の手法と比較して、推論遅延を最大34%削減しながら、競争精度を達成している。
論文 参考訳(メタデータ) (2026-01-28T08:33:36Z) - Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting [15.751224470424786]
ビジョントランスフォーマー(ViT)は、グローバルな依存関係をキャプチャする強力な能力を示しているが、多くの場合、きめ細かい局所的な詳細を効率的に表現するのに苦労している。
Grc-ViT(Granularity-driven Vision Transformer)は、画像の複雑さに基づいて視覚的な粒度を適応的に調整する動的粗い微細化フレームワークである。
2つの学習可能なパラメータとベータは、グローバルな推論と局所的な知覚のバランスを取るためにエンドツーエンドに最適化されている。
論文 参考訳(メタデータ) (2025-11-24T11:55:22Z) - PiT: Progressive Diffusion Transformer [50.46345527963736]
拡散変換器(DiT)は変換器アーキテクチャを用いて画像生成において顕著な性能を発揮する。
DiTは以前信じられていたようなグローバルな情報に大きく依存していない。
Pseudo Progressive Diffusion Transformer (PiT)を提案する。
論文 参考訳(メタデータ) (2025-05-19T15:02:33Z) - Any Image Restoration via Efficient Spatial-Frequency Degradation Adaptation [158.37640586809187]
劣化した画像を1つのモデルで効率的に復元することは、ますます重要になっている。
我々のアプローチはAnyIRと呼ばれ、様々な劣化にまたがる固有の類似性を活用する統一された経路をとっています。
劣化認識と文脈的注意を融合させるため,空間周波数並列融合戦略を提案する。
論文 参考訳(メタデータ) (2025-04-19T09:54:46Z) - LIFT: Latent Implicit Functions for Task- and Data-Agnostic Encoding [4.759109475818876]
Implicit Neural Representations (INR)は、多様なデータドメインをまたいだタスクモデリングを統合するための強力なパラダイムであることが証明されている。
本稿では,メタラーニングによるマルチスケール情報をキャプチャする新しい高性能フレームワークLIFTを紹介する。
また、残差接続と表現頻度符号化を組み込んだLIFTの強化版であるReLIFTについても紹介する。
論文 参考訳(メタデータ) (2025-03-19T17:00:58Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Transforming Image Super-Resolution: A ConvFormer-based Efficient Approach [58.57026686186709]
本稿では, Convolutional Transformer Layer (ConvFormer) を導入し, ConvFormer-based Super-Resolution Network (CFSR) を提案する。
CFSRは畳み込みベースのアプローチとトランスフォーマーベースのアプローチの両方の利点を継承する。
CFSRは計算コストと性能のバランスが最適であることを示す実験である。
論文 参考訳(メタデータ) (2024-01-11T03:08:00Z) - Factorization Vision Transformer: Modeling Long Range Dependency with
Local Window Cost [25.67071603343174]
本稿では,ローカルウィンドウコストと長期依存性モデリング機能の両方の利点を享受できる因子分解自己注意機構を提案する。
FaViTは、入力画像空間分解能に関する線形計算複雑性により、高い性能とロバスト性を達成する。
FaViT-B2は, モデルパラメータを14%削減しつつ, 分類精度を1%, 頑健性を7%向上させる。
論文 参考訳(メタデータ) (2023-12-14T02:38:12Z) - Low-Resolution Self-Attention for Semantic Segmentation [93.30597515880079]
我々は,グローバルコンテキストを計算コストの大幅な削減で捉えるために,低解像度自己認識(LRSA)機構を導入する。
我々のアプローチは、入力画像の解像度に関わらず、固定された低解像度空間における自己注意を計算することである。
本稿では,エンコーダ・デコーダ構造を持つビジョントランスであるLRFormerを構築することで,LRSA手法の有効性を示す。
論文 参考訳(メタデータ) (2023-10-08T06:10:09Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z) - Learned Queries for Efficient Local Attention [11.123272845092611]
視覚変換器の自己保持機構は、高レイテンシと非効率なメモリ利用に悩まされる。
本稿では,クエリ・アンド・アテンション(QnA)と呼ばれる,新たなシフト不変なローカルアテンション層を提案する。
我々は、最先端モデルと同等の精度を達成しつつ、スピードとメモリの複雑さの改善を示す。
論文 参考訳(メタデータ) (2021-12-21T18:52:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。