論文の概要: SAMIC: A Lightweight Semantic-Aware Mamba for Efficient Perceptual Image Compression
- arxiv url: http://arxiv.org/abs/2605.04560v1
- Date: Wed, 06 May 2026 07:03:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.688979
- Title: SAMIC: A Lightweight Semantic-Aware Mamba for Efficient Perceptual Image Compression
- Title(参考訳): SAMIC:効率的な知覚画像圧縮のための軽量セマンティック・アウェア・マンバ
- Authors: Jiaqian Zhang, Hao Wei, Chenyang Ge, Yanhui Zhou,
- Abstract要約: 状態空間モデルの長距離モデリング能力と線形計算複雑性を利用した効率的な知覚画像圧縮法を提案する。
我々は,動的にクラスタ化された意味的特徴によってガイドされるスキャンを可能にする意味認識型マンバブロック (SAMB) を開発した。
提案手法は, 速度歪み知覚トレードオフとモデル複雑性の観点から, 最先端の手法に対して良好に機能する。
- 参考スコア(独自算出の注目度): 5.394151637957463
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Perceptual image compression focuses on preserving high visual quality under low-bitrate constraints. Most existing approaches to perceptual compression leverage the strong generative capabilities of generative adversarial networks or diffusion models, at the cost of substantial model complexity. To this end, we present an efficient perceptual image compression method that exploits the long-range modeling capability and linear computational complexity of state space models, with a particular focus on Mamba. Unlike existing methods that rely on an inherently fixed scanning order and consequently impair semantic continuity and spatial correlation, we develop a semantic-aware Mamba block (SAMB) to enable scanning guided by dynamically clustered semantic features, thereby alleviating the strict causality constraints and long-range information decay inherent to Mamba. Inspired by singular value decomposition, we design an SVD-inspired redundancy reduction module (SVD-RRM) that performs a low-rank approximation on the latent features by introducing a learnable soft threshold, leading to channel-wise redundancy information reduction. The proposed SAMB is integrated into both the encoder and decoder of the compression framework, whereas the SVD-RRM is incorporated only in the encoder. Extensive experiments demonstrate that our method performs favorably against state-of-the-art approaches in terms of rate-distortion-perception tradeoff and model complexity. The source code and pretrained models will be available at https://github.com/Jasmine-aiq/SAMIC.
- Abstract(参考訳): 知覚的画像圧縮は、低ビットレート制約下での高画質の保存に焦点を当てる。
知覚的圧縮に対する既存のほとんどのアプローチは、生成的敵ネットワークや拡散モデルの強力な生成能力を利用して、相当なモデルの複雑さを犠牲にしている。
そこで本研究では,状態空間モデルの長距離モデリング能力と線形計算複雑性を利用して,特にマンバに着目した効率的な知覚画像圧縮手法を提案する。
そこで本研究では,マンバ固有の厳密な因果性制約と長距離情報減衰を緩和し,動的にクラスタリングされた意味的特徴によってガイドされるスキャンを可能にする意味認識型マンバブロック(SAMB)を開発した。
特異値分解にインスパイアされたSVD-RRM(SVD-RRM)を設計し、学習可能なソフトしきい値を導入し、遅延特性を低ランクで近似し、チャネルワイズ冗長情報を低減する。
提案したSAMBは圧縮フレームワークのエンコーダとデコーダの両方に統合されるが,SVD-RRMはエンコーダにのみ組み込まれている。
広汎な実験により,本手法は速度歪み知覚トレードオフとモデル複雑性の観点から,最先端の手法に対して良好に作用することが示された。
ソースコードと事前訓練されたモデルはhttps://github.com/Jasmine-aiq/SAMIC.comで入手できる。
関連論文リスト
- MambaEye: A Size-Agnostic Visual Encoder with Causal Sequential Processing [14.888533532729864]
MambaEyeは、低複雑さと因果プロセスベースの純粋なMamba2バックボーンを活用する、新しい因果シーケンシャルエンコーダである。
従来のMambaベースの視覚エンコーダとは異なり、我々の厳密な一方向アプローチは、状態空間モデルの本質的な因果性を保存する。
MambaEyeは、幅広い画像解像度、特にImageNet-1K分類タスクの15362$のような高解像度で、堅牢なパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-11-25T06:18:18Z) - Multi-Scale Invertible Neural Network for Wide-Range Variable-Rate Learned Image Compression [90.59962443790593]
本稿では,制限を克服するために,可逆変換に基づく可変レート画像圧縮モデルを提案する。
具体的には、入力画像をマルチスケールの潜在表現にマッピングする、軽量なマルチスケール非可逆ニューラルネットワークを設計する。
実験結果から,提案手法は既存の可変レート法と比較して最先端性能を実現することが示された。
論文 参考訳(メタデータ) (2025-03-27T09:08:39Z) - MambaIC: State Space Models for High-Performance Learned Image Compression [40.155314987485376]
多数のフィールドをまたいだリアルタイム情報伝送には,高性能な画像圧縮アルゴリズムが不可欠である。
状態空間モデル(SSM)の長距離依存性の捕捉効果に着想を得て,SSMを利用して既存手法の計算不効率に対処する。
そこで本稿では,MambaICと呼ばれる洗練されたコンテキストモデリングによる画像圧縮手法を提案する。
論文 参考訳(メタデータ) (2025-03-16T11:32:34Z) - Multi-dimensional Visual Prompt Enhanced Image Restoration via Mamba-Transformer Aggregation [4.227991281224256]
本稿では,計算効率を犠牲にすることなく,MambaとTransformerの相補的な利点を十分に活用することを提案する。
マンバの選択的走査機構は空間モデリングに焦点をあて、長距離空間依存のキャプチャを可能にする。
トランスフォーマーの自己保持機構は、画像の空間次元と二次的な成長の重荷を回避し、チャネルモデリングに焦点をあてる。
論文 参考訳(メタデータ) (2024-12-20T12:36:34Z) - Cross-Scan Mamba with Masked Training for Robust Spectral Imaging [51.557804095896174]
本研究では,空間スペクトルSSMを用いたクロススキャンマンバ(CS-Mamba)を提案する。
実験の結果, CS-Mambaは最先端の性能を達成し, マスク付きトレーニング手法によりスムーズな特徴を再構築し, 視覚的品質を向上させることができた。
論文 参考訳(メタデータ) (2024-08-01T15:14:10Z) - Hierarchical Integration Diffusion Model for Realistic Image Deblurring [71.76410266003917]
拡散モデル (DM) は画像劣化に導入され, 有望な性能を示した。
本稿では,階層型統合拡散モデル(HI-Diff)を提案する。
人工的および実世界のぼかしデータセットの実験は、HI-Diffが最先端の手法より優れていることを示した。
論文 参考訳(メタデータ) (2023-05-22T12:18:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。