論文の概要: MixCompress: Mixture of Experts for Variable Rate Learned Image Compression
- arxiv url: http://arxiv.org/abs/2607.14334v1
- Date: Wed, 15 Jul 2026 19:57:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.901134
- Title: MixCompress: Mixture of Experts for Variable Rate Learned Image Compression
- Title(参考訳): MixCompress: 可変レート学習画像圧縮の専門家の混在
- Abstract要約: MixCompressは、スパース構造特化に基づく統一可変ビットレート(VBR)フレームワークである。
モデルキャパシティを動的にスケールするために,Mixture-of-Depths(MoD)拡張を導入する。
- 参考スコア(独自算出の注目度): 6.773101031620122
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learned image compression (LIC) is bottlenecked by the need to store independent models for each rate-distortion operating point. Existing variable bit-rate (VBR) methods aim to reduce this overhead via dense parameter modulation, but forcing a shared backbone to approximate divergent mappings causes severe feature entanglement. Specifically, low-rate smoothing gradients inherently conflict with the preservation of high-frequency textural details, leading to sub-optimal performance. To resolve this, we propose MixCompress, a unified VBR framework based on sparse structural specialization. While sparsely gated Mixture-of-Experts (MoE) routing successfully mitigates gradient conflict, it operates on a fixed computational budget. To address the increased representational demands of higher bit-rates we introduce a Mixture-of-Depths (MoD) extension to dynamically scale model capacity. Combined with Conditional Auxiliary Transforms (CAT) for dynamic sub-band energy modulation, our hierarchical framework effectively dynamically scales capacity. Extensive evaluations demonstrate that MixCompress not only matches individually optimized single-rate baselines but can even surpass them, establishing a new Pareto frontier for computationally efficient image coding.
- Abstract(参考訳): 学習された画像圧縮(lic)は、各レート歪曲操作点の独立モデルを保存する必要性によってボトルネックとなる。
既存の可変ビットレート(VBR)法は、高密度パラメータ変調によってこのオーバーヘッドを削減することを目的としているが、共有バックボーンを近似した発散写像に強制することは、深刻な特徴の絡み合いを引き起こす。
特に低レートなスムーズな勾配は、本質的に高周波のテクスチャの保存と矛盾し、準最適性能をもたらす。
そこで本稿では,疎構造特化に基づく統一VBRフレームワークであるMixCompressを提案する。
Mixture-of-Experts (MoE)ルーティングは、グラデーションコンフリクトの緩和に成功しているが、固定された計算予算で運用されている。
高ビットレートの表現要求の増加に対処するために,モデルキャパシティを動的にスケールするためにMixture-of-Depths(MoD)拡張を導入する。
動的サブバンドエネルギー変調のための条件補助変換(CAT)と組み合わせることで、階層的枠組みは効率よくキャパシティを動的に拡張する。
大規模な評価では、MixCompressは個別に最適化されたシングルレートのベースラインに適合するだけでなく、それらを上回り、計算効率の良い画像符号化のための新しいParetoフロンティアを確立している。
関連論文リスト
- Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models [6.94102129809152]
大規模言語モデル(LLM)はしばしば静的パラメータのプルーニングや動的トークンレベルの計算によって圧縮される。
本稿では,まず低ランク近似とチャネルプルーニングを適用し,静的に圧縮されたバックボーンを得るミニマリスト複合スパーシリティフレームワークについて検討する。
論文 参考訳(メタデータ) (2026-06-29T01:33:30Z) - MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts [37.49087932678935]
MoECodecはトークン対応の画像圧縮フレームワークで、単一のモデル内で複数のダウンストリームタスクをサポートする。
MoECodecは、Transformerベースの圧縮モデルにおけるFFN層を置き換える。
論文 参考訳(メタデータ) (2026-06-19T01:56:25Z) - Adaptive Targeted Dynamic Chunking for Tokenization-Free Hierarchical Model [1.283285810929198]
トークン化のない階層モデルは、従来の大規模言語モデルに代わる有望な選択肢として浮上しています。
本稿では,新しいバイト圧縮制御機構であるAdaptive Targeted Dynamic Chunking (ATDC)を提案する。
論文 参考訳(メタデータ) (2026-05-28T15:26:34Z) - Joint Degradation-Aware Arbitrary-Scale Super-Resolution for Variable-Rate Extreme Image Compression [28.21479870337623]
ASSR-EICは可変レートの極端な画像圧縮をサポートする新しい画像圧縮フレームワークである。
我々は、再構成を導く前に圧縮と再スケーリングを意識した拡散を利用して、高い忠実性と高いリアリズムの回復をもたらす。
論文 参考訳(メタデータ) (2026-03-18T06:35:53Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - Error-Propagation-Free Learned Video Compression With Dual-Domain Progressive Temporal Alignment [92.57576987521107]
両ドメインのプログレッシブな時間的アライメントと品質条件の混合(QCMoE)を備えた新しい統合変換フレームワークを提案する。
QCMoEは、魅力的なR-Dパフォーマンスで連続的かつ一貫したレート制御を可能にする。
実験結果から,提案手法は最先端技術と比較して,競争力のあるR-D性能を実現することが示された。
論文 参考訳(メタデータ) (2025-12-11T09:14:51Z) - Rethinking Autoregressive Models for Lossless Image Compression via Hierarchical Parallelism and Progressive Adaptation [75.58269386927076]
自己回帰(AR)モデルは、しばしば計算コストの禁止のために非現実的に除外される。
この研究は、階層的並列性とプログレッシブ適応に基づくフレームワークを導入して、このパラダイムを再考する。
各種データセット(自然,衛星,医療)の実験により,本手法が新たな最先端圧縮を実現することを確認した。
論文 参考訳(メタデータ) (2025-11-14T06:27:58Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Efficient Micro-Structured Weight Unification and Pruning for Neural
Network Compression [56.83861738731913]
ディープニューラルネットワーク(DNN)モデルは、特にリソース制限されたデバイスにおいて、実用的なアプリケーションに不可欠である。
既往の非構造的あるいは構造化された重量刈り法は、推論を真に加速することはほとんど不可能である。
ハードウェア互換のマイクロ構造レベルでの一般化された重み統一フレームワークを提案し,高い圧縮と加速度を実現する。
論文 参考訳(メタデータ) (2021-06-15T17:22:59Z) - Spatiotemporal Entropy Model is All You Need for Learned Video
Compression [9.227865598115024]
生のピクセルフレーム(残像ではなく)を圧縮する枠組みを提案する。
エントロピーモデルはピクセルレベルではなく潜在空間における時間的冗長性を推定するために用いられる。
実験の結果,提案手法は最先端(SOTA)性能より優れていた。
論文 参考訳(メタデータ) (2021-04-13T10:38:32Z) - Structured Sparsification with Joint Optimization of Group Convolution
and Channel Shuffle [117.95823660228537]
本稿では,効率的なネットワーク圧縮のための新しい構造空間分割法を提案する。
提案手法は, 畳み込み重みに対する構造的疎度を自動的に誘導する。
また,学習可能なチャネルシャッフル機構によるグループ間通信の問題にも対処する。
論文 参考訳(メタデータ) (2020-02-19T12:03:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。