論文の概要: Efficient Learned Data Compression via Dual-Stream Feature Decoupling
- arxiv url: http://arxiv.org/abs/2604.07239v1
- Date: Wed, 08 Apr 2026 16:05:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.623885
- Title: Efficient Learned Data Compression via Dual-Stream Feature Decoupling
- Title(参考訳): デュアルストリーム特徴分離による効率的な学習データ圧縮
- Authors: Huidong Ma, Xinyan Shi, Hui Sun, Xiaofei Yue, Xiaoguang Liu, Gang Wang, Wentong Cai,
- Abstract要約: 本稿では,深層並列処理を浅層並列ストリームに置き換えるために,ローカルおよびグローバルコンテキストをアンハングするDual-Stream Multi-Scale Decouplerを提案する。
本手法は,低レイテンシとメモリ使用量を維持しながら,圧縮比とスループットの両面で最先端性能を実現する。
- 参考スコア(独自算出の注目度): 11.752785837648199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Learned Data Compression (LDC) has achieved superior compression ratios, balancing precise probability modeling with system efficiency remains challenging. Crucially, uniform single-stream architectures struggle to simultaneously capture micro-syntactic and macro-semantic features, necessitating deep serial stacking that exacerbates latency. Compounding this, heterogeneous systems are constrained by device speed mismatches, where throughput is capped by Amdahl's Law due to serial processing. To this end, we propose a Dual-Stream Multi-Scale Decoupler that disentangles local and global contexts to replace deep serial processing with shallow parallel streams, and incorporate a Hierarchical Gated Refiner for adaptive feature refinement and precise probability modeling. Furthermore, we design a Concurrent Stream-Parallel Pipeline, which overcomes systemic bottlenecks to achieve full-pipeline parallelism. Extensive experiments demonstrate that our method achieves state-of-the-art performance in both compression ratio and throughput, while maintaining the lowest latency and memory usage. The code is available at https://github.com/huidong-ma/FADE.
- Abstract(参考訳): Learned Data Compression (LDC) は圧縮比が優れているが、正確な確率モデリングとシステム効率のバランスをとることは依然として困難である。
重要なことに、単一ストリームアーキテクチャは、マイクロシンタクティックとマクロセマンティックの機能を同時にキャプチャするのに苦労し、遅延を悪化させるディープシリアルスタックを必要とする。
これを組み合わせることで、異種系はデバイス速度ミスマッチによって制約され、そこではスループットはシリアル処理によってアムダールの法則によって制限される。
そこで本研究では,局所的およびグローバルなコンテキストをアンハングして,深層並列処理を浅層並列ストリームに置き換えるDual-Stream Multi-Scale Decouplerを提案する。
さらに,並列並列化を実現するために,システムボトルネックを克服するコンカレントストリーム並列パイプラインを設計する。
提案手法は,低レイテンシとメモリ使用量を維持しながら,圧縮率とスループットの両面で最先端性能を実現することを実証した。
コードはhttps://github.com/huidong-ma/FADE.comで公開されている。
関連論文リスト
- Towards Practical Lossless Neural Compression for LiDAR Point Clouds [84.36825469211375]
高精度な幾何学的詳細の極端に広い範囲は、効率的な文脈モデリングを妨げる。
私たちのフレームワークは2つの軽量モジュールで構成されています。
実験では、リアルタイムに競争力のある圧縮性能を示す。
論文 参考訳(メタデータ) (2026-03-26T10:02:07Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling [10.012655130147413]
拡散モデルは高忠実度画像、ビデオ、オーディオ生成において顕著な進歩を遂げた。
本フレームワークは,SDXLとSD3でそれぞれ2.31times$と2.07times$のレイテンシ低減を実現している。
提案手法は,高分解能合成条件下での既存の高速化手法よりも優れている。
論文 参考訳(メタデータ) (2026-02-25T10:23:07Z) - AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism [54.8494905524997]
両方の並列処理軸をまたいだ非同期更新を導入し、コロケーション要求を緩和します。
スパース平均化と非同期更新の両方に対して収束保証を提供します。
大規模言語モデルを用いた実験により,本手法が完全同期ベースラインの性能と一致することを示した。
論文 参考訳(メタデータ) (2026-01-30T01:24:47Z) - DeepCoT: Deep Continual Transformers for Real-Time Inference on Data Streams [63.27233749591346]
トランスフォーマーベースのモデルは、ますます複雑なタスクに取り組むために、そのサイズとパラメータ数を劇的に増加させてきた。
ストリームデータ推論は通常、スライディング時間ウィンドウ上で実行され、非常に冗長な計算に繋がる。
提案するDeep Continual Transformer(DeepCoT)は冗長性のないエンコーダのみのモデルであり,最小限の変更で既存のディープエンコーダアーキテクチャに適用できる。
論文 参考訳(メタデータ) (2025-11-21T16:15:43Z) - PT$^2$-LLM: Post-Training Ternarization for Large Language Models [52.4629647715623]
大きな言語モデル(LLM)は、様々なタスクにまたがる印象的な機能を示しているが、その大きなメモリと計算能力は、デプロイメントを妨げている。
PT$2$-LLMを提案する。
その中核は2段精製パイプラインを備えた非対称3次量子化器である。
論文 参考訳(メタデータ) (2025-09-27T03:01:48Z) - ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs [34.477777651648914]
大規模言語モデル(LLM)は、自動回帰デコードパラダイムのため、推論遅延の大きな問題を生じさせる。
本稿では、並列化可能なデータの自動構築と効率的な並列化機構の2つの課題に対処する適応シリアル-パラレルデコーディング(ASPD)を提案する。
我々のフレームワークは、効率的なLCM並列推論のための基盤となるベンチマークを設定し、AIによるカスタマーサービスボットや回答検索エンジンのようなレイテンシに敏感なアプリケーションへのデプロイの道を開く。
論文 参考訳(メタデータ) (2025-08-12T12:35:55Z) - Accelerating Parallel Diffusion Model Serving with Residual Compression [11.093231994205986]
拡散モデルは現実的な画像やビデオを生成するが、かなりの計算資源を必要とする。
パラレル推論は、デバイス間で大きなアクティベーションを交換する際の通信オーバーヘッドを大幅に引き起こす。
生成品質を維持しながら通信を著しく削減する圧縮フレームワークであるCompactFusionを提案する。
論文 参考訳(メタデータ) (2025-07-23T13:49:25Z) - Nesterov Method for Asynchronous Pipeline Parallel Optimization [59.79227116582264]
パイプライン並列処理における非同期最適化のために,Nesterov Accelerated Gradient (NAG) の変種を導入する。
具体的には、NAGのルックアヘッドステップを変更して、勾配の安定性を効果的に解決する。
我々は、勾配の固定遅延の存在下で、我々のアプローチがサブ線形速度で収束することを理論的に証明する。
論文 参考訳(メタデータ) (2025-05-02T08:23:29Z) - The Streaming Batch Model for Efficient and Fault-Tolerant Heterogeneous Execution [28.768566833298365]
異種バッチ推論パイプラインのスループットを2.5~12$times$で向上するストリーミングバッチシステムであるRay Dataを紹介します。
Ray Dataは、シングルノードMLデータローダと比較して、安定拡散のようなマルチモーダルモデルのトレーニングスループットを31%改善する。
論文 参考訳(メタデータ) (2025-01-16T19:54:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。