論文の概要: Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression
- arxiv url: http://arxiv.org/abs/2608.11249v1
- Date: Tue, 04 Aug 2026 08:19:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.305902
- Title: Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression
- Title(参考訳): 圧縮の困難:無害圧縮のための拡散型LMの活用
- Abstract要約: 本稿では,デジタルテキストデータの収集・保存の急激な増加を背景として,ロスレステキスト圧縮の問題点を考察する。
自己回帰型LLM手法の代替的推論パラダイムとして拡散言語モデル(DLM)を導入する。
- 参考スコア(独自算出の注目度): 1.133608012542551
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study the problem of lossless text compression, motivated by the rapid growth in the collection and storage of digital textual data - including plain text, source code, and structured formats such as XML - and by recent advances in neural language model-based compression. In particular, recent LLM-based approaches, whether built on symbol-ranking pipelines or paired with a statistical compressor, have demonstrated compression ratios significantly superior to general-purpose compressors such as zstd, gzip, or bzip on text and code. However, these neural approaches suffer from severe throughput limitations, making them not yet practically usable. For the first time in the context of lossless neural text compression, we introduce Diffusion Language Models (DLMs) as an alternative inference paradigm to autoregressive LLM-based approaches. We argue that replacing autoregressive LLMs with DLMs within the same compression framework could overcome the throughput bottleneck caused by their one-symbol-per-step limitation. However, achieving these improvements requires addressing algorithmic challenges introduced by applying DLMs to lossless compression, where the architecture allows the number and positions of symbols encoded at each forward pass to be decided independently. We design efficient and effective strategies to solve these challenges and evaluate them experimentally against LLM-based and general-purpose compressors on enwik8, a well-established textual benchmark. Our results show that the newly proposed DLM-based framework advances the state of the art in lossless text compression. Moreover, as DLMs are still a relatively young paradigm, recent advances toward increasingly capable and efficient models suggest substantial room for further improvements.
- Abstract(参考訳): 本研究では,デジタルテキストデータの収集・保存が急速に増加し,平文やソースコード,XMLなどの構造化形式など,損失のないテキスト圧縮の問題や,近年のニューラル言語モデルに基づく圧縮の進歩を背景として,ロスレステキスト圧縮の課題について考察する。
特に、最近のLCMベースのアプローチでは、シンボルグレードのパイプライン上に構築するか、あるいは統計的圧縮機と組み合わせて構築するかは、テキストやコード上でのzstd、gzip、bzipといった汎用圧縮機よりもはるかに優れた圧縮比を示す。
しかし、これらのニューラルネットワークアプローチはスループットの厳しい制限に悩まされており、現実的にはまだ使用できない。
損失のないニューラルテキスト圧縮の文脈で初めて、自動回帰LPMベースのアプローチに代わる推論パラダイムとして拡散言語モデル(DLM)を導入する。
自動回帰LDMを同じ圧縮フレームワーク内でDLMに置き換えることによって、1段当たりの1シンボル制限によるスループットのボトルネックを克服できると主張している。
しかし、これらの改善を達成するには、DLMをロスレス圧縮に適用することでもたらされるアルゴリズム上の課題に対処する必要がある。
我々はこれらの課題を解決するための効率的かつ効果的な戦略を設計し、十分に確立されたテキストベンチマークである enwik8 上の LLM ベースの汎用圧縮機に対して実験的に評価する。
その結果,新たに提案されたDLMベースのフレームワークは,ロスレステキスト圧縮の最先端化を実現していることがわかった。
さらに、DLMはまだ比較的若いパラダイムであるため、より有能で効率的なモデルへの最近の進歩は、さらなる改善の余地を示唆している。
関連論文リスト
- Efficient Learned Image Compression without Entropy Coding [62.01837001379442]
エントロピー符号化自由学習画像圧縮(EF-LIC)を提案する。
EF-LICは、符号化レイテンシの低い統計的および相関的冗長性を排除し、コンパクトな表現を生成するマルチレートフレームワークである。
実験の結果、EF-LIC はコダックの MS-ILLM を LPIPS で67.86% 削減できることがわかった。
論文 参考訳(メタデータ) (2026-05-22T07:37:30Z) - D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation [78.32916244416033]
Supervised Fine-Tuning (SFT) はタスク固有の大規模言語モデル (LLM) の開発を加速するが、細調整モデルの増加によってメモリオーバーヘッドが大幅に増大する。
本稿ではDQRELO(Delta Compression via Quantization and Residual Low-Rank)を提案する。
粗い1ビットの量子化を組み合わせ、デルタの支配的な構造を捉える。
論文 参考訳(メタデータ) (2026-04-18T09:52:18Z) - Seq2Seq2Seq: Lossless Data Compression via Discrete Latent Transformers and Reinforcement Learning [3.2641459166493405]
本稿では,T5言語モデルアーキテクチャに適用した強化学習に基づく新しい圧縮手法を提案する。
このアプローチは、従来のベクトル表現ではなく、トークンのシーケンスへのデータの圧縮を可能にする。
言語モデル内の潜伏情報を活用することで、明示的なコンテンツ理解を必要とせず、効果的にデータを圧縮する。
論文 参考訳(メタデータ) (2026-02-12T16:30:55Z) - Rethinking Autoregressive Models for Lossless Image Compression via Hierarchical Parallelism and Progressive Adaptation [75.58269386927076]
自己回帰(AR)モデルは、しばしば計算コストの禁止のために非現実的に除外される。
この研究は、階層的並列性とプログレッシブ適応に基づくフレームワークを導入して、このパラダイムを再考する。
各種データセット(自然,衛星,医療)の実験により,本手法が新たな最先端圧縮を実現することを確認した。
論文 参考訳(メタデータ) (2025-11-14T06:27:58Z) - Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction [9.302754209202607]
大規模言語モデル(LLM)は、ドメインにまたがってデプロイされ、利用され続けている。
LLM生成データの圧縮は、従来の人間や機械生成のコンテンツと比較して、独特な課題を示す。
また,LLMに基づく予測手法は,Gzipで達成した3倍の圧縮速度をはるかに上回る20倍の圧縮速度を達成することを示す。
論文 参考訳(メタデータ) (2025-05-07T17:42:35Z) - Large Language Model for Lossless Image Compression with Visual Prompts [26.132381529841815]
本稿では,大規模言語モデルに視覚的プロンプトを組み込んだ,ロスレス画像圧縮のための新しいパラダイムを提案する。
複数のベンチマークデータセットの実験により,本手法が最先端の圧縮性能を実現することを示す。
我々のアプローチは、医用画像やスクリーンコンテンツ画像など他の領域の画像にも容易に拡張でき、優れたパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-02-22T09:36:03Z) - Large Language Models for Lossless Image Compression: Next-Pixel Prediction in Language Space is All You Need [53.584140947828004]
前例のないインテリジェンスを持つ言語大モデル(LLM)は、様々なデータモダリティのための汎用ロスレス圧縮機である。
P$2$-LLMは,様々な入念な洞察と方法論を統合した次世代の予測型LLMである。
ベンチマークデータセットの実験では、P$2$-LLMがSOTAの古典的および学習的コーデックに勝ることを示した。
論文 参考訳(メタデータ) (2024-11-19T12:15:40Z) - Language Models as Zero-shot Lossless Gradient Compressors: Towards General Neural Parameter Prior Models [56.00251589760559]
大型言語モデル(LLM)はゼロショット設定でグラデーション先行として振る舞うことができる。
本稿では,LSMと算術符号を統合する新しい手法であるLM-GCを紹介する。
実験により、LM-GCは既存の最先端のロスレス圧縮手法を超越していることが示された。
論文 参考訳(メタデータ) (2024-09-26T13:38:33Z) - Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models [21.025001473355996]
大規模言語モデル(LLM)の即時圧縮問題について定式化する。
ブラックボックスモデルのハードプロンプトを生成するトークンレベルのプロンプト圧縮手法を統合するためのフレームワークを提案する。
本稿では,現在の高速圧縮法の性能と最適戦略との間に大きなギャップがあることを述べる。
論文 参考訳(メタデータ) (2024-07-22T09:40:13Z) - LLMLingua: Compressing Prompts for Accelerated Inference of Large
Language Models [22.06402870816756]
大きな言語モデル(LLM)は、その驚くべき能力のために様々なアプリケーションに適用されている。
本稿では,意味的整合性を維持するための予算制御を伴う粗大なプロンプト圧縮手法であるLLMLinguaを提案する。
提案手法により,最先端性能が得られ,最大20倍圧縮が可能であり,性能損失が少ないことを示す。
論文 参考訳(メタデータ) (2023-10-09T14:10:21Z) - Compressing LLMs: The Truth is Rarely Pure and Never Simple [90.05366363633568]
Knowledge-Intensive Compressed LLM BenchmarKは、圧縮された大言語モデルの評価プロトコルを再定義することを目的としている。
LLM-KICKは、現在のSoTA圧縮方式の多くの有利な利点と不運な点を明らかにしている。
LLM-KICKは、言語理解、推論、生成、テキスト内検索、テキスト内要約などのための圧縮LLMの能力に一様にアクセスできるように設計されている。
論文 参考訳(メタデータ) (2023-10-02T17:42:37Z) - Deep Lossy Plus Residual Coding for Lossless and Near-lossless Image
Compression [85.93207826513192]
本稿では、損失のない画像圧縮とほぼロスレス画像圧縮の両面において、統合された強力な深い損失+残差(DLPR)符号化フレームワークを提案する。
VAEのアプローチにおける連立損失と残留圧縮の問題を解く。
ほぼロスレスモードでは、元の残差を量子化し、与えられた$ell_infty$エラー境界を満たす。
論文 参考訳(メタデータ) (2022-09-11T12:11:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。