論文の概要: LLM-based Source Code Compression via Thresholded Symbol Ranking
- arxiv url: http://arxiv.org/abs/2607.24192v2
- Date: Wed, 29 Jul 2026 11:01:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.711757
- Title: LLM-based Source Code Compression via Thresholded Symbol Ranking
- Title(参考訳): Thresholded Symbol RankingによるLLMソースコード圧縮
- Abstract要約: 汎用圧縮機(例: zstd, bzip2)は圧縮比と速度の間に良いトレードオフを提供するが、ソースコードに固有の全ての特別な規則を活用できない。
最近のアプローチでは、ShannonのシンボルレベルのフレームワークでLarge Language Models(LLM)を利用している。
我々は2つの新しいシンボルグレードの変種を配置する$T$バウンド圧縮機を導入し、予測を上位の$T$にバウンドする。
- 参考スコア(独自算出の注目度): 1.133608012542551
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We study the problem of lossless compression of source code, motivated by the storage demands of large-scale software archives, such as Software Heritage (https://www.softwareheritage.org/). General-purpose compressors (e.g., zstd, bzip2) offer a good trade-off between compression ratio and speed, but fail to exploit all special regularities inherent in source code. Recent approaches leverage Large Language Models (LLMs) within Shannon's symbol-ranking framework, relying on a scheme in which the predicted rank can grow arbitrarily. While effective at reducing space, this setting incurs significant throughput degradation, and leaves open the question whether it is necessary to explicitly encode all ranks. In this work, we introduce LLM-based compressors deploying two novel symbol-ranking variants that bound predictions to the top-$T$ ranks ($T=1$ or $63$), with out-of-threshold symbols stored as exceptions and compressed jointly with the rank stream via general-purpose compressors. We conduct the first large-scale evaluation of LLM-based source code compression across 30 LLMs, including general-domain, code-specialized, and quantized models. Our $T$-bounded approach outperforms prior LLM-based compressors both in compression ratio (up to 37% relative improvement) and compression throughput (40% faster). Compared to general-purpose compressors (e.g., zstd, bzip2), we obtain up to 82% relative compression gain but at a lower speed, thus offering a new trade-off point in the compression-speed spectrum. We also show that these gains are stronger on source code than on natural language, suggesting an interesting indication, namely that source code exposes regularities captured by LLMs but missed by general-purpose exact-match-based compressors. We conclude by commenting on open problems that offer theoretical and practical avenues of research.
- Abstract(参考訳): 我々は,ソフトウェア遺産(https://www.softwareheritage.org/)のような大規模ソフトウェアアーカイブのストレージ要求に動機づけられた,ソースコードのロスレス圧縮の問題について検討する。
汎用圧縮機(例: zstd, bzip2)は圧縮比と速度の間に良いトレードオフを提供するが、ソースコードに固有のすべての特別な規則を活用できない。
最近のアプローチでは、予測ランクが任意に成長するスキームに頼って、Shannonのシンボルランクフレームワーク内でLarge Language Models(LLM)を利用する。
空間の削減には有効であるが、この設定は大きなスループット低下を引き起こし、すべてのランクを明示的にエンコードする必要があるかどうかという疑問を解き放つ。
本研究では, LLMをベースとした圧縮機において, 最大T$($T=1$または$63$)に予測をバウンドする2種類の新しいシンボルグレードを配置し, 外部のシンボルを例外として保存し, 汎用圧縮機を介してランクストリームと共同で圧縮する。
汎用ドメイン, コード特殊化, 量子化モデルを含む, 30 個の LLM にまたがる LLM ベースのソースコード圧縮の大規模評価を行う。
我々の$T$-boundedアプローチは、圧縮比(最大37%の改善)と圧縮スループット(40%高速化)の両方で、従来のLCMベースの圧縮機よりも優れています。
汎用圧縮機(eg, zstd, bzip2)と比較して82%の相対圧縮ゲインを得るが、低速で得られるので、圧縮速度スペクトルに新たなトレードオフ点を与える。
また、これらの利点は自然言語よりもソースコードの方が強いことを示し、ソースコードがLLMが取得した正規性を露呈するが、汎用的完全整合圧縮機に欠落していることを示す興味深い兆候を示唆している。
我々は、理論的および実践的な研究方法を提供するオープンな問題についてコメントすることで締めくくります。
関連論文リスト
- End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - OpenZL: Using Graphs to Compress Smaller and Faster [1.9508265730898475]
データ集約型アプリケーションのための新しい圧縮戦略であるOpenZLを提案する。
OpenZLは、圧縮をモジュラーコーデックの有向非巡回グラフとして表現するための新しい理論フレームワークを実装している。
現状の汎用圧縮機と比較して,OpenZLは圧縮率と速度が優れていることを示す。
論文 参考訳(メタデータ) (2026-05-11T03:28:15Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - Cmprsr: Abstractive Token-Level Question-Agnostic Prompt Compressor [36.57824786347272]
LLM-as-a-compressorベンチマークは25のオープンソースモデルとクローズドソースモデルにまたがる。
我々は,テキストグラデーションに基づく圧縮メタプロンプト最適化により,最高のバニラ圧縮器の性能を向上させる。
得られたモデルをCmprsrと呼び、抽出圧縮とバニラ抽象圧縮の両方よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-11-15T16:28:03Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - OpenZL: A Graph-Based Model for Compression [1.9508265730898475]
アプリケーション固有の圧縮機システムは、最高の汎用圧縮機よりも優れている。
これらの課題は,新たな圧縮戦略によって克服可能であることを示す。
OpenZLはデータを自己記述型のワイヤフォーマットに圧縮し、任意の構成はユニバーサルデコーダによって圧縮される。
論文 参考訳(メタデータ) (2025-10-03T17:40:29Z) - CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs [6.936336826531964]
Retrieval-Augmented Generation (RAG)は、検索したコード例をプロンプトに組み込むことで、コーディングタスクを強化する。
既存の即時圧縮技術は自然言語に重点を置いており、コードの適切なソリューションが欠如している。
RAGに組み込む前にコード例を圧縮するフレームワークであるCodePromptZipを提案する。
論文 参考訳(メタデータ) (2025-02-19T23:15:23Z) - Large Language Models for Lossless Image Compression: Next-Pixel Prediction in Language Space is All You Need [53.584140947828004]
前例のないインテリジェンスを持つ言語大モデル(LLM)は、様々なデータモダリティのための汎用ロスレス圧縮機である。
P$2$-LLMは,様々な入念な洞察と方法論を統合した次世代の予測型LLMである。
ベンチマークデータセットの実験では、P$2$-LLMがSOTAの古典的および学習的コーデックに勝ることを示した。
論文 参考訳(メタデータ) (2024-11-19T12:15:40Z) - Compressing LLMs: The Truth is Rarely Pure and Never Simple [90.05366363633568]
Knowledge-Intensive Compressed LLM BenchmarKは、圧縮された大言語モデルの評価プロトコルを再定義することを目的としている。
LLM-KICKは、現在のSoTA圧縮方式の多くの有利な利点と不運な点を明らかにしている。
LLM-KICKは、言語理解、推論、生成、テキスト内検索、テキスト内要約などのための圧縮LLMの能力に一様にアクセスできるように設計されている。
論文 参考訳(メタデータ) (2023-10-02T17:42:37Z) - Unrolled Compressed Blind-Deconvolution [77.88847247301682]
sparse multi channel blind deconvolution (S-MBD) はレーダー/ソナー/超音波イメージングなどの多くの工学的応用で頻繁に発生する。
そこで本研究では,受信した全信号に対して,はるかに少ない測定値からブラインドリカバリを可能にする圧縮手法を提案する。
論文 参考訳(メタデータ) (2022-09-28T15:16:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。