論文の概要: Lossless Tensor Compression as Program Synthesis
- arxiv url: http://arxiv.org/abs/2608.02162v1
- Date: Mon, 03 Aug 2026 12:42:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.567449
- Title: Lossless Tensor Compression as Program Synthesis
- Title(参考訳): プログラム合成としてのロスレステンソル圧縮
- Authors: Jieke Shi, Junda He, Wenjia Jiang, Weifeng Sun, Shidong Pan, Zhensu Sun, Chengran Yang, Peixin Zhang, Yifan Jia, Zhou Yang, Thong Hoang, Xiwei Xu, Zhenchang Xing, David Lo,
- Abstract要約: 汎用圧縮機はストレージ要件を削減できるが、テンソル構造は無視できる。
本稿では、プログラム合成としてロスレステンソル圧縮を定式化するブレビスについて述べる。
Brevisは3.60GB/s圧縮と6.61GB/s圧縮を実現し、すべてのソースバイトを保存する。
- 参考スコア(独自算出の注目度): 24.01685754372427
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model checkpoints are growing in both number and size, which makes archival, transfer, and deployment increasingly costly. General-purpose compressors can reduce storage requirements but ignore tensor structure, whereas existing tensor-specific compressors rely on fixed and format-specific pipelines. We present Brevis, which formulates lossless tensor compression as program synthesis. We design a typed domain-specific language (DSL) that captures recurring tensor structures, such as repeated regions and floating-point fields, through a set of reversible operators. Given a tensor, Brevis synthesizes a self-contained DSL program that reconstructs it bit-exactly. A checkpoint-specific production prior, learned from a small representative sample of tensors, guides a bounded A* search to synthesize compact programs, which can later be executed directly for bit-exact decompression. On 10 public checkpoints spanning language, audio, and image generation models, Brevis reduces 2.13 TB of checkpoint data to 1.41 TB, a 33.93% storage reduction. It produces archives up to 30.87% smaller than those of four general-purpose compressors, including zstd and gzip, and smaller archives than the tensor-specific compressors ZipNN and DFloat11. Under a practical concurrency configuration, Brevis achieves 3.60 GB/s compression and 6.61 GB/s decompression while preserving every source byte.
- Abstract(参考訳): モデルチェックポイントは数とサイズの両方で増加しており、アーカイブ、転送、デプロイメントはますますコストがかかる。
汎用圧縮機はストレージ要件を削減できるが、テンソル構造は無視できるが、既存のテンソル固有の圧縮機は固定およびフォーマット固有のパイプラインに依存している。
本稿では、プログラム合成としてロスレステンソル圧縮を定式化するブレビスについて述べる。
本稿では,繰り返し領域や浮動小数点フィールドなどのテンソル構造を可逆演算子によってキャプチャする型付きドメイン固有言語(DSL)を設計する。
テンソルを与えられたブレヴィスは、それを少し正確に再構築する自己完結型DSLプログラムを合成する。
テンソルの小さな代表サンプルから学習したチェックポイント特異的生産は、境界付きA*探索を誘導してコンパクトプログラムを合成し、後にビットエクサクソン圧縮のために直接実行できる。
言語、オーディオ、画像生成モデルにまたがる10の公開チェックポイントにおいて、ブレビスは2.13TBのチェックポイントデータを1.41TBに削減し、33.93%のストレージを削減した。
zstdやgzipを含む4つの汎用圧縮機よりも最大30.87%小さく、テンソル固有の圧縮機ZipNNやDFloat11よりも小さいアーカイブを生成する。
実用的な並行処理構成では、Brevisはソースバイトを保存しながら3.60GB/sの圧縮と6.61GB/sの圧縮を実現している。
関連論文リスト
- End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - A Practical Tensor-Network Compression Pipeline for Production-Scale Large Language Models [0.0]
Minimaは、Transformerの構造的圧縮の場所と方法を学ぶ、プロダクション圧縮パイプラインである。
Minimaは8k-tokenコンテキストウィンドウでQwen3-32B上で実行し、ピークVRAMを64 GiBから40 GiBに削減する。
単一のアクティブリクエストでは、スループットは毎秒40トークン(ベースライン)から毎秒50トークン(ミニマ)、毎秒75トークン(推測復号化のミニマ)に向上する。
論文 参考訳(メタデータ) (2026-02-02T04:03:39Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - Lossless Compression for LLM Tensor Incremental Snapshots [0.0]
私たちはLanguage Model(LMC)と呼ばれる効果的な圧縮ソリューションを構築します。
LMCの16コア並列実装は、それぞれ2.78 GiB/sと3.76 GiB/sの圧縮および減圧スループットを実現することができる。
このパフォーマンスの向上は、最終的に必要なリソースを削減し、次のエポック前にデータをストレージシステムにコピーする時間を増やすことで、より高い周波数のチェックポイントを可能にします。
論文 参考訳(メタデータ) (2025-05-14T21:24:14Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Fast Feedforward 3D Gaussian Splatting Compression [55.149325473447384]
3D Gaussian Splatting (FCGS) は、1つのフィードフォワードパスで3DGS表現を高速に圧縮できる最適化フリーモデルである。
FCGSは圧縮比を20倍以上に向上し、高精細度を維持しながら、ほとんどのシーン毎のSOTA最適化手法を上回ります。
論文 参考訳(メタデータ) (2024-10-10T15:13:08Z) - What Operations can be Performed Directly on Compressed Arrays, and with What Error? [1.3307486544794784]
我々は、圧縮されたデータに直接、数十のかなり基本的な操作を可能にする、損失のある圧縮機を開発した。
3つの非自明なアプリケーション上で評価し、内部表現のために異なる数系を選択する。
論文 参考訳(メタデータ) (2024-06-17T05:01:09Z) - TensorCodec: Compact Lossy Compression of Tensors without Strong Data
Assumptions [22.937900567884796]
TENSORCODECは、必ずしも強い入力データ仮定に従わない一般的なテンソルに対する損失圧縮アルゴリズムである。
8つの実世界のデータセットの解析と実験は、TENSORCODECが(a)簡潔であることを示す。
圧縮速度は7.38倍で、同様のリコンストラクションエラーの最大のライバルである。
論文 参考訳(メタデータ) (2023-09-19T04:48:01Z) - Towards Compact CNNs via Collaborative Compression [166.86915086497433]
チャネルプルーニングとテンソル分解を結合してCNNモデルを圧縮する協調圧縮方式を提案する。
52.9%のFLOPを削減し、ResNet-50で48.4%のパラメータを削除しました。
論文 参考訳(メタデータ) (2021-05-24T12:07:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。