論文の概要: BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression
- arxiv url: http://arxiv.org/abs/2607.08643v1
- Date: Thu, 09 Jul 2026 16:17:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.591388
- Title: BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression
- Title(参考訳): BiSCo-LLM:極低ビット大言語モデル圧縮のためのルックアップフリーバイナリ球面符号化
- Abstract要約: BiSCo-LLMは、超低ビットLLM重み圧縮のためのコードブックフリーのバイナリ球面符号化フレームワークである。
報告されたストレージ予算にはバイナリコード、ニューラルデコーダ、プロテクトチャネルペイロード、LoRAアダプタ、メタデータが含まれる。
- 参考スコア(独自算出の注目度): 30.978394138413623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly constrained by memory capacity, weight bandwidth, and checkpoint storage during deployment. Existing low-bit compression methods mainly follow two directions. Scalar or group-wise quantization is simple and compatible with efficient low-precision kernels, but its representation capacity becomes limited when the target budget approaches 2 bits per weight. Vector-quantized weight compression provides a richer block-level representation, but usually introduces explicit codebooks, index lookup, and additional storage accounting. This paper presents BiSCo-LLM, a codebook-free binary spherical coding framework for extreme low-bit LLM weight compression. The core pipeline is built on three components. First, local weight chunks are mapped onto a unit hypersphere and binarized into compact spherical codes, so that the main payload is a bit-packed sign stream rather than explicit VQ centroids. Second, a residual BSQ stage encodes the reconstruction error left by the base spherical codec, providing an explicit rate-distortion path without stored codebooks. Third, category-wise recovery distillation is performed after replacing each Transformer module category, reducing the mismatch between local weight reconstruction and assembled model behavior. A small 8-bit protected-channel path is used as an auxiliary stabilization mechanism for sensitive channels and is counted separately from the BSQ payload. The reported storage budget includes binary codes, neural decoders, protected-channel payloads, LoRA adapters, and metadata.
- Abstract(参考訳): 大規模言語モデル(LLM)は、展開中のメモリ容量、重み付け帯域幅、チェックポイントストレージによってますます制限されている。
既存の低ビット圧縮法は主に2方向に従う。
スケーラビリティやグループワイドの量子化は単純で効率的な低精度カーネルと互換性があるが、目標予算が1重あたり2ビットに近づくと、その表現能力は制限される。
ベクトル量子化重み圧縮はよりリッチなブロックレベルの表現を提供するが、通常は明示的なコードブック、インデックス検索、追加のストレージ会計を導入している。
本稿では,超低ビットLLM重み圧縮のためのコードブックフリーバイナリ球面符号化フレームワークBiSCo-LLMを提案する。
コアパイプラインは3つのコンポーネントで構成されている。
まず、局所重みチャンクを単位超球面にマッピングし、コンパクトな球面符号にバイナライズすることにより、主ペイロードは明示的なVQセントロイドではなくビットパックされた符号ストリームとなる。
第二に、残余のBSQステージは、ベース球面コーデックが残した再構成誤差を符号化し、記憶されたコードブックのない明示的なレート歪み経路を提供する。
第3に, 各トランスフォーマーモジュールのカテゴリを置き換えた後に, 局所重量復元と組立モデル挙動のミスマッチを低減し, カテゴリワイド回収蒸留を行う。
小型の8ビット保護チャネルパスは、機密チャネルの補助安定化機構として使用され、BSQペイロードとは別個にカウントされる。
報告されたストレージ予算にはバイナリコード、ニューラルデコーダ、プロテクトチャネルペイロード、LoRAアダプタ、メタデータが含まれる。
関連論文リスト
- SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference [16.38817531610931]
本稿では,KV割り当てを高速復号化のためのレート歪み問題として扱う長文推論手法であるSpherical KVを提案する。
この手法は, (i)デコードホットループにおいて, 方向性情報を安価に表現し, (ii) 予測された将来の有用性に応じて, 保持と精度を割り当てる2つのアイデアに基づいて構築される。
論文 参考訳(メタデータ) (2026-05-13T18:48:48Z) - Towards Practical Lossless Neural Compression for LiDAR Point Clouds [84.36825469211375]
高精度な幾何学的詳細の極端に広い範囲は、効率的な文脈モデリングを妨げる。
私たちのフレームワークは2つの軽量モジュールで構成されています。
実験では、リアルタイムに競争力のある圧縮性能を示す。
論文 参考訳(メタデータ) (2026-03-26T10:02:07Z) - ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression [19.538318240352424]
ロスレスモデル圧縮は、ビットエクササイズ大言語モデル(LLM)サービスにおけるメモリと帯域幅のボトルネックを軽減するために、非常に有望である。
既存のアプローチは、GPUアーキテクチャと基本的な設計ミスマッチのため、かなり推論が遅くなることが多い。
我々は、効率的なLLM推論のために共同設計されたロスレス圧縮フレームワークZipServを提案する。
論文 参考訳(メタデータ) (2026-03-18T07:21:21Z) - CARVQ: Corrective Adaptor with Group Residual Vector Quantization for LLM Embedding Compression [0.4104352271917982]
大規模言語モデル(LLM)はトークンの埋め込みに多数のパラメータを依存しているため、かなりのストレージ要件とメモリフットプリントに繋がる。
本稿では, グループ残差ベクトル量子化を併用したポストトレーニング小説Corrective AdaptorであるCARVQを紹介する。
CarVQは、低ビットストレージをサポートするための特別なハードウェアを必要とせず、約1.6ビットまで圧縮するためにオリジナルのモデルを模倣している。
論文 参考訳(メタデータ) (2025-10-14T17:00:13Z) - Re-Densification Meets Cross-Scale Propagation: Real-Time Neural Compression of LiDAR Point Clouds [83.39320394656855]
LiDARポイントクラウドは、様々なアプリケーションに基本的だが、高精度スキャンは、かなりのストレージと送信オーバーヘッドを発生させる。
既存の手法では、非順序の点を階層的なオクツリーやボクセル構造に変換して、密度から疎い予測符号化を行うのが一般的である。
筆者らのフレームワークは2つの軽量モジュールから構成されている。まず、Geometry Re-Densification Moduleがエンコードされたスパース幾何を再認識し、より密なスケールで特徴を抽出し、予測符号化のための特徴を再分離する。
論文 参考訳(メタデータ) (2025-08-28T06:36:10Z) - BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook [20.89001326838199]
本稿では,新しいサブ1ビット大規模言語モデル(LLM)の量子化フレームワークであるBTC-LLMを提案する。
提案手法は,(1)非可逆スケーリングと回転を最適化し,二項化重みを完全精度分布に整合させる学習可能な変換,(2)繰り返し発生するバイナリベクトルクラスタを識別するFlashおよび精度の高いバイナリコードブックである。
論文 参考訳(メタデータ) (2025-05-24T03:57:19Z) - BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments [53.71158537264695]
大規模言語モデル(LLM)は、多くのアプリケーションに革命をもたらしたが、ローカルデバイスにおけるメモリ制限により、その展開は依然として困難である。
textbfBitStackは,メモリ使用量とモデル性能のトレードオフを可能にする,新しいトレーニング不要な重み圧縮手法である。
論文 参考訳(メタデータ) (2024-10-31T13:26:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。