論文の概要: Breaking the 1.58-bit Barrier for Ternary LLMs
- arxiv url: http://arxiv.org/abs/2609.16338v1
- Date: Mon, 14 Sep 2026 20:54:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.239935
- Title: Breaking the 1.58-bit Barrier for Ternary LLMs
- Title(参考訳): 第3次LLM用1.58ビットバリアの破壊
- Abstract要約: 第三大言語モデル(LLM)は、全ての重みを3つのシンボルのうちの1つとして保存する。
BITCOSは、密度の高いビットマップとコンパクトな符号ベクトルからなる単純な分布適応レイアウトである。
BITCOSは、29の試験モデルのうち26の5トリットパッケージよりも重量をコンパクトに保存し、1ビット当たり1485ドルに達する。
- 参考スコア(独自算出の注目度): 42.09057806159106
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ternary Large Language Models (LLM) store every weight as one of three symbols $\{-1,0,+1\}$, so the cost of a ternary model is conventionally referenced to the information-theoretic $\log_2 3 \approx 1.585$ bits per weight. The prevailing deployment format packs five ternary weights into one byte (five-trit packing), and due to the power-of-two group sizes used in practice this rounds up to $1.625$ bits per weight. This effective storage bit-width treats the three symbols $\{-1,0,+1\}$ as equiprobable. We measure the actual symbol distribution of 29 ternary LLM models and find that zeros account for up to $51.5\%$ of all weights. Motivated by this finding, we introduce BITCOS, a simple distribution-adaptive layout comprised of a dense presence bitmap plus a compacted sign vector, and costs $2 - z$ bits per weight element given a zero density $z$ in the model's weights. BITCOS stores weights more compactly than the five-trit packing in 26 of the 29 tested models, and reaches $1.485$ bits per weight on the sparsest of them. BITCOS is amenable to efficient unpacking on modern processors and GPUs, and we present optimized unpacking sequences for AVX-512, AVX2 and Intel Xe2 GPUs. Measured against production state-of-the-art ternary matrix-vector multiplication kernels, at the zero densities real-world ternary models exhibit, the realized gain with our proposed layout is up to $1.28\times$. Finally, we illustrate end-to-end LLM inference results on 5 different platforms (client and server CPUs, integrated and discrete Xe2 GPUs) where decode throughput improves by up to $1.18\times$ on CPUs and $1.27\times$ on GPUs.
- Abstract(参考訳): 第三大言語モデル(LLM)は、全ての重みを3つのシンボルの1つとして保存するので、三次モデルのコストは、伝統的に情報理論の$\log_2 3 \approx 1.585$ bits per weightに参照される。
一般的な展開形式は5つの3次重みを1バイト(5つのトリットパック)にまとめるが、実際には2つのグループサイズでこのラウンドは1ビット当たり最大1625ドルである。
この効率的なストレージビット幅は、3つのシンボル$\{-1,0,+1\}$を等確率として扱う。
3次LLMモデルの実際のシンボル分布を測定し、ゼロが全重みの最大51.5\%以上を占めることを発見した。
この発見に触発されたBITCOSは、密度の高いビットマップとコンパクトな符号ベクトルからなる単純な分布適応レイアウトであり、モデルの重みにゼロ密度$z$が与えられた場合、重量要素あたり2-z$ビットのコストがかかる。
BITCOSは重量を29の試験モデルのうち26の5トリットパッケージよりもコンパクトに保存し、1ビット当たり1485ドルに達する。
AVX-512, AVX2, Intel Xe2 GPU向けに最適化されたアンパックシーケンスを提案する。
実世界の実世界3次モデルが示すゼロ密度での3次行列ベクトル乗算カーネルの生産状況に対して,提案したレイアウトによる実利得は最大で1.28\times$である。
最後に,5つのプラットフォーム(クライアントCPU,サーバCPU,統合GPU,離散GPU)上でのLLMのエンドツーエンド推論結果について説明する。
関連論文リスト
- Reducing Data Movement in the Galerkin Product of Block Algebraic Multigrid on GPUs [0.0]
3Dの弾力性のために、ファインオペレーターは3倍の3倍の3倍の3倍の3倍の3倍の3倍の6倍の6倍の6倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の3倍の幅を持つ。
共有メモリ型カーネルを検索不要なソートスケジュールで提供し、ポータブルなKokkosチームカーネルの半数以下でバイト数を減らした。
論文 参考訳(メタデータ) (2026-07-30T23:17:29Z) - SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity [86.71343842875878]
NVIDIAの2:4 Sparse Coresは2倍のスループットを提供するが、厳しい50%のプルーニングを要求する。
Milder $(2N-2):2N$パターンは正確さを維持しながらハードウェアサポートを受けない。
Sparse Coreアクセラレーションをアンロックする最初のシステムであるSlideSparseを紹介する。
論文 参考訳(メタデータ) (2026-03-05T14:49:16Z) - Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs [11.45717904490388]
トランスフォーマーベースの基盤モデルの最近の進歩は、多くのタスクのデフォルト選択となった。
その急速に成長するサイズは、単一のGPUに完全なモデルを適合させることがますます難しくなり、計算コストが禁じられる。
ブロック低ランク(BLR)圧縮技術は、重み行列のコンパクト表現を学習することでこの問題に対処する。
論文 参考訳(メタデータ) (2025-12-24T00:41:13Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Scalable MatMul-free Language Modeling [9.048532540945086]
MatMul操作は、大きな言語モデルから除外できる。
最大2.7BパラメータのモデルでテストされるMatMulフリーモデルは、最先端のトレーニング済みトランスフォーマーに匹敵する。
論文 参考訳(メタデータ) (2024-06-04T17:50:34Z) - DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention [82.24166963631949]
Diffusion Gated Linear Attention Transformers (DiG) は、最小限のパラメータオーバーヘッドを持つ単純で適用可能なソリューションである。
より優れた効率性と競争効率を示す、平易なU字型アーキテクチャの2つのバリエーションを提供する。
論文 参考訳(メタデータ) (2024-05-28T17:59:33Z) - ReALLM: A general framework for LLM compression and fine-tuning [11.738510106847414]
ReALLMは、事前訓練された言語モデルの圧縮とメモリ効率の適応のための新しいアプローチである。
重みのみの量子化アルゴリズムは、トレーニングなしで3ドルビットの予算で言語生成タスク(C4とWikiText-2)の最良の結果を得る。
論文 参考訳(メタデータ) (2024-05-21T18:50:51Z) - Fully $1\ imes1$ Convolutional Network for Lightweight Image
Super-Resolution [79.04007257606862]
ディープモデルは、シングルイメージ超解像(SISR)タスク、特に大きなカーネルを持つ大きなモデル(3時間3ドル以上)において重要なプロセスを持つ。
$1times1$の畳み込みは計算効率を大幅に向上させるが、局所的な空間表現の集約に苦労する。
我々は、Shift-Conv-based Network (SCNet) という、シンプルで効果的な1時間1ドルの畳み込みネットワークを提案する。
論文 参考訳(メタデータ) (2023-07-30T06:24:03Z) - Density Matrix Renormalization Group with Tensor Processing Units [0.0]
GoogleのProcessing Units(TPU)は、機械学習ワークロードの高速化とスケールアップに特化した集積回路である。
本研究では、局所量子多体ハミルトニアンの基底状態を計算するための強力な数値的アプローチである密度行列再正規化群(DMRG)の高速化とスケールアップにTPUを用いることを実証する。
論文 参考訳(メタデータ) (2022-04-12T10:40:14Z) - Compressing 1D Time-Channel Separable Convolutions using Sparse Random
Ternary Matrices [65.4388266814055]
1次元時間チャネル分離可能な畳み込みの1x1-畳み込みを、定数でスパースな乱数三元行列で-1,0,+1$の重みで置き換える。
Google Speech Commands v1のコマンド認識のために、最新の精度を同じネットワークサイズで97.21%$から97.41%$に改善します。
librispeech上での音声認識では、トレーニングすべき重みの数は半分になり、浮動小数点ベースラインの単語誤り率の約1%を犠牲にします。
論文 参考訳(メタデータ) (2021-03-31T15:09:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。