論文の概要: LegoLM: Structured Weight Sharing for Large Language Models
- arxiv url: http://arxiv.org/abs/2608.08652v1
- Date: Sun, 09 Aug 2026 11:51:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.908539
- Title: LegoLM: Structured Weight Sharing for Large Language Models
- Title(参考訳): LegoLM: 大きな言語モデルのための構造化されたウェイトシェア
- Abstract要約: 大規模言語モデルのための構造付き重み共有圧縮フレームワークであるLegoLMを提案する。
LegoLMは2つの障害モードを解決している。
GPT-2 の小型(124M) と Mistral-7B 全体で、LegoLM は Mistral-7B 上の 4.41X 圧縮で +0.03% PPL の劣化を達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present \LegoLM{}, a structured weight-sharing compression framework for large language models grounded in a systematic study of why global weight sharing fails and how to fix it. We identify two distinct failure modes. Distributional mismatch: for vector blocks of dimension d <= 2, transformer layers with heterogeneous weight scales impose a scale-mismatch penalty that grows linearly with d and cannot be resolved by increasing K, producing perplexity in the millions.Outlier dominance: for scalar blocks, a fraction ~1/K of weights lies beyond the outermost Lloyd-Max decision threshold and cannot be represented by any centroid; their misrepresentation accumulates across layers, causing catastrophic quality loss. \LegoLM{} resolves both failure modes via three data-free adaptations: 1 scalar-block encoding to eliminate the $d$-linear mismatch component, 2 percentile-selective replacement that identifies and preserves outlier weights verbatim, and 3 boundary-layer protection for the first and last transformer blocks. Across GPT-2 small (124M) and Mistral-7B, \LegoLM{} achieves +0.03% PPL degradation at 4.41X compression on Mistral-7B - outperforming PTQ-8bit in both quality and compression ratio - and -0.02% at 2.67X. Downstream evaluation on LAMBADA and HellaSwag confirms that \LegoLM{} at K=64, p=99% preserves accuracy within noise at 5.12 X compression, exceeding PTQ-8bit's compression ratio while matching its accuracy. We further discover that outlier dominance grows with model scale: full replacement at K=128 degrades GPT-2 small by only +23% but catastrophically degrades Mistral-7B by +1,134,279%, while selective replacement at p=99% rescues both models to under +15%. A controlled ablation confirms that selective replacement is the dominant mechanism: adding it to per-layer K-means also yields near-lossless quality, matching \LegoLM{} within 0.02%.
- Abstract(参考訳): 本稿では,グローバルな重み共有がなぜ失敗するのか,どのように修正するかという体系的な研究に基づいて,大規模言語モデルのための構造化された重み共有圧縮フレームワークである「LegoLM{}」を提案する。
私たちは2つの異なる障害モードを特定します。
分布ミスマッチ:次元 d <= 2 のベクトルブロックの場合、不均一な重量スケールを持つ変圧器層はスケールミスマッチのペナルティを課し、d と線形に成長し、K を増大させることで解決できない。
1 sscalar-block encoding to eliminate the $d$-linear mismatch component, 2 %ile-elect replacement that identifys outlier weights verbatim, 3 boundary-layer protection for the first and last transformer blocks。
GPT-2 の小型(124M) と Mistral-7B 全体で、 \LegoLM{} は Mistral-7B の4.41X 圧縮で +0.03% PPL の劣化を達成した。
LAMBADAとHellaSwagの下流評価では、K=64の‘LegoLM{}, p=99%は5.12Xの圧縮でノイズの精度を保ち、PTQ-8bitの圧縮比を超える。
K=128 での完全置換は GPT-2 をわずか +23% で分解するが、破滅的に Mistral-7B を+1,134,279% で分解する一方、p=99% での選択的置換は 15% 以下である。
制御されたアブレーションにより、選択的な置換が支配的なメカニズムであることが確認される: 層ごとのK平均値にそれを加えると、ほぼロスレスの品質が得られ、 0.02% 以内でレゴLM{} と一致する。
関連論文リスト
- Deterministic LLM Inference Across GPU Kernels: Power-of-Two INT8 Quantization Scales and the Limits of Tolerance-Based Conformance [0.10152838128195468]
量子化されたGEMMカーネルのコンフォーマンススイートは、2つの実装が許容範囲内で一致するかどうかを問う。
5つのエピローグ断層(スケール精度、ダブルラウンド、乗算順序、出力トランケーション、融合順序)のうちの1つが、少なくとも1つのbfloat16間隔で出力を移動していることがわかった。
5つの断層のうち4つはスイートのチェック無しで検出され、5番目は2つのスケールでのみ検出される。
論文 参考訳(メタデータ) (2026-08-25T03:05:54Z) - Bounded Precision-Geometry Scaling for Robust Multi-Task Learning under Loss Scale Mismatch [0.0]
マルチタスク学習はしばしば数桁の損失を組み合わせ、ホモシステマティックな不確実性重み付けが著しく低下する。
バッチ損失統計に固定された有界シグモノイドパラメータ化により各タスクのログ分散をマッピングする手法である境界精度幾何スケーリング(BPGS)を提案する。
BPGSを合成応力試験と実世界の3つのベンチマークで評価した: NYUv2高密度予測、Yeast多ラベル分類、RF1多ターゲット回帰。
論文 参考訳(メタデータ) (2026-08-21T21:48:51Z) - Wiring Beats Blending: What Transfers Between Transformer Sizes -- and What Doesn't [0.0]
我々は Pythia family の 1.4B->410M 変換を特徴付ける。
最小二乗補償と分散保存再スケールの2つの独立レバーに分解する。
補償は普遍的よりもトークン効率が高く低予算の勝利である。
論文 参考訳(メタデータ) (2026-08-03T19:44:08Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Normalized Architectures are Natively 4-Bit [49.13186675123547]
重みと隠れ表現を単位超球面に制限するアーキテクチャであるnGPTは、本質的に低精度算術よりも堅牢である。
本手法は,最大3B/30Bパラメータの1.2B密度モデルとハイブリッド(Mamba-Transformer)MoEモデルの両方で検証する。
論文 参考訳(メタデータ) (2026-05-07T11:54:07Z) - Predicting LLM Compression Degradation from Spectral Statistics [2.76240219662896]
マトリックスレベルの低ランク圧縮は、大きな言語モデルのコストを削減するための有望な方法である。
この計算にコミットする前に圧縮誘起劣化を予測することができるか?
安定なランクと情報密度は,パラメータごとのビット数で測定され,性能劣化が支配的であることがわかった。
論文 参考訳(メタデータ) (2026-04-20T11:01:19Z) - Quantization Dominates Rank Reduction for KV-Cache Compression [0.0]
量子化は、モデルと圧縮レベルに応じて、4-364 PPLのランク低下を一貫して上回る。
我々は、ソフトマックスフィッシャー計量の下で、投射損傷が1方向に3 x 2 (2b) の量子化損傷を超える結果によってこれを定式化する。
論文 参考訳(メタデータ) (2026-04-13T14:06:18Z) - Compressing Transformer Language Models via Matrix Product Operator Decomposition: A Case Study on PicoGPT [0.0]
トランスフォーマーベースの言語モデルは、NLPタスク間で強力なパフォーマンスを実現するが、その2次パラメータスケーリングは、リソース制約のあるハードウェアへのデプロイを高くする。
変圧器の原理圧縮法として行列積演算子分解について検討する。
MPOは、重み行列を低ランクコアの鎖に分解し、近似品質は結合次元chiによって制御される。
論文 参考訳(メタデータ) (2026-03-30T14:57:47Z) - Only relative ranks matter in weight-clustered large language models [0.0]
大規模言語モデル(LLM)は数十億のパラメータを含むが、多くの正確な値は必須ではない。
重みの相対的なランクは、ある接続が正確な大きさよりも強いか弱いかを示す。
Llama 3.1-8B-Instruct と SmolLM2-135M では、各行列を16-64個の異なる値に減らし、再トレーニングすることなく高い精度を保っている。
論文 参考訳(メタデータ) (2026-03-18T16:55:13Z) - LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning [50.89500210372827]
リソース制約のあるエッジデバイスに大規模言語モデル(LLM)をデプロイするには、量子化と微調整が不可欠である。
LoTA-QAFは量子化LDM用に特別に設計された新しい微調整法である。
MMLUベンチマークでは,16ビットLORAを最大5.14%越えて,量子化モデルの性能を効果的に回復する。
論文 参考訳(メタデータ) (2025-05-24T14:47:28Z) - Label Distributionally Robust Losses for Multi-class Classification:
Consistency, Robustness and Adaptivity [55.29408396918968]
多クラス分類のためのラベル分布ロバスト(LDR)損失という損失関数群について検討した。
我々の貢献は、多クラス分類のためのLDR損失のトップ$kの一貫性を確立することによって、一貫性と堅牢性の両方を含んでいる。
本稿では,各インスタンスのクラスラベルの雑音度に個別化温度パラメータを自動的に適応させる適応型LDR損失を提案する。
論文 参考訳(メタデータ) (2021-12-30T00:27:30Z) - Training with Quantization Noise for Extreme Model Compression [57.51832088938618]
与えられたモデルサイズに対する精度を最大化しながら、コンパクトなモデルを作成するという問題に取り組む。
標準的な解決策は、トレーニング中に重みが定量化され、勾配がストレート・スルー推定器に近似される量子化意識訓練(Quantization Aware Training)でネットワークをトレーニングすることである。
本稿では, この手法を, 極端な圧縮法を用いて, int8 の固定点量子化を超えて機能するように拡張する。
論文 参考訳(メタデータ) (2020-04-15T20:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。