論文の概要: Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data
- arxiv url: http://arxiv.org/abs/2607.11883v1
- Date: Mon, 13 Jul 2026 17:58:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.582624
- Title: Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data
- Title(参考訳): 逐次符号化:自己生成学習データによるモデル圧縮の限界を押し上げる
- Abstract要約: 本稿では,教師モデルが生徒自身の分布から抽出した学習サンプルを選択するための逐次符号化手法を提案する。
結果として得られるコード長は、パラメータカウントとデータエントロピーとは独立しており、多くの場合、先行するコード長よりも桁違いに短い。
- 参考スコア(独自算出の注目度): 55.04392122319273
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Compression is fundamental to intelligence. A model that can represent its training data as a short code has discovered regularities that enable generalization. Large neural networks may learn functions far simpler than their parameter counts suggest, but it is challenging to construct codes that realize this simplicity. Parameter-based methods such as quantization produce code lengths that scale with model size, insensitive to how much information the parameters store. Prequential coding bypasses this issue by compressing the training trajectory, but codes the exact data sequence regardless of how much the model learns, yielding large codes when the data has high entropy. We introduce requential coding, where a teacher model selects training samples drawn from the student's own distribution. The student's code records only these selections, which cost bits only where teacher and student disagree. The resulting code length is independent of parameter count and data entropy, and often orders of magnitude shorter than the prequential counterpart, with an advantage that grows with scale. This compression sheds light on phenomena inaccessible to prior compressors. Holding loss fixed, larger models and ensembles compress to much smaller sizes despite more parameters. Plugged into a PAC-Bayes bound, the requential code yields state-of-the-art generalization guarantees for billion-parameter LLMs, outperforming bounds built on aggressive post-training quantization even granted zero error. The bound tightens with scale in the compute-optimal regime, as models become increasingly compressible relative to dataset size. The same code predicts that models gradually overfit when trained for multiple epochs. It also isolates the learnable information in a dataset from its unpredictable, random content, revealing that lower-entropy text holds far more learnable structure than higher-entropy image data.
- Abstract(参考訳): 圧縮は知性に欠かせない。
トレーニングデータを短いコードとして表現できるモデルが、一般化を可能にする正規性を発見した。
大規模ニューラルネットワークは、パラメータの数よりもはるかに単純な関数を学ぶことができるが、この単純さを実現するコードを構築することは困難である。
量子化のようなパラメータベースのメソッドは、パラメータがどれだけ情報を保存するかに敏感で、モデルのサイズに合わせてスケールするコード長を生成する。
逐次符号化は、トレーニング軌跡を圧縮することでこの問題を回避するが、モデルがどのように学習するかに関わらず正確なデータシーケンスを符号化し、データが高いエントロピーを持つときに大きなコードを生成する。
本稿では,教師モデルが生徒自身の分布から抽出した学習サンプルを選択するための逐次符号化手法を提案する。
学生のコードはこれらの選択のみを記録しており、教師と生徒の意見が一致しない場合にのみ、多少のコストがかかる。
結果として得られるコード長は、パラメータカウントとデータエントロピーとは独立しており、多くの場合、序列よりも桁違いに短い。
この圧縮は、先行圧縮機に到達できない現象に光を放つ。
損失を固定し、より大きなモデルとアンサンブルは、より多くのパラメータにもかかわらず、はるかに小さなサイズに圧縮される。
PAC-Bayes境界に差し込むと、逐次符号は10億パラメートル LLM に対して最先端の一般化を保証する。
モデルがデータセットサイズに対して圧縮されやすくなるにつれて、境界は計算-最適状態のスケールとともに強まります。
同じコードは、モデルを複数のエポックでトレーニングすると、徐々に過度に適合する、と予測する。
また、データセット内の学習可能な情報を予測不能でランダムなコンテンツから分離し、低エントロピーのテキストが高エントロピーの画像データよりもはるかに学習可能な構造を持つことを示した。
関連論文リスト
- Fine-Tuning Low-Bit Models with Gradient in Quantized Code Space [78.05046281165885]
微調整の低ビットモデルは、最終配置されたチェックポイントを同じ低ビット形式に保ちながら、量子化されたモデルを適用することを目的としている。
GradCodesは、異なる量子化データタイプにわたる微調整の低ビットモデルを一貫して改善する。
論文 参考訳(メタデータ) (2026-08-31T14:54:30Z) - Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios [76.85739138203014]
本稿では,一方向および注目メカニズムを加速する新しいアーキテクチャであるSpecFormerを紹介する。
また,SpecFormerはトレーニング要求の低減と計算コストの削減を実現している。
論文 参考訳(メタデータ) (2025-11-25T14:20:08Z) - LLMComp: A Language Modeling Paradigm for Error-Bounded Scientific Data Compression (Technical Report) [4.2414540423650795]
LLMCOMPは、デコーダのみの大規模言語モデルを利用して科学的データをモデル化する、失われた圧縮パラダイムである。
常に最先端の圧縮機を上回り、厳密な誤差境界の下で最大30%高い圧縮比を達成する。
論文 参考訳(メタデータ) (2025-10-24T05:41:04Z) - Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression [57.54335545892155]
本稿では,各重みの群に独自の格子コードブックを割り当てるGLVQ(Grouped Lattice Vector Quantization)フレームワークを紹介する。
提案手法は,既存のトレーニング後の量子化ベースラインと比較して,モデルサイズと精度のトレードオフが良好である。
論文 参考訳(メタデータ) (2025-10-23T20:19:48Z) - UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance [65.01483640267885]
大きな言語モデル(LLM)は、様々なタスクにおいて顕著な能力を示してきたが、コード生成は依然として大きな課題である。
私たちは、モデル生成ユニットテストを活用してコード生成プロセスのガイドと検証を行う、システマティックパイプラインであるUnitCoderを紹介します。
我々の研究は、モデル生成単体テストを利用して、事前学習コーパスから高品質なコードデータの合成を誘導するスケーラブルなアプローチを提案する。
論文 参考訳(メタデータ) (2025-02-17T05:37:02Z) - Optimizing Datasets for Code Summarization: Is Code-Comment Coherence Enough? [11.865113785648932]
コード要約の特定の品質属性であるコード圧縮コヒーレンスが、コードの要約データセットの最適化にどの程度利用できるかを検討する。
2つの最先端データセット(TL-CodeSumとFuncom)から複数のレベルのトレーニングインスタンスを調べ、3つの手作業によるテストセット上で結果モデルを評価する。
論文 参考訳(メタデータ) (2025-02-11T15:02:19Z) - The Persian Rug: solving toy models of superposition using large-scale symmetries [0.0]
入力次元が大きければ最小限の非線形スパースデータオートエンコーダによって学習されたアルゴリズムの完全なメカニスティック記述を示す。
我々の研究は、オートエンコーダの構造を理解する技術を導入することによって、ニューラルネットワークの解釈可能性に貢献している。
論文 参考訳(メタデータ) (2024-10-15T22:52:45Z) - Few-Shot Non-Parametric Learning with Deep Latent Variable Model [50.746273235463754]
遅延変数を用いた圧縮による非パラメトリック学習(NPC-LV)を提案する。
NPC-LVは、ラベルなしデータが多いがラベル付きデータはほとんどないデータセットの学習フレームワークである。
我々は,NPC-LVが低データ構造における画像分類における3つのデータセットの教師あり手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2022-06-23T09:35:03Z) - COIN++: Data Agnostic Neural Compression [55.27113889737545]
COIN++は、幅広いデータモダリティをシームレスに扱うニューラルネットワーク圧縮フレームワークである。
様々なデータモダリティを圧縮することで,本手法の有効性を示す。
論文 参考訳(メタデータ) (2022-01-30T20:12:04Z) - Generative time series models using Neural ODE in Variational
Autoencoders [0.0]
生成時系列モデリングのための変分オートエンコーダ設定にニューラル正規微分方程式を実装した。
開発と研究を容易にするために、コードに対するオブジェクト指向のアプローチが採られた。
論文 参考訳(メタデータ) (2022-01-12T14:38:11Z) - A flexible, extensible software framework for model compression based on
the LC algorithm [10.787390511207683]
ニューラルネットワークや他の機械学習モデルを最小限の労力で圧縮できるソフトウェアフレームワークを提案する。
ライブラリはPythonとPyTorchで書かれており、Githubで入手できる。
論文 参考訳(メタデータ) (2020-05-15T21:14:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。