論文の概要: Baseline Shape Decides the Verdict: A Controlled Re-Examination of Ternary Language Models at 60K Parameters
- arxiv url: http://arxiv.org/abs/2609.29397v1
- Date: Thu, 24 Sep 2026 11:24:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.871541
- Title: Baseline Shape Decides the Verdict: A Controlled Re-Examination of Ternary Language Models at 60K Parameters
- Title(参考訳): ベースライン形状が判断を下す:60Kパラメータにおける第三言語モデルの制御された再検討
- Abstract要約: 経路3次ブロックがパラメータマッチングされた完全精度変圧器を22%の60Kパラメータで打ち負かすことを示す。
私たちはそれを、1つの固定されたレシピ、セルごとに3つの種、98バイトレベルのラップトップで再実行します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ternary (1.58-bit) weights are attractive for microcontroller-class language models, but the sub-1M-parameter regime rests mainly on isolated, single-seed comparisons. One prominent example reports that a routed ternary block (convolution, diagonal SSM and sparse attention mixed by a per-token router) beats a parameter-matched full-precision transformer by 22% at 60K parameters, attributing this to inductive bias. We re-run it under one fixed recipe, three seeds per cell, 98 byte-level runs on one laptop. (i) Baseline shape dominates: at a 16M-byte budget, param-matched transformers span 22.6% in validation loss purely by depth/width choice - far more than any architecture effect we measure there - and the best-shaped transformer ties the routed model, so the published margin is at least partly a baseline-shape effect; the ordering of shapes reverses with budget, so no single fixed shape can be trusted. (ii) At 130M bytes the routed model does win, by 22.2-24.0% over the three transformer shapes we evaluate there - but a plain gated diagonal-SSM block beats it by a further 9.1%, and the routed model's own router puts most of its weight on its recurrent pathway, so the gain does not require routing. (iii) The ternary penalty differs by architecture at the larger budget (+5.3% best transformer vs. +19.5% routed, +28.1% gated SSM), but we cannot attribute that to architecture alone: our transformers keep learned positional embeddings in full precision, 11-22% of their parameters, so they are less quantized than the models they are compared with. (iv) A 90/10 full-precision-then-ternary schedule beats all-ternary training, but only at a stage-2 learning rate about 10x the pretraining peak; at a conventional fine-tuning rate it looks 15.3% worse, reversing the conclusion. The from-scratch baseline was not itself learning-rate tuned, which bounds (iii) and (iv). Code and run logs released.
- Abstract(参考訳): 三進法(1.58ビット)の重みはマイクロコントローラクラスの言語モデルには魅力的であるが、サブ-1Mパラメーターの規則は主に孤立した単座比較に基づいている。
1つの顕著な例は、ルーティングされた三進ブロック(畳み込み、対角SSM、トーケン当たりルータで混合されたスパースアテンション)が、パラメータマッチングされたフル精度トランスを60Kパラメータで22%上回り、誘導バイアスに起因する。
私たちはそれを、1つの固定されたレシピ、セルごとに3つの種、98バイトレベルのラップトップで再実行します。
i) ベースライン形状が支配的である: 16Mバイトの予算では、パラム整合トランスフォーマーは、深さ/幅選択によって純粋にバリデーション損失の22.6%にまたがっており、最もよい形のトランスフォーマーはルートモデルと結びついているので、公開されたマージンは少なくとも部分的にはベースライン形状効果であり、形状の順序は予算と逆転するため、単一の固定形状を信頼できない。
(ii) ルートモデルが1300万バイト当たり22.2~24.0%で、評価した3つの変圧器の形状に対して勝利するが、通常のゲート付き対角SSMブロックがさらに9.1%の差をつけ、ルートモデル自身のルータがリカレントパスに重みを付けているので、利得はルーティングを必要としない。
(3)3次ペナルティは、より大きな予算でのアーキテクチャ(+5.3%のベストトランスフォーマー対+19.5%のルート付き、+28.1%のゲート付きSSM)によって異なるが、アーキテクチャのみによるものではない。
(4)90/10の完全精度3次スケジュールは全3次訓練に勝るが、事前学習ピークの約10倍のステージ2学習率でしかなく、従来の微調整レートでは15.3%悪化し、結論を覆す。
オフスクラッチベースラインは、それ自体が学習率調整されていない。
(三)及び(三)
(4)。
コードと実行ログのリリース。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Representation Distribution Matching for One-Step Visual Generation [107.84208192304455]
表現分布マッチング(Representation Distribution Matching, RDM)の設計空間の解明
2つの設計軸、分布がどのように比較され、それらの表現が比較されるかを特定し、それに沿って制御された研究によって3つの結果が得られた。
同じレシピは4ステップのFLUX.2[klein]を1ステップのジェネレータに後付けし、GenEvalの4ステップバージョンである0.826から0.794、PickScoreの22.76から22.58を90 H200 GPU時間で上回った。
論文 参考訳(メタデータ) (2026-07-02T16:15:38Z) - How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap [0.0]
深層学習EEG(Deep Learning EEG Denoising Architectures)は、数万から数千万のパラメータに拡張されているが、実験変数としてモデルキャパシティを分離した以前の研究はない。
アーキテクチャ,損失,データ分割,トレーニングレシピの両ギャップに対処し,最小限の深さ分離可能な畳み込みU-Netで1.05Kから40.26Kパラメータまでのチャネル幅を網羅する。
論文 参考訳(メタデータ) (2026-06-07T12:17:25Z) - THEIA: Learning Complete Kleene Three-Valued Logic in a Pure-Neural Modular Architecture [0.0]
THEIAは2.75Mのモジュラー・ニューラルアーキテクチャで、外部のシンボル推論や手書きのK3ゲートプリミティブを使わずにタスクデータから完全Kleene 3値論理(K3)真理表を学習する。
トランスフォーマーのベースラインは39の規則すべてで99%に到達し、フラットは0.04pp以内のフェーズ1の精度でTheIAと一致している。
論文 参考訳(メタデータ) (2026-04-13T10:44:15Z) - Compressing Transformer Language Models via Matrix Product Operator Decomposition: A Case Study on PicoGPT [0.0]
トランスフォーマーベースの言語モデルは、NLPタスク間で強力なパフォーマンスを実現するが、その2次パラメータスケーリングは、リソース制約のあるハードウェアへのデプロイを高くする。
変圧器の原理圧縮法として行列積演算子分解について検討する。
MPOは、重み行列を低ランクコアの鎖に分解し、近似品質は結合次元chiによって制御される。
論文 参考訳(メタデータ) (2026-03-30T14:57:47Z) - Directional Routing in Transformers [0.0]
指向性ルーティングは、共有ルータによって制御される各トランスフォーマーアテンションヘッド学習抑制方向を提供する軽量なメカニズムである。
結果の回路を機械的解釈可能性によってトレースする。
ルーティングは、ベースラインに対するパープレキシティを31~56%削減するが、下流の多重選択ベンチマークはまだこれらの利得を反映していない。
論文 参考訳(メタデータ) (2026-03-16T07:28:22Z) - Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance [87.19164603145056]
実験室レベルの資源をトラッキングするための大規模ViTモデルのパワーを明らかにする手法であるLoRATを提案する。
私たちの作業の本質は、推論レイテンシを追加することなく、モデルパラメータの小さなサブセットを微調整するテクニックであるLoRAを適用することです。
我々はPETRの適応のみに基づくアンカーフリーヘッドを設計し、計算オーバーヘッドを少なくして性能を向上する。
論文 参考訳(メタデータ) (2024-03-08T11:41:48Z) - EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm [111.17100512647619]
本稿では、実証された実用的な進化的アルゴリズム(EA)と類似したビジョントランスフォーマーの合理性を説明する。
本稿では,EA ベースのトランス (EAT) ブロックのみを含む新しいピラミッド EATFormer バックボーンを提案する。
画像分類,下流タスク,説明実験に関する大規模かつ定量的な実験は,我々のアプローチの有効性と優位性を示すものである。
論文 参考訳(メタデータ) (2022-06-19T04:49:35Z) - End-to-End Multi-speaker Speech Recognition with Transformer [88.22355110349933]
音声認識モデルにおけるRNNベースのエンコーダデコーダをトランスフォーマーアーキテクチャに置き換える。
また、計算量を削減するために、シーケンス全体ではなくセグメントに制限されるセルフアテンションコンポーネントを変更します。
論文 参考訳(メタデータ) (2020-02-10T16:29:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。