論文の概要: Super Apriel: One Checkpoint, Many Speeds
- arxiv url: http://arxiv.org/abs/2604.19877v1
- Date: Tue, 21 Apr 2026 18:00:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:10.671477
- Title: Super Apriel: One Checkpoint, Many Speeds
- Title(参考訳): スーパーエイプリル:1つのチェックポイント、多くのスピード
- Authors: SLAM Labs, :, Oleksiy Ostapenko, Raymond Li, Torsten Scholak, Alireza Mousavi-Hosseini, Aman Tiwari, Denis Kocetkov, Joel Lamy Poirier, Kelechi Ogueji, Nanda H Krishna, Rafael Pardinas, Sathwik Tejaswi Madhusudhan, Shruthan Radhakrishna, Srinivas Sunkara, Valerie Becaert,
- Abstract要約: 我々は、すべてのデコーダ層が4つの訓練済みミキサー選択を提供するスーパーネットであるSuper Aprielをリリースした。
配置はレイヤ毎に1つのミキサーを選択します。
スーパーエイプリルは凍ったエイプリル1.6の教師の蒸留で訓練され、その後監督された微調整が行われる。
- 参考スコア(独自算出の注目度): 12.035800821596936
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We release Super Apriel, a 15B-parameter supernet in which every decoder layer provides four trained mixer choices -- Full Attention (FA), Sliding Window Attention (SWA), Kimi Delta Attention (KDA), and Gated DeltaNet (GDN). A placement selects one mixer per layer; placements can be switched between requests at serving time without reloading weights, enabling multiple speed presets from a single checkpoint. The shared checkpoint also enables speculative decoding without a separate draft model. The all-FA preset matches the Apriel 1.6 teacher on all reported benchmarks; recommended hybrid presets span $2.9\times$ to $10.7\times$ decode throughput at 96% to 77% quality retention, with throughput advantages that compound at longer context lengths. With four mixer types across 48 layers, the configuration space is vast. A surrogate that predicts placement quality from the per-layer mixer assignment makes the speed-quality landscape tractable and identifies the best tradeoffs at each speed level. We investigate whether the best configurations at each speed level can be identified early in training or only after convergence. Rankings stabilize quickly at 0.5B scale, but the most efficient configurations exhibit higher instability at 15B, cautioning against extrapolation from smaller models. Super Apriel is trained by stochastic distillation from a frozen Apriel 1.6 teacher, followed by supervised fine-tuning. We release the supernet weights, Fast-LLM training code, vLLM serving code, and a placement optimization toolkit.
- Abstract(参考訳): 我々は、すべてのデコーダ層が、フルアテンション(FA)、スライディングウインドウアテンション(SWA)、キミデルタアテンション(KDA)、Gated DeltaNet(GDN)の4つの訓練済みミキサー選択を提供する、15BパラメーターのスーパーネットであるSuper Aprielをリリースした。
プレースメントはレイヤ毎に1つのミキサーを選択する。オーバメントは、ウェイトをリロードすることなく、サービス時にリクエスト間で切り替えることができ、単一のチェックポイントから複数のスピードプリセットを可能にする。
共有チェックポイントは、別のドラフトモデルなしで投機的復号化を可能にする。
推奨されるハイブリッドプリセットは、$2.9\times$から$10.7\times$デコードスループットは96%から77%の品質保持であり、より長いコンテキスト長で合成されるスループットの利点がある。
48層に4つのミキサー型があるため、構成空間は広い。
層間ミキサ割り当てから配置品質を予測するサロゲートは、速度品質のランドスケープを抽出可能とし、各速度レベルでの最良のトレードオフを特定する。
本研究は,各速度レベルにおける最適構成が早期に識別可能か,収束後にのみ識別可能かを検討する。
ランク付けは0.5Bスケールで迅速に安定するが、最も効率的な構成は15Bで高い不安定性を示し、より小さなモデルからの外挿に注意する。
スーパーエイプリルは凍ったエイプリル1.6の教師による確率的蒸留によって訓練され、その後、監督された微調整が行われる。
スーパーネットの重み付け、高速LLMトレーニングコード、vLLMサービスコード、配置最適化ツールキットをリリースします。
関連論文リスト
- Temporally Extended Mixture-of-Experts Models [6.07059176899521]
Mixture-of-Expertsモデルは、一定の推論速度でキャパシティをスケーリングするのに人気がある。
モデルが利用可能なGPUメモリを上回ると、このチャーンはオフロードやプレフェッチといった最適化を非効率にレンダリングすることができる。
我々は、強化学習におけるオプションフレームワークがこの問題に取り組むのに最適であり、時間的に拡張された熟練層について論じる。
論文 参考訳(メタデータ) (2026-04-22T03:50:52Z) - OPTIMA: Optimal One-shot Pruning for LLMs via Quadratic Programming Reconstruction [12.653025902977001]
トレーニング後のモデルプルーニングは有望なソリューションだが、ゼロウェイトは高速だが精度は劣化しているというトレードオフに直面している。
SparseGPTのようなワンショット方式は、効率的で近似的な重み更新を適用することで、最適化の実践的なトレードオフを提供する。
OPTIMAは,精度とスケーラビリティのバランスを保ちながら,実践的なワンショット・ポストトレーニング・プルーニング手法である。
論文 参考訳(メタデータ) (2025-12-15T20:41:29Z) - A Stable Whitening Optimizer for Efficient Neural Network Training [99.7641280234926]
アルゴリズムのシャンプー系をベースとして,3つの重要な問題を同定・緩和し,SPlus法を提案する。
まず,行列逆が長期にわたってキャッシュされる場合,素早いシャンプーは分岐しがちであることがわかった。
第二に、ネットワーク幅をまたいで学習率の伝達を可能にするために、形状認識スケーリングを適用する。
第3に,高い学習率によってパラメータノイズが大きくなり,より高速な学習をブロックする簡単な反復学習方式を提案する。
論文 参考訳(メタデータ) (2025-06-08T18:43:31Z) - SeWA: Selective Weight Average via Probabilistic Masking [51.015724517293236]
より良く、より高速な収束を達成するためには、ほんの数ポイントしか必要としないことを示す。
離散選択問題を連続的な部分集合最適化フレームワークに変換する。
両凸画像チェックポイントの値よりもシャープなSeWAの安定性境界を導出する。
論文 参考訳(メタデータ) (2025-02-14T12:35:21Z) - ASAG: Building Strong One-Decoder-Layer Sparse Detectors via Adaptive
Sparse Anchor Generation [50.01244854344167]
適応スパースアンカージェネレータ(ASAG)の提案により、スパース検出器と密度検出器のパフォーマンスギャップを橋渡しする。
ASAGは、グリッドではなくパッチの動的なアンカーを予測することで、機能競合の問題を軽減する。
提案手法は高密度な手法より優れ,高速かつ高精度なトレードオフを実現する。
論文 参考訳(メタデータ) (2023-08-18T02:06:49Z) - SmartBERT: A Promotion of Dynamic Early Exiting Mechanism for
Accelerating BERT Inference [18.456002674399244]
本稿では,SmartBERT と呼ばれる BERT 推論のための動的早期退避と層スキップを併用した新しい動的早期退避法を提案する。
SmartBERTは、いくつかのレイヤを適応的にスキップし、終了するかどうかを適応的に選択できる。
GLUEベンチマークの8つの分類データセットについて実験を行った。
論文 参考訳(メタデータ) (2023-03-16T12:44:16Z) - Towards End-to-end Semi-supervised Learning for One-stage Object
Detection [88.56917845580594]
本稿では,高度な一段検出ネットワークYOLOv5の半教師付き学習に焦点を当てた。
そこで我々は,Multi-view Pseudo-label Refinement (MPR) とDecoupled Semi-supervised Optimization (DSO) の2つの革新的な設計を取り入れた新しい教師学習レシピOneTeacherを提案する。
特に、MPRは、拡張ビューリファインメントとグローバルビューフィルタリングによって擬似ラベルの品質を改善し、DSOは構造的な微調整とタスク固有の擬似ラベルによる共同最適化競合を処理する。
論文 参考訳(メタデータ) (2023-02-22T11:35:40Z) - FROST: Faster and more Robust One-shot Semi-supervised Training [0.0]
本稿では,一対一の半教師付き学習手法を提案する。
実験では、ラベルなしデータの構成が不明な場合、FROSTが良好に動作できることを実証した。
論文 参考訳(メタデータ) (2020-11-18T18:56:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。