論文の概要: On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
- arxiv url: http://arxiv.org/abs/2608.30320v1
- Date: Mon, 31 Aug 2026 06:35:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.25907
- Title: On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
- Title(参考訳): Qwen3.8-Nextアーキテクチャの設計について:評価,効率,訓練安定性について
- Authors: Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu,
- Abstract要約: Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
- 参考スコア(独自算出の注目度): 57.03393882933515
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We describe the architecture and ablations of Qwen3.8-Flash-Next, a sparse mixture-of-experts model with 125B parameters, 6B activated per token, and additional 51B parameters of n-gram embedding tables held off the accelerator. On fourteen pre-training benchmarks the model leads the 397B-A17B predecessor on eight and trails it on the rest by at most 2.6 points, at 1/3 the activated parameters, 1/3 the training tokens, and roughly 1/9 the training FLOPs. Token mixing uses a layer-wise hybrid of Gated DeltaNet (GDN) and global attention, with one full-attention layer in every four; at continued-pretraining time those full-attention layers are replaced by Qwen Sparse Attention (QSA), which scores context at micro-block granularity with a compressed lightweight indexer. The residual stream is widened to four branches and read through an elementwise gate, a design we call the Gated Residual (GR). Capacity is added outside the backbone by a single n-gram embedding layer whose tables are prefetched from host memory. We evaluate every candidate change along three axes: loss together with downstream benchmarks; the cost of the change in training, prefill and decode; and its effect on the optimal hyperparameters and training stability. Loss and downstream accuracy do not always move together: enlarging the n-gram vocabulary lowers loss monotonically while downstream accuracy saturates. The architecture and the Muon optimizer together shift the optimal learning rate and batch size upwards, render batch-size warmup unnecessary, and substantially improve stability under stress tests. Loss, benchmarks, efficiency and stability form one design problem. Solved jointly, they yield a recipe that is simultaneously more efficient, more capable and more stable.
- Abstract(参考訳): Qwen3.8-Flash-Nextは、125Bパラメータ、トークンあたり6Bアクティベート、さらに加速器から保持されたn-gram埋め込みテーブルの51Bパラメータを含むスパース・ミックス・オブ・エキスパート・モデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
トケミキシングでは、Gated DeltaNet(GDN)のレイヤーワイドハイブリッドとグローバルアテンションを使用し、4つに1つのフルアテンション層を配置し、継続的な事前トレーニング時に、これらのフルアテンション層をQwen Sparse Attention(QSA)に置き換える。
残留ストリームは4つのブランチに拡張され、要素ワイドゲートを通して読み込まれる。
キャパシティは、テーブルがホストメモリからプレフェッチされた単一のn-gram埋め込み層によって、バックボーンの外側に追加される。
ダウンストリームベンチマークによる損失、トレーニングにおける変更のコスト、プリフィルとデコード、最適なハイパーパラメータとトレーニング安定性に対する影響の3つの軸に沿って、すべての候補変更を評価する。
損失と下流の精度は必ずしも一致しない:n-gram語彙の増大は、下流の精度が飽和している間に単調に損失を下げる。
アーキテクチャとMuonオプティマイザは、最適な学習率とバッチサイズを上向きにシフトし、バッチサイズのウォームアップを不要にし、ストレステスト時の安定性を大幅に改善する。
損失、ベンチマーク、効率、安定性が1つの設計問題となる。
共同で解かれたレシピは、より効率的で、より有能で、より安定している。
関連論文リスト
- p-Spin Glass Network Efficient Single-Batch Continual Learning [0.0]
p$-Spin Glass Networkは,制約を克服し,最適化の分散を構造的に管理し,注目に値する4つの機能を実現する新しいアーキテクチャである。
サンプル効率を実証し、Transformerベースラインのパフォーマンスにマッチし、トレーニングシーケンスの少ない8倍のコストで利用することができる。
最終的に、この作業は安定したディープラーニングに対する大きな要求を取り除き、継続的学習とエッジAIの基礎を確立します。
論文 参考訳(メタデータ) (2026-08-14T16:24:37Z) - Aftab: A Comprehensive Benchmark of CNN Encoders and Advanced Value Functions in Parallelized Q-Networks [2.179313476241343]
本稿では,並列化Q-Network (PQN) アルゴリズムにおけるコナールニューラルネットワークのアーキテクチャ設計空間について検討する。
本研究では,Hadamax符号化パラダイムをカテゴリ,アンサンブル,デュエルの値ヘッドと組み合わせることで,乗法的表現学習と高度な値推定の効果について検討する。
その結果, 並列化・再生不要なQ-ラーニングフレームワークにおいて, エンコーダトポロジ, 乗法的特徴相互作用, 高度な値推定ヘッドは, 性能を著しく向上させることができることを示した。
論文 参考訳(メタデータ) (2026-08-07T15:29:15Z) - GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning [61.67411833252235]
本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
論文 参考訳(メタデータ) (2026-08-03T17:55:24Z) - Stable FP4 Training via Transposition-Invariant Block Quantization [14.373963304887754]
従来の1Dブロック量子化では、前方と後方のパスは変換後に同じ値に誘電性スケーリング因子を割り当てる。
本稿では,2次元ブロックFP4量子化に基づく低精度トレーニングフレームワークを提案する。
提案手法は安定なエンドツーエンドFP4トレーニングを実現し,BF16の性能と密に一致し,パープレキシティと下流精度が1.3%未満に低下した。
論文 参考訳(メタデータ) (2026-07-27T18:03:34Z) - Forge-UGC: FX optimization and register-graph engine for universal graph compiler [2.587194279527956]
OpenVINOやONNXのような既存のフレームワークは、しばしば不透明なコンパイルパイプラインを使用する。
Forge-UGCは、グラフキャプチャ、最適化、中間表現の低下、バックエンドスケジューリングを分離するハードウェアに依存しない設計でこの問題に対処する。
論文 参考訳(メタデータ) (2026-04-14T04:39:16Z) - Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models [6.396911723204044]
Mixture-of-experts (MoE)言語モデルは、高密度モデルよりも優れた品質と効率のトレードオフをもたらすことがしばしば期待されている。
そこで本研究では,高密度および高密度なMoE設計にまたがる7つの推論指向命令調整モデルのベンチマークを示す。
論文 参考訳(メタデータ) (2026-04-08T12:50:52Z) - BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity [66.94629945519125]
我々は、新しいMoEアーキテクチャであるBlockFFNと、その効率的なトレーニングとデプロイメント技術を紹介します。
具体的には、ReLUアクティベーションとRMSNormを統合したルータを、微分可能かつ柔軟なルーティングに使用します。
次に、トークンレベルのスペーサ(TLS)とチャンクレベルのスペーサ(CLS)の両方を促進するために、CLS対応のトレーニング目標を設計し、BlockFFNをより加速しやすいものにした。
論文 参考訳(メタデータ) (2025-07-11T17:28:56Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。