論文の概要: SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
- arxiv url: http://arxiv.org/abs/2607.20145v2
- Date: Thu, 30 Jul 2026 09:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.243096
- Title: SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
- Title(参考訳): SLAI T-Rex:Accend SuperPODによるDeepSeek-V4ファミリーのフルパラメータポストトレーニング
- Authors: Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo,
- Abstract要約: 本稿では,Ascend NPU SuperPODにおけるエンドツーエンド最適化手法を提案する。
モデルレベルの並列性、計算通信オーケストレーション、低レベルのカーネル実行にまたがる階層的最適化フレームワークを開発した。
その結果、34.22%のモデルFLOP(Model FLOP)利用が達成され、オープンソースのベースラインレシピよりも2.93倍改善された。
- 参考スコア(独自算出の注目度): 91.71050339479261
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Full-parameter post-training of trillion-parameter-scale MoE models introduces substantial system-level challenges for large-scale distributed training, including severe memory pressure, non-overlapped communication overhead, and inefficient kernel execution. While most large-scale LLM training systems are built around GPU-based clusters, this report presents an end-to-end optimization practice on the Ascend NPU SuperPOD. Using the DeepSeek-V4 model family as the target workload, we develop a hierarchical optimization framework spanning model-level parallelism, computation-communication orchestration, and low-level kernel execution. The resulting system achieves 34.22% Model FLOPs Utilization (MFU) with a 2.93x improvement over the open-source baseline recipe while maintaining training stability. Building on this optimized infrastructure, we further establish a CPT and SFT workflow for complex Operations Research (OR) tasks. We refer to the integrated framework as SLAI T-Rex. Using DeepSeek-V4-Flash, we develop OR-oriented CPT and SFT data pipelines that combine collected domain resources with solver-verified synthetic optimization documents. The resulting dataset contains 10K high-quality SFT samples spanning four task categories and three problem representations. The specialized model achieves the highest average zero-shot Pass@1 score among the evaluated models, reaching 71.81% and outperforming GPT-5.4-Mini and the base DeepSeek-V4-Flash model by 3.98 and 11.27 percentage points, respectively. Overall, this work demonstrates a full-stack pathway from efficient trillion-parameter model post-training on Ascend infra to domain-specialized Flash models for solver-grounded mathematical modeling, advancing frontier-model systems for complex reasoning.
- Abstract(参考訳): 1兆パラメータスケールのMOEモデルのフルパラメータ後トレーニングでは、大規模な分散トレーニングにおいて、大きなメモリプレッシャー、オーバーラップしない通信オーバーヘッド、非効率的なカーネル実行など、システムレベルの大きな課題が導入されている。
大規模LLMトレーニングシステムはGPUベースのクラスタを中心に構築されているが,本報告ではAscend NPU SuperPOD上でのエンドツーエンドの最適化手法を提案する。
目的のワークロードとしてDeepSeek-V4モデルファミリを用いて,モデルレベルの並列処理,計算通信オーケストレーション,低レベルのカーネル実行を対象とする階層的最適化フレームワークを開発した。
その結果、トレーニング安定性を維持しながら、オープンソースのベースラインレシピよりも2.93倍改善した34.22%のモデルFLOP(MFU)が実現された。
この最適化されたインフラ上に構築し、複雑なオペレーションリサーチ(OR)タスクのためのCPTおよびSFTワークフローをさらに確立する。
統合フレームワークをSLAI T-Rexと呼ぶ。
DeepSeek-V4-Flashを用いて、収集したドメインリソースとソルバ検証された合成最適化文書を組み合わせたOR指向CPTおよびSFTデータパイプラインを開発する。
得られたデータセットには、4つのタスクカテゴリと3つの問題表現にまたがる10Kの高品質なSFTサンプルが含まれている。
評価されたモデルのうち、平均ゼロショットパス@1スコアは71.81%に達し、GPT-5.4-Mini、ベースとなるDeepSeek-V4-Flashモデルの3.98ポイント、11.27ポイントを上回っている。
全体として、この研究は、Ascend infraでの効率的な1兆パラメータモデルから、複雑な推論のためのフロンティアモデルの進歩、ソルバグラウンドの数学的モデリングのためのドメイン特化Flashモデルまで、効率的な1兆パラメータモデルへのフルスタックパスを示す。
関連論文リスト
- Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models [1.9290392443571385]
2021年から2026年にかけて発行されたOFDMRIS最適化について調査した。
標準化されたベンチマークは存在せず、クロスペーパー比較は実現不可能である。
合成ベースのベンチマークデプロイメントから6つのオープンな課題が浮かび上がっている。
論文 参考訳(メタデータ) (2026-06-30T08:34:46Z) - Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models [63.96252564303143]
Embodied-R1.5は統合されたEmbodied Foundation Model(EFM)であり、包括的エンボディド推論機能を統合する。
我々は15B以上のトークンからなる大規模データシステムを構築し、マルチタスクバランスのRLレシピを設計する。
8Bパラメータしか持たず、Embodied-R1.5 SOTAは24のVLMベンチマークのうち16で、Gemini-Robotics-ER-1.5やGPT-5.4といった主要なモデルを上回った。
論文 参考訳(メタデータ) (2026-06-09T18:07:50Z) - How to Train Your LLM Web Agent: A Statistical Diagnosis [96.86317871461834]
LLMウェブエージェントのポストトレーニングにおける計算割当に関する統計学的基礎研究について述べる。
提案手法では,Llama 3.1 8Bの学生を対象に,教師付き微調整(SFT)とオンライン強化学習を用いて,Llama 3.3 70Bの教師を模倣する2段階のパイプラインを用いた。
以上の結果から,SFTとオンラインRLの組み合わせは,WorkArenaとMiniWob++のいずれにおいても,単独でのアプローチよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-07-05T17:12:33Z) - Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs [51.21041884010009]
Ring-liteは、強化学習(RL)により最適化されたMixture-of-Experts(MoE)ベースの大規模言語モデルである
我々のアプローチは、挑戦的なベンチマーク上でのSOTA(State-of-the-art)の小規模推論モデルの性能と一致する。
論文 参考訳(メタデータ) (2025-06-17T17:12:34Z) - MiniCPM4: Ultra-Efficient LLMs on End Devices [126.22958722174583]
MiniCPM4は、エンドサイドデバイス向けに明示的に設計された高効率な大規模言語モデル(LLM)である。
この効率性は、モデルアーキテクチャ、トレーニングデータ、トレーニングアルゴリズム、推論システムという4つの重要な側面において、体系的な革新を通じて達成します。
論文 参考訳(メタデータ) (2025-06-09T16:16:50Z) - From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning [31.95005389919542]
データスケールとモデルサイズは、大規模言語モデルの性能向上に有効であることが証明されている。
本稿では,教師付きファインチューニングパラダイムであるAggregation Fine-Tuning(AFT)を紹介する。
ベンチマークデータセットの実証評価では、AFT訓練されたモデルは標準のSFTよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-01-21T04:11:59Z) - Lightweight Deep Learning Framework for Accurate Particle Flow Energy Reconstruction [8.598010350935596]
本稿では,ディープラーニング再構築の枠組みを体系的に評価する。
重み付き平均2乗と誤差構造類似度指数を組み合わせたハイブリッド損失関数を設計する。
我々は,モーダル時間的相関とエネルギー変位非線形性を捉えるモデルの能力を強化する。
論文 参考訳(メタデータ) (2024-10-08T11:49:18Z) - A 4D Hybrid Algorithm to Scale Parallel Training to Thousands of GPUs [1.7481226034111275]
本稿では,並列訓練における通信を最適化するための4次元(4次元)アプローチを提案する。
AxoNNは最先端のフレームワークであるMegatron-LMを26%上回っている。
理論上のピークFLOP/sの57%、合計182 PFLOP/sを達成している。
論文 参考訳(メタデータ) (2023-05-22T22:41:49Z) - A Hybrid Tensor-Expert-Data Parallelism Approach to Optimize
Mixture-of-Experts Training [13.346719319555943]
Mixture-of-Experts (MoE)は、ベースモデルにわずかにアクティベートされたエキスパートブロックを追加するニューラルネットワークアーキテクチャである。
現在の分散ディープラーニングフレームワークは、大規模なベースモデルで高品質なMoEモデルをトレーニングする能力に制限がある。
本稿では,データ,テンソル,エキスパート並列性を組み合わせた3次元ハイブリッド並列アルゴリズムDeepSpeed-TEDを提案する。
論文 参考訳(メタデータ) (2023-03-11T05:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。