論文の概要: Instella-MoE Technical Report
- arxiv url: http://arxiv.org/abs/2609.00791v1
- Date: Tue, 01 Sep 2026 06:38:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.420272
- Title: Instella-MoE Technical Report
- Title(参考訳): Instella-MoE 技術報告
- Authors: Jiang Liu, Sudhanshu Ranjan, Prakamya Mishra, Yonatan Dukler, Gowtham Ramesh, Jialian Wu, Ximeng Sun, Wen Xie, Chaojun Hou, Vikram Appia, Zhenyu Gu, Zicheng Liu, Emad Barsoum,
- Abstract要約: Instella-MoEはMixture-of-Experts(MoE)言語モデルで、16億の総パラメータと280億のアクティブパラメータを持つ。
Instella-MoEはAMD Instinct MI300XとMI325Xのグラフィックカードで完全にスクラッチから訓練されている。
- 参考スコア(独自算出の注目度): 22.767094992305257
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we introduce Instella-MoE, a fully open Mixture-of-Experts (MoE) language model with 16 billion total parameters and 2.8 billion active parameters per token, trained entirely from scratch on AMD Instinct MI300X and MI325X GPUs. Instella-MoE combines a sparsely activated MoE design with architectural and system-level innovations, including Gated Multi-head Latent Attention (Gated MLA) and FarSkip-Collective connectivity, enabling efficient large-scale training and inference. The model is developed through a multi-stage pipeline comprising pre-training, mid-training, long-context extension, supervised fine-tuning with feedback-driven data curation, direct preference optimization, and reinforcement learning with Multi-Teacher On-Policy Distillation. Instella-MoE achieves an average score of 76.7 across standard pre-training benchmarks, outperforming prior fully open models including OLMo-3-7B, SmolLM3-3B, and OLMoE-1B-7B, while remaining competitive with open-weight MoE and dense baselines at comparable active-parameter scales, including Moonlight-16B-A3B and Qwen3.5-4B. After post-training, our final Think checkpoint achieves an average score of 73.2 across instruction-following, reasoning, math, coding, and chat benchmarks, outperforming both fully open and open-weight models with comparable or larger active parameter counts in our evaluation. To support transparent and reproducible research, we release the complete Instella-MoE model flow, including model weights, training configurations, data mixtures, and training code. Together, these contributions establish Instella-MoE a strong, fully open foundation for efficient, high-performing MoE models and reproducible research.
- Abstract(参考訳): 本研究では,AMD Instinct MI300XとMI325X GPUでスクラッチから完全にトレーニングされた,合計16億のパラメータと280億のアクティブパラメータを備えた,完全にオープンなMixture-of-Experts(MoE)言語モデルであるInstella-MoEを紹介する。
Instella-MoEは、Gated Multi-head Latent Attention (Gated MLA) やFarSkip-Collective Connectなどのアーキテクチャおよびシステムレベルの革新と疎結合であり、大規模なトレーニングと推論を効率的に行うことができる。
このモデルは、事前学習、中級訓練、長期コンテキスト拡張、フィードバック駆動型データキュレーションによる教師付き微調整、直接選好最適化、マルチTeacher On-Policy Distillationによる強化学習を含む多段階パイプラインによって開発されている。
Instella-MoEは標準トレーニング前のベンチマークで平均76.7のスコアを達成し、OLMo-3-7B、SmolLM3-3B、OLMoE-1B-7Bなど、以前の完全にオープンなモデルよりも優れているが、Moonlight-16B-A3BやQwen3.5-4Bなど、オープンウェイトなMoEや高密度なベースラインと競合する。
学習後、最後のThinkチェックポイントは、インストラクションフォロー、推論、数学、コーディング、チャットベンチマークの平均スコア73.2を達成し、我々の評価において、同等またはより大きいアクティブパラメータ数を持つ完全オープンモデルとオープンウェイトモデルの両方を上回った。
透明で再現可能な研究を支援するため、モデルウェイト、トレーニング構成、データミックス、トレーニングコードを含む、完全なInstella-MoEモデルフローをリリースする。
これらの貢献により、Instella-MoEは効率よく高性能なMoEモデルと再現可能な研究のための、強力で完全にオープンな基盤となった。
関連論文リスト
- Training Communication-Efficient Mixture-of-Experts Language Models with Layer Re-Configuration [13.010351659575297]
通信効率MoEモデル(CE-MoE)
トークンミキシングとチャネルミキシングの深さを分離する異種層パターンを採用する。
31.5Bスケールでは、CE-MoEは平均ダウンストリームスコアと推論スループットを改善しながら、GPU時間を33.3%削減している。
論文 参考訳(メタデータ) (2026-08-28T16:44:50Z) - Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data [55.65426108082807]
Uni-MoE-2.0-Omniをスクラッチから3つのコアコントリビューションで構築しています。
雑用的な理解や、画像、テキスト、音声を生成することができる。
論文 参考訳(メタデータ) (2025-11-16T14:10:55Z) - FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models [19.984973014373118]
FLAME-MoEは7つのデコーダのみのモデルからなる完全にオープンソースな研究スイートである。
FLAME-MoEは、同一のFLOPで訓練された密度の高いベースラインよりも平均精度を最大3.4ポイント向上させる。
論文 参考訳(メタデータ) (2025-05-26T17:06:25Z) - MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining [60.02032710118597]
提案するMiMo-7Bは,学習前の段階と学習後の段階にまたがって最適化された,推論タスクのための大規模言語モデルである。
MiMo-7B-Baseは25兆のトークンで事前訓練されており、性能の向上と推論速度の高速化を目標としている。
最後のRLチューニングモデルであるMiMo-7B-RLは、OpenAI o1-miniの性能を上回り、数学、コード、一般的な推論タスクにおいて優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-12T14:30:11Z) - Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs [111.69640966866059]
ミキチャー・オブ・エキスパート(MoE)と1兆近いパラメータを持つ疎大言語モデル(LLM)が、最も有能な言語モデルの領域を支配している。
本稿では,Ascend NPU上でそのようなスケールを利用するレシピを明らかにすることを目的としている。
主な目的は、動的スパースモデル構造下でのコンピューティングリソースのより良い使用と、実際のハードウェアで期待されるパフォーマンス向上の実現である。
論文 参考訳(メタデータ) (2025-05-07T15:46:36Z) - 2 OLMo 2 Furious [154.15728448754854]
我々は、私たちの完全にオープンな言語の次世代モデルであるOLMo 2を紹介します。
OLMo 2は、7B、13B、32Bスケールの高密度な自己回帰言語モデルを含む。
修正されたモデルアーキテクチャとトレーニングレシピについて説明する。
論文 参考訳(メタデータ) (2024-12-31T21:55:10Z) - MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services [32.278096820269816]
大規模トレーニングと推論の両方において効率を高める新しいMoESysを提案する。
具体的には、トレーニング手順において、提案されたMoESysは、階層ストレージ上の2Dプリフェッチとフュージョン通信を備えたElastic MoEトレーニング戦略を採用する。
単一ノードでのスケーラブルな推論のために、MoESysはCPU-GPUメモリを、モデルをロードするセクションのリングに共同で構築し、効率的な推論のためにラウンドロビン方式でメモリセクション全体で計算タスクを実行する。
論文 参考訳(メタデータ) (2022-05-20T09:09:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。