論文の概要: Motif 3: Technical Report
- arxiv url: http://arxiv.org/abs/2608.09119v1
- Date: Mon, 10 Aug 2026 04:53:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.08433
- Title: Motif 3: Technical Report
- Title(参考訳): Motif 3: テクニカルレポート
- Abstract要約: トークン毎に合計314億のパラメータと132億のアクティベートを持つデコーダのみのMixture-of-Experts言語モデルを導入する。
MoEレイヤには384のルーティング専門家が含まれており、トークン毎に8つの選択がある。
我々は、Webドキュメント、STEM、コード、数学、多言語コンテンツ、ドメイン特化コーパスにまたがる約12.5兆のトークンでMotif 3を事前訓練する。
- 参考スコア(独自算出の注目度): 26.937626894426916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Motif 3, a decoder-only Mixture-of-Experts language model with 314 billion total parameters and 13.2 billion activated per token. Each sparse MoE layer contains 384 routed experts, with eight selected per token. This fine-grained sparsity provides substantial expert capacity while limiting computation. Motif 3 is built around Grouped Differential Latent Attention (GDLA), which integrates grouped differential attention with the compressed key-value representation of Multi-head Latent Attention. The architecture further incorporates modified manifold-constrained hyper-connections, Expert Specific PolyNorm activations, and multi-token prediction to improve optimization stability, expert specialization, and inference efficiency. We pretrain Motif 3 on approximately 12.5 trillion tokens spanning web documents, STEM, code, mathematics, multilingual content, and domain-specialized corpora. Expert-balancing and numerical-stabilization techniques support stable training at scale, while selective MXFP8 computation and communication, memory-efficient fused kernels, and window-aware context parallelism enable training with context lengths up to 256K tokens. Our post-training pipeline combines general supervised fine-tuning, six specialist teachers trained with reinforcement learning, a software-engineering teacher trained with supervised fine-tuning, and Multi-teacher On-Policy Distillation. The resulting unified model consolidates complementary capabilities in reasoning, coding, tool use, professional work, long-context understanding, calibrated abstention, and instruction following. Across a broad evaluation suite, Motif 3 demonstrates competitive performance against leading open weight models, including strong results on long-horizon agentic tasks, mathematical reasoning, scientific knowledge, and hallucination-sensitive evaluation.
- Abstract(参考訳): 314億の総パラメータを持つデコーダのみのMixture-of-Experts言語モデルであるMotif 3を紹介します。
各スパースMoE層には384のルーティング専門家がおり、トークンごとに8つの選択がある。
このきめ細かい空間は、計算を制限しながらかなりの専門能力を提供します。
Motif 3 は Grouped Differential Latent Attention (GDLA) を中心に構築されている。
このアーキテクチャには、修正された多様体に制約されたハイパーコネクション、Expert Specific PolyNormアクティベーション、最適化安定性、エキスパート特殊化、推論効率を改善するためのマルチトークン予測が含まれている。
我々は、Webドキュメント、STEM、コード、数学、多言語コンテンツ、ドメイン特化コーパスにまたがる約12.5兆のトークンでMotif 3を事前訓練する。
エキスパートバランシングと数値安定化技術は、MXFP8計算と通信、メモリ効率の高い融合カーネル、ウィンドウ認識のコンテキスト並列性により、最大256Kトークンまでのコンテキスト長でのトレーニングを可能にする。
ポストトレーニングパイプラインには、一般的な教師による微調整、強化学習を専門とする6人の専門教師、教師による微調整を専門とするソフトウェア工学の教師、マルチ教師による多目的蒸留が組み合わされている。
結果として得られる統一モデルは、推論、コーディング、ツールの使用、専門的な作業、長いコンテキスト理解、校正された棄権、そして次の指示における補完的な能力を統合する。
幅広い評価スイート全体にわたって、Motif 3は、長い水平なエージェントタスク、数学的推論、科学的知識、幻覚に敏感な評価に関する強力な結果を含む、主要なオープンウェイトモデルに対する競争性能を示している。
関連論文リスト
- Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles [32.54156025863882]
強化学習駆動オーケストレーションフレームワークであるMaestroを紹介します。
Maestroは、階層的なモデルスキルレジストリ上でのシーケンシャルな意思決定プロセスとして、異質なマルチモーダルタスクを再構成する。
数学的推論,チャート理解,高分解能知覚,ドメイン固有分析を対象とする10の代表的なマルチモーダルベンチマークに対して,Maestroの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T08:47:49Z) - InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing [87.5130783098133]
InternVL-Uは、マルチモーダル理解と推論機能を民主化する軽量な4BパラメータUMMである。
MLLM(Multimodal Large Language Model)と特殊なMMDiTベースのビジュアルジェネレーションヘッドを統合している。
BAGEL (14B) など,さまざまな生成タスクや編集タスクにおいて,3倍以上のスケールで統一ベースラインモデルを上回るパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-10T16:38:33Z) - Scalable Training of Mixture-of-Experts Models with Megatron Core [26.9162079065285]
MOE(Scaling Mixture-of-Experts)トレーニングでは、密集したモデルに欠けているシステムの課題が導入されている。
各トークンは専門家のサブセットのみを活性化するため、このスパーシリティにより、トータルパラメータはトーケン計算よりもはるかに高速に成長できる。
メモリ(微細な再計算,オフロード,通信,計算)の統合最適化により,MoEトレーニングにおけるこれらの課題に対処する。
論文 参考訳(メタデータ) (2026-03-08T15:42:43Z) - DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing [67.77471070868852]
DeepGen 1.0は、画像生成と編集のための軽量な5B統一モデルである。
わずか5000万のサンプルでトレーニングされており、WISEでは80BのHunyuan Imageを28%、UniREditBenchでは27BのQwen-Image-Editを37%上回っている。
トレーニングコード、ウェイト、データセットをオープンソース化することで、統合マルチモーダルリサーチを民主化する、効率的で高性能な代替手段を提供します。
論文 参考訳(メタデータ) (2026-02-12T17:44:24Z) - Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models [78.73992315826035]
ネイティブエージェントインテリジェンスと高い計算効率を調和させる軽量言語モデルであるYoutu-LLMを紹介する。
Youtu-LLMは、スクラッチから体系的に推論と計画能力の育成まで事前訓練されている。
論文 参考訳(メタデータ) (2025-12-31T04:25:11Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - Motif 2 12.7B technical report [8.084150960631142]
Motif-2-12.7Bは、大規模言語モデルの効率フロンティアを推し進める新しいオープンウェイト基盤モデルである。
モデルは、様々な言語、数学、科学、プログラミングドメインにまたがる5.5兆のトークンで事前訓練されている。
ポストトレーニングでは、一般的な命令順守、構成的理解、言語的正確性を高める3段階の教師付き微調整パイプラインが採用されている。
論文 参考訳(メタデータ) (2025-11-07T10:32:16Z) - Multi-Head Mixture-of-Experts [100.60556163597946]
MH-MoE(Multi-Head Mixture-of-Experts)を提案する。
MH-MoEは、他のSMoE最適化手法の実装と分離が容易であり、性能向上のために他のSMoEモデルとの統合が容易である。
論文 参考訳(メタデータ) (2024-04-23T13:47:09Z) - Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models [93.92762966380793]
大規模言語モデル(LLM)は、3つのドメインすべてにまたがって高いパフォーマンスを同時に達成しようと試みている。
本稿では,すでに高度に特殊化されているモデルを融合する手法を提案する。
提案されているハウジングフレームワークであるUltraFuserは、すでに言語、コーディング、数学について十分に訓練されている3つの異なるスペシャリストで構成されている。
論文 参考訳(メタデータ) (2024-03-13T06:18:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。