論文の概要: Mach-Mind-4-Flash Technical Report
- arxiv url: http://arxiv.org/abs/2607.09375v1
- Date: Fri, 10 Jul 2026 12:57:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.843367
- Title: Mach-Mind-4-Flash Technical Report
- Title(参考訳): Mach-Mind-4-Flash技術報告
- Abstract要約: Mach-Mind-4-Flashは3Bアクティベートパラメータを持つMixture-of-Experts (MoE)エージェントモデルである。
トレーニング後の最適化は、事前学習計算をスケーリングすることなく、100B-パラメータクラスのモデルと同等かそれ以上のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present Mach-Mind-4-Flash, a 35B-parameter Mixture-of-Experts (MoE) agentic model with 3B activated parameters. Through post-training optimization alone without scaling pre-training compute, the model achieves performance on par with or surpassing that of 100B-parameter-class models. By introducing scalable agentic interaction environments for large-scale reinforcement learning, the model attains significant performance gains on real-world application tasks. Our pipeline comprises three stages: (1) a unified RL/OPD training infrastructure with dynamic multi-teacher scheduling and operator-level acceleration, delivering 17\% end-to-end training speedup; (2) multiple domain-specific RL experts trained in parallel across Reasoning, General, and Agent tracks, then fused into a single generalist via Multi-Teacher On-Policy Distillation (MOPD) -- a routed reverse-KL objective that eliminates the see-saw degradation of mixed-reward RL; (3) Hybrid Median-length Policy Optimization (HMPO), a single-stage token-efficiency method that compresses reasoning chains by 19--46\% with $\le$0.7 percentage-point accuracy loss. Mach-Mind-4-Flash scores 92.70 on AIME'26, 82.82 on IFBench, 80.74 on Behavioral-SafetyBench, 75.80 on BFCL-v4, 72.31 on BrowseComp-zh, and 84.20 on ClawBench -- leading or matching models with 10--30$\times$ its activated size at a fraction of the inference cost.
- Abstract(参考訳): 3B アクティベートパラメータを持つ 35B パラメータ混合 (MoE) エージェントモデルである Mach-Mind-4-Flash を提案する。
事前学習計算をスケーリングすることなく、トレーニング後の最適化だけで、100Bパラメータクラスのモデルと同等かそれ以上のパフォーマンスを達成できる。
大規模強化学習のためのスケーラブルなエージェントインタラクション環境を導入することで、このモデルは現実世界のアプリケーションタスクにおいて大きなパフォーマンス向上を達成することができる。
このパイプラインは,(1)動的マルチテラースケジューリングとオペレータレベルのアクセラレーションを備えた統合RL/OPDトレーニングインフラストラクチャ,(2)推論,ジェネラル,エージェントトラックを並行してトレーニングした複数のドメイン固有RL専門家,(3)混合リワードRLのシーソー劣化を解消する経路付き逆KL目標,(3)HMPO(Hybrid Median-length Policy Optimization)の3段階からなる。
Mach-Mind-4-Flash scores 92.70 on AIME'26, 82.82 on IFBench, 80.74 on Behavioral-SafetyBench, 75.80 on BFCL-v4, 72.31 on BrowseComp-zh, 84.20 on ClawBench -- leading or matching models with 10-30$\times$ its activated size at a fraction of the inference cost。
関連論文リスト
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD [91.71050339479261]
本稿では,Ascend NPU SuperPODにおけるエンドツーエンド最適化手法を提案する。
モデルレベルの並列性、計算通信オーケストレーション、低レベルのカーネル実行にまたがる階層的最適化フレームワークを開発した。
その結果、34.22%のモデルFLOP(Model FLOP)利用が達成され、オープンソースのベースラインレシピよりも2.93倍改善された。
論文 参考訳(メタデータ) (2026-07-22T13:49:17Z) - NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research [5.287668610154937]
トレーニング後のアライメントは、大きな言語モデルの能力に従って、推論と人間の好みを決定する。
この研究は、Qwen3-8Bベース上に構築された完全に透明でアブレーション駆動のポストトレーニングパイプラインであるNebulaExpを提示する。
論文 参考訳(メタデータ) (2026-06-25T07:03:25Z) - JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency [56.46698214215968]
JoyAI-LLM Flashは、強力なパフォーマンスとトークン効率のトレードオフを再定義するために設計された、効率的なMixture-of-Experts (MoE)言語モデルである。
JoyAI-LLM Flashは20兆トークンの巨大なコーパスで事前トレーニングされており、厳格なポストトレーニングパイプラインを通じてさらに最適化されている。
論文 参考訳(メタデータ) (2026-04-03T13:52:38Z) - PRISM: Demystifying Retention and Interaction in Mid-Training [20.198164159173647]
PRISMは、大規模言語モデルにおける中級学習設計の選択に関する総合的な実証的研究である。
約27Bの高品位トークンの中間トレーニングでは, 数学では+15から+40点, コードでは+5から+12点, 科学ベンチマークでは+6から+13点, 一般性能は+6から+13点となる。
論文 参考訳(メタデータ) (2026-03-17T19:04:33Z) - Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters [169.7981969517903]
Step 3.5 Flashは、フロンティアレベルのエージェントインテリジェンスと計算効率を橋渡しする。
エージェントを構築する上で最も重要なもの、すなわち、シャープな推論と高速で信頼性の高い実行に重点を置いています。
論文 参考訳(メタデータ) (2026-02-11T07:53:51Z) - Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models [0.0]
大規模言語モデルにおけるマルチホップ文脈推論の制御に関する研究について述べる。
マルチエージェントシステムは逆パターンを示し、ルールベースのメソッドが失敗する推論タスクを最大80%達成する。
論文 参考訳(メタデータ) (2026-01-06T20:18:55Z) - Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model [100.86587937568832]
Ring-1Tは、数兆のパラメータを持つ最初のオープンソースの最先端の思考モデルである。
総パラメータは1兆で、1トークンあたり約500億を活性化する。
論文 参考訳(メタデータ) (2025-10-21T17:46:14Z) - Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning [29.605396813225386]
マルチターン対話型タスクにおけるエージェントの訓練に強化学習をどのように利用できるかを示す。
本手法は,オープンウェイトモデルを用いた多ターン対話タスクのための有能エージェントの訓練のための実践的アプローチを提供する。
論文 参考訳(メタデータ) (2025-08-05T14:30:47Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z) - Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs [51.21041884010009]
Ring-liteは、強化学習(RL)により最適化されたMixture-of-Experts(MoE)ベースの大規模言語モデルである
我々のアプローチは、挑戦的なベンチマーク上でのSOTA(State-of-the-art)の小規模推論モデルの性能と一致する。
論文 参考訳(メタデータ) (2025-06-17T17:12:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。