論文の概要: Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs
- arxiv url: http://arxiv.org/abs/2607.04371v1
- Date: Sun, 05 Jul 2026 16:00:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.909939
- Title: Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs
- Title(参考訳): Nemotron-Labs-3-Puzzle-75B-A9B:圧縮ハイブリッドMOE LLM
- Abstract要約: Nemotron-Labs-3-Puzzle-75B-A9BはNemotron-3-Superの圧縮型で、対話的な展開に最適化されている。
単一の8xB200ノード上の対話型サービスワークロードでは、Puzzle-75B-A9BはNemotron-3-Superより約2倍高いサーバスループットを実現している。
- 参考スコア(独自算出の注目度): 58.395498136166395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Nemotron-Labs-3-Puzzle-75B-A9B, a compressed variant of Nemotron-3-Super optimized for interactive deployment. We designed the model to maximize server throughput under high user throughput constraints. In interactive serving workloads on a single 8xB200 node, Puzzle-75B-A9B achieves approximately 2x higher server throughput than Nemotron-3-Super at matched user throughput constraints. In ultra-long-context deployment on a single H100 GPU, the compressed model increases 1M-token concurrency from 1 request to 8 requests. Puzzle-75B-A9B is constructed using a multi-stage pipeline that combines the Iterative Puzzle compression framework with knowledge distillation, reinforcement learning, quantization, and a Multi-Token Prediction head. The compression process jointly optimizes heterogeneous MoE pruning, active parameter budget, and Mamba pruning to improve inference efficiency while preserving model quality. We evaluate Puzzle-75B-A9B on a broad suite of reasoning, coding, multilingual, long-context, and agentic benchmarks. Despite substantial compression, the model retains strong downstream accuracy relative to the parent model across a wide range of tasks. These results demonstrate that large hybrid MoE models can be substantially optimized for deployment efficiency while maintaining strong downstream capability.
- Abstract(参考訳): 我々は,対話的展開に最適化されたNemotron-Labs-3-Puzzle-75B-A9Bを圧縮したNemotron-3-Superを提案する。
高いユーザスループット制約下でサーバスループットを最大化するモデルを設計した。
単一の8xB200ノード上の対話型サービスワークロードでは、Puzzle-75B-A9Bは、一致したユーザのスループット制約でNemotron-3-Superよりも約2倍高いサーバスループットを達成する。
単一のH100 GPU上での超長期コンテキストデプロイメントでは、圧縮されたモデルは、1要求から8要求までの100万件の並行処理を増大させる。
Puzzle-75B-A9Bは、反復的なPuzzle圧縮フレームワークと知識蒸留、強化学習、量子化、マルチトークン予測ヘッドを組み合わせた多段パイプラインで構築されている。
圧縮プロセスは、モデル品質を維持しつつ、不均一なMoEプルーニング、アクティブパラメータ予算、およびマンバプルーニングを共同で最適化し、推論効率を向上させる。
我々はPuzzle-75B-A9Bを、推論、コーディング、多言語、長文、エージェントベンチマークの幅広いスイートで評価した。
かなりの圧縮にもかかわらず、このモデルは幅広いタスクにわたって親モデルと比較して下流の精度が強い。
これらの結果から,大規模なハイブリッドMoEモデルは,下流能力を維持しつつ,展開効率に実質的に最適化できることが示唆された。
関連論文リスト
- Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs [80.72350166388601]
Nemotron Elasticは推論指向のLLMを構築するためのフレームワークである。
ネストしたサブモデルを単一の親モデルに組み込む。
これらのサブモデルはそれぞれ、親モデルと重みを共有し、デプロイ中にゼロショットを抽出できる。
論文 参考訳(メタデータ) (2025-11-20T18:59:21Z) - OverFill: Two-Stage Models for Efficient Language Model Decoding [68.68408155020568]
大規模言語モデル(LLM)は多様なタスクにまたがって優れていますが、高い推論コストのため、デプロイメント上の大きな課題に直面しています。
プリフィルとデコードステージを分離し,精度と効率のトレードオフを最適化するOverFillを提案する。
我々の3B-to-1B OverFill構成は1Bプルーニングモデルを83.2%上回り、8B-to-3B構成は3Bプルーニングモデルを79.2%上回った。
論文 参考訳(メタデータ) (2025-08-11T20:07:34Z) - Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models [192.5620883942846]
ネモトロン-Hは8Bと56B/47Bハイブリッド・マンバ・トランスフォーマーのファミリーである。
私たちは共通のTransformerモデルアーキテクチャにおけるほとんどの自己注意レイヤをMambaレイヤに置き換えます。
Nemotron-Hモデルは、他の同様のサイズのオープンソーストランスフォーマーモデルと比較して、精度が良いか低いかのどちらかを提供する。
論文 参考訳(メタデータ) (2025-04-04T17:41:58Z) - Puzzle: Distillation-Based NAS for Inference-Optimized LLMs [17.72841008597783]
大きな言語モデル(LLM)は優れた能力を提供するが、高い推論コストは広く採用を制限する。
本稿では,LLMの推論を高速化するハードウェア対応フレームワークであるPuzzleについて述べる。
我々は、Llama-3.1-Nemotron-51B-Instruct (Nemotron-51B)とLlama-3.3-Nemotron-49Bという2つの公開モデルを通して、我々のフレームワークの影響を実証する。
論文 参考訳(メタデータ) (2024-11-28T13:45:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。