論文の概要: Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models
- arxiv url: http://arxiv.org/abs/2504.03624v2
- Date: Thu, 10 Apr 2025 05:31:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-04-18 13:29:50.042997
- Title: Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models
- Title(参考訳): Nemotron-H: 高精度かつ効率的なハイブリッドマンバ変圧器モデルの一家系
- Abstract要約: ネモトロン-Hは8Bと56B/47Bハイブリッド・マンバ・トランスフォーマーのファミリーである。
私たちは共通のTransformerモデルアーキテクチャにおけるほとんどの自己注意レイヤをMambaレイヤに置き換えます。
Nemotron-Hモデルは、他の同様のサイズのオープンソーストランスフォーマーモデルと比較して、精度が良いか低いかのどちらかを提供する。
- 参考スコア(独自算出の注目度): 164.47008715747822
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As inference-time scaling becomes critical for enhanced reasoning capabilities, it is increasingly becoming important to build models that are efficient to infer. We introduce Nemotron-H, a family of 8B and 56B/47B hybrid Mamba-Transformer models designed to reduce inference cost for a given accuracy level. To achieve this goal, we replace the majority of self-attention layers in the common Transformer model architecture with Mamba layers that perform constant computation and require constant memory per generated token. We show that Nemotron-H models offer either better or on-par accuracy compared to other similarly-sized state-of-the-art open-sourced Transformer models (e.g., Qwen-2.5-7B/72B and Llama-3.1-8B/70B), while being up to 3$\times$ faster at inference. To further increase inference speed and reduce the memory required at inference time, we created Nemotron-H-47B-Base from the 56B model using a new compression via pruning and distillation technique called MiniPuzzle. Nemotron-H-47B-Base achieves similar accuracy to the 56B model, but is 20% faster to infer. In addition, we introduce an FP8-based training recipe and show that it can achieve on par results with BF16-based training. This recipe is used to train the 56B model. All Nemotron-H models will be released, with support in Hugging Face, NeMo, and Megatron-LM.
- Abstract(参考訳): 推論時間のスケーリングが推論能力を高めるために重要になるにつれて、推論を効率的にするモデルを構築することがますます重要になっている。
提案するNemotron-Hは、8Bと56B/47BのハイブリッドMamba-Transformerモデルで、所定の精度レベルでの推論コストを削減する。
この目的を達成するために、共通のTransformerモデルアーキテクチャにおけるほとんどの自己注意層を、一定の計算を行い、生成されたトークン毎に一定のメモリを必要とするMamba層に置き換える。
我々は、Nemotron-Hモデルが、他の同規模のオープンソーストランスフォーマーモデル(例えば、Qwen-2.5-7B/72BとLlama-3.1-8B/70B)よりも精度が良く、かつ、推論で最大3$\times$高速であることを示す。
推論速度をさらに向上させ, 推論時に必要となるメモリを削減するため, プルーニングによる新しい圧縮とMiniPuzzleと呼ばれる蒸留技術を用いて, 56BモデルからNemotron-H-47B-Baseを開発した。
ネモトロン-H-47B-Baseは56Bモデルと同様の精度を達成しているが、推測より20%高速である。
さらに、FP8ベースのトレーニングレシピを導入し、BF16ベースのトレーニングと同等の結果が得られることを示す。
このレシピは56Bモデルのトレーニングに使用される。
すべてのNemotron-Hモデルがリリースされ、Hugging Face、NeMo、Megatron-LMがサポートされる。
関連論文リスト
- Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs [58.395498136166395]
Nemotron-Labs-3-Puzzle-75B-A9BはNemotron-3-Superの圧縮型で、対話的な展開に最適化されている。
単一の8xB200ノード上の対話型サービスワークロードでは、Puzzle-75B-A9BはNemotron-3-Superより約2倍高いサーバスループットを実現している。
論文 参考訳(メタデータ) (2026-07-05T16:00:29Z) - Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning [262.0414794728708]
ネモトロン3スーパーの事前学習、後学習、量子化について述べる。
Nemotron 3 Superは1200億(アクティブ120億)のパラメータハイブリッドMamba-Attention Mixture-of-Expertsモデルである。
論文 参考訳(メタデータ) (2026-04-14T07:02:32Z) - Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs [80.72350166388601]
Nemotron Elasticは推論指向のLLMを構築するためのフレームワークである。
ネストしたサブモデルを単一の親モデルに組み込む。
これらのサブモデルはそれぞれ、親モデルと重みを共有し、デプロイ中にゼロショットを抽出できる。
論文 参考訳(メタデータ) (2025-11-20T18:59:21Z) - SpikingBrain: Spiking Brain-inspired Large Models [42.41339012839023]
SpikingBrainは脳にインスパイアされたモデルの1つである。
線形 LLM である SpikingBrain-7B とハイブリッド線形 MoE LLM である SpikingBrain-76B の2つのモデルを開発した。
我々のモデルは、長期トレーニング効率を大幅に改善し、(部分的には)一定メモリとイベント駆動スパイクの振る舞いで推論を提供する。
論文 参考訳(メタデータ) (2025-09-05T17:34:00Z) - Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search [42.46046429414803]
Jet-Nemotronはハイブリッドアーキテクチャ言語モデルの新しいファミリーである。
それは、主要なフルアテンションモデルの正確さと一致または超える。
論文 参考訳(メタデータ) (2025-08-21T17:59:08Z) - NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model [205.51647932840226]
Nemotron-Nano-9B-v2は、推論処理のスループットを向上させるために設計されたハイブリッドのMamba-Transformer言語モデルである。
Nemotron-Nano-9B-v2はNemotron-Hアーキテクチャをベースにしており、共通のTransformerアーキテクチャの自己保持層の大部分をMamba-2層に置き換えている。
論文 参考訳(メタデータ) (2025-08-20T06:00:57Z) - Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance [7.261605702995345]
Falcon-H1は、高性能と効率の両方に最適化されたハイブリッドアーキテクチャを備えた、新しい大規模言語モデル(LLM)である。
Falcon-H1は、0.5B, 1.5B, 1.5B-deep, 3B, 7B, 34Bパラメータのベースおよび命令調整型を含む複数の構成でリリースされている。
最大256Kコンテキストトークンと18言語のサポートにより、Falcon-H1は幅広いアプリケーションに適している。
論文 参考訳(メタデータ) (2025-07-30T07:55:33Z) - Efficient Hybrid Language Model Compression through Group-Aware SSM Pruning [54.584665518334035]
注意と状態空間モデル(SSM)を組み合わせたハイブリッドアーキテクチャは、最先端の精度と実行時のパフォーマンスを達成する。
近年の研究では、アテンションのみのモデルに圧縮と蒸留を適用することで、トレーニングコストのごく一部でより小さく、より正確なモデルが得られることが示されている。
本稿では,SSMブロックの構造的整合性とそのシーケンスモデリング機能を維持するグループ対応プルーニング戦略を提案する。
論文 参考訳(メタデータ) (2025-04-15T17:26:29Z) - Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners [72.37408197157453]
近年の進歩により、大規模言語モデル(LLM)の性能は、テスト時に計算資源をスケーリングすることで大幅に向上することが示されている。
複雑性が低いモデルは、より優れた生成スループットを活用して、固定された計算予算のために同様の大きさのトランスフォーマーを上回りますか?
この問題に対処し、強い四分法的推論器の欠如を克服するために、事前訓練された変換器から純およびハイブリッドのマンバモデルを蒸留する。
論文 参考訳(メタデータ) (2025-02-27T18:08:16Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z) - Scaling Inference-Efficient Language Models [3.271571137474847]
モデルアーキテクチャは推論レイテンシに影響を与えており、同じサイズのモデルでは最大3.5倍のレイテンシの差が生じる可能性がある。
我々は、モデルパラメータ数、トレーニングトークンの数、モデルアーキテクチャを共最適化するために、Chinchillaスケーリングの法則を変更します。
我々はMorph-1Bモデルをリリースし、オープンソースモデルと比較して下流タスクの精度を保ちながら、推論遅延を1.8倍改善した。
論文 参考訳(メタデータ) (2025-01-30T03:16:44Z) - Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA [8.305827430948654]
キー-値ヘッドの圧縮比が全くないGQAモデルにMHAモデルをプルーニングするための低コストな手法を提案する。
我々の戦略は、LLaMA2-7Bモデルのキー値ヘッドの87.5%を、過剰な性能劣化を伴わずに圧縮することができる。
論文 参考訳(メタデータ) (2024-12-30T03:05:45Z) - Puzzle: Distillation-Based NAS for Inference-Optimized LLMs [17.72841008597783]
大きな言語モデル(LLM)は優れた能力を提供するが、高い推論コストは広く採用を制限する。
本稿では,LLMの推論を高速化するハードウェア対応フレームワークであるPuzzleについて述べる。
Llama-3.1-Nemotron-51B-Instruct (Nemotron-51B) はLlama-3.1-70B-Instructから派生した一般公開モデルである。
論文 参考訳(メタデータ) (2024-11-28T13:45:42Z) - The Mamba in the Llama: Distilling and Accelerating Hybrid Models [76.64055251296548]
注目層からの線形射影重みを学術的なGPU資源で再利用することにより,大規模な変換器を線形RNNに蒸留する方法を示す。
結果として得られたハイブリッドモデルは、チャットベンチマークのオリジナルのTransformerに匹敵するパフォーマンスを達成する。
また,Mambaとハイブリッドモデルの推論速度を高速化するハードウェア対応投機的復号アルゴリズムを導入する。
論文 参考訳(メタデータ) (2024-08-27T17:56:11Z) - An Empirical Study of Mamba-based Language Models [69.74383762508805]
Mambaのような選択的な状態空間モデル(SSM)はトランスフォーマーの欠点を克服する。
同じデータセット上で訓練された8B-context Mamba, Mamba-2, Transformer モデルを直接比較する。
8BのMamba-2-Hybridは、12の標準タスクで8BのTransformerを上回っている。
論文 参考訳(メタデータ) (2024-06-12T05:25:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。