論文の概要: MiniMax-01: Scaling Foundation Models with Lightning Attention
- arxiv url: http://arxiv.org/abs/2501.08313v1
- Date: Tue, 14 Jan 2025 18:50:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-01-15 17:02:04.581381
- Title: MiniMax-01: Scaling Foundation Models with Lightning Attention
- Title(参考訳): MiniMax-01:Lightning注意によるファンデーションモデルのスケーリング
- Abstract要約: MiniMax-Text-01とMiniMax-VL-01は、より長いコンテキストを処理するのに優れた機能を提供する。
MiniMax-Text-01は、トレーニング中に最大100万のトークンに到達でき、推論時に400万のトークンを安価な価格で外挿できる。
私たちのビジョン言語モデルであるMiniMax-VL-01は、512億のビジョン言語トークンによる継続的なトレーニングによって構築されます。
- 参考スコア(独自算出の注目度): 59.38940023647236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce MiniMax-01 series, including MiniMax-Text-01 and MiniMax-VL-01, which are comparable to top-tier models while offering superior capabilities in processing longer contexts. The core lies in lightning attention and its efficient scaling. To maximize computational capacity, we integrate it with Mixture of Experts (MoE), creating a model with 32 experts and 456 billion total parameters, of which 45.9 billion are activated for each token. We develop an optimized parallel strategy and highly efficient computation-communication overlap techniques for MoE and lightning attention. This approach enables us to conduct efficient training and inference on models with hundreds of billions of parameters across contexts spanning millions of tokens. The context window of MiniMax-Text-01 can reach up to 1 million tokens during training and extrapolate to 4 million tokens during inference at an affordable cost. Our vision-language model, MiniMax-VL-01 is built through continued training with 512 billion vision-language tokens. Experiments on both standard and in-house benchmarks show that our models match the performance of state-of-the-art models like GPT-4o and Claude-3.5-Sonnet while offering 20-32 times longer context window. We publicly release MiniMax-01 at https://github.com/MiniMax-AI.
- Abstract(参考訳): 我々は,MiniMax-Text-01とMiniMax-VL-01を含むMiniMax-01シリーズを紹介する。
その中核は雷の注意と効率的なスケーリングにある。
計算容量を最大化するために、Mixture of Experts (MoE)と統合し、32のエキスパートと46億の合計パラメータを持つモデルを作成し、各トークンに対して459億が活性化される。
我々は、MoEと雷の注意のための最適化された並列戦略と高度に効率的な計算・通信重複技術を開発した。
このアプローチは、数百万のトークンにまたがるコンテキストにわたって、数十億のパラメータを持つモデルに対して、効率的なトレーニングと推論を可能にする。
MiniMax-Text-01のコンテキストウィンドウは、トレーニング中に最大100万のトークンに到達し、安価なコストで推論中に400万のトークンを外挿することができる。
私たちのビジョン言語モデルであるMiniMax-VL-01は、512億のビジョン言語トークンによる継続的なトレーニングによって構築されます。
GPT-4oやClaude-3.5-Sonnetのような最先端モデルの性能に一致し、20~32倍のコンテキストウィンドウを提供する。
MiniMax-01 を https://github.com/MiniMax-AI で公開しています。
関連論文リスト
- Opt.Gear Technical Report [3.573729952898132]
OptGearは、デバイス上での効率的なデプロイメント、リアルタイム推論、強力なタスク能力のために設計された基盤モデルである。
密度モデル(1M、270M、1B)で、コンテキスト長は64Kである。
OptGear-1MはARM Cortex-M7 CPU上でW4A32量子化で20TPSを達成した最初の生成言語モデルである。
論文 参考訳(メタデータ) (2026-08-02T06:43:25Z) - MiniMax Sparse Attention [16.750980846187343]
MiniMax Sparse Attention (MSA)は、Grouped Query Attention (GQA)上に構築されたブロックワイズスパースアテンションである。
軽量インデックスブランチはキー値ブロックをスコアし、GQAグループ毎にTop-kサブセットを独立に選択する。
メインブランチは、選択されたブロックのみに対して正確なブロックスパースアテンションを実行する。
論文 参考訳(メタデータ) (2026-06-11T14:23:41Z) - Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models [63.96252564303143]
Embodied-R1.5は統合されたEmbodied Foundation Model(EFM)であり、包括的エンボディド推論機能を統合する。
我々は15B以上のトークンからなる大規模データシステムを構築し、マルチタスクバランスのRLレシピを設計する。
8Bパラメータしか持たず、Embodied-R1.5 SOTAは24のVLMベンチマークのうち16で、Gemini-Robotics-ER-1.5やGPT-5.4といった主要なモデルを上回った。
論文 参考訳(メタデータ) (2026-06-09T18:07:50Z) - MolmoAct2: Action Reasoning Models for Real-world Deployment [67.6315757474802]
MolmoAct2は、実用的なデプロイメントのために構築された、完全にオープンなアクション推論モデルである。
空間的および具体的推論に特化した VLM バックボーンである MolmoER を紹介する。
低コストプラットフォームにまたがる3つの新しいデータセットをリリースする。
論文 参考訳(メタデータ) (2026-05-04T17:51:21Z) - RadLite: Multi-Task LoRA Fine-Tuning of Small Language Models for CPU-Deployable Radiology AI [1.5161700234179216]
大型言語モデル(LLM)は放射線学において有望であるが、その展開は資源制約された臨床環境での使用を妨げる計算要求によって制限されている。
我々は,340億個のパラメータからなる小型言語モデル (SLM) が,LoRAファインチューニングによるマルチタスク・ラジオロジーの性能向上を実現し,コンシューマグレードのCPUに展開できるかどうかを検討する。
我々の研究は、小型で効率的に調整されたモデルが、GPUを必要としないコンシューマハードウェアに完全にデプロイ可能な、実用的なマルチタスク・ラジオロジーAIアシスタントとして機能することを実証している。
論文 参考訳(メタデータ) (2026-05-01T05:39:08Z) - AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model [40.488271586857884]
AndesVLはQwen3のLLMと様々なビジュアルエンコーダに基づいて0.6Bから4Bのパラメータを持つモバイル側のMLLMのスイートである。
効率的なタスク適応とモデル圧縮を容易にするために,Quantization-Aware LoRA Fine-Tuningフレームワークとともに1+N LoRAアーキテクチャを導入する。
我々は、MediaTek Dimensity 9500チップにAndesVL-4Bをデプロイする際に、最大6.7倍のピーク復号率、最大30.9%のメモリ削減、1.8ビット/ウェイトを実現した。
論文 参考訳(メタデータ) (2025-10-13T15:04:38Z) - LongCat-Flash Technical Report [165.64670448930875]
LongCat-Flashは、560ビリオンパラメータのMixture-of-Experts (MoE)言語モデルである。
計算効率と高度なエージェント能力の両方のために設計されている。
30日以内に20兆トークン以上のモデルトレーニングを完了し、100トークン/秒 (TPS) 以上の推論を0.70パーセントのアウトプットトークンで達成しました。
論文 参考訳(メタデータ) (2025-09-01T10:05:45Z) - MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention [90.68287470551311]
MiniMax-M1は、オープンウェイトで大規模なハイブリッドアテンション推論モデルである。
コンテクストの長さは100万トークンで、DeepSeek R1のコンテクストサイズは8倍だ。
MiniMax-M1は大規模強化学習を用いて訓練されている。
論文 参考訳(メタデータ) (2025-06-16T15:08:02Z) - Test-Time Training Done Right [61.8429380523577]
テスト時間トレーニング(TTT)モデルは、推論中にモデルの重みの一部を適応させることによってコンテキストをモデル化する。
既存のTT手法は、長文データを扱う上で有効性を示すのに苦労した。
我々は,大規模チャンクテストタイムトレーニング(LaCT)を開発し,ハードウェア利用率を桁違いに向上させる。
論文 参考訳(メタデータ) (2025-05-29T17:50:34Z) - OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models [36.0400717590138]
線形構造に基づく最初のマルチモーダル生成モデルであるOmniMambaを提案する。
テキストと画像の両方を、統合された次世代の予測パラダイムで生成する。
JanusFlowと競合し、ベンチマークでShow-oを上回っている。
論文 参考訳(メタデータ) (2025-03-11T17:59:46Z) - Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs [195.24565517943802]
我々はPhi-4-MiniとPhi-4-Multimodalを導入し、コンパクトだが高機能な言語とマルチモーダルモデルを提案する。
Phi-4-Miniは、高品質なウェブおよび合成データに基づいて訓練された3.8ビリオンパラメータ言語モデルである。
Phi-4-Multimodalは、テキスト、ビジョン、音声、音声の入力モーダルを単一のモデルに統合するマルチモーダルモデルである。
論文 参考訳(メタデータ) (2025-03-03T17:05:52Z) - OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference [9.78611123915888]
デバイス上での効率的な推論のための視覚言語モデルであるOmniVLMを提案する。
視覚トークンシーケンスの長さを729から81に短縮し、計算オーバーヘッドを大幅に削減する。
968MのパラメータフットプリントでnanoLLAVAのような既存のベースラインを上回ります。
論文 参考訳(メタデータ) (2024-12-16T06:38:00Z) - Puzzle: Distillation-Based NAS for Inference-Optimized LLMs [17.72841008597783]
大規模言語モデル(LLM)は目覚ましい能力を示しているが、その採用は推論時に高い計算コストによって制限されている。
本稿では,特定のハードウェア上でLLM推論を高速化するフレームワークであるPuzzleについて述べる。
Nemotron-51Bは、バッチサイズが大きい単一のGPU上で推論できる最も正確な言語モデルである。
論文 参考訳(メタデータ) (2024-11-28T13:45:42Z) - Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance [78.48606021719206]
Mini-InternVL は 1B から 4B までのパラメータを持つ一連の MLLM であり、パラメータの 5% しか持たない性能の90% を達成している。
我々は,ダウンストリームタスクにおける特化モデルの転送と性能向上を可能にする,Mini-InternVLの統一適応フレームワークを開発した。
論文 参考訳(メタデータ) (2024-10-21T17:58:20Z) - 1.5-Pints Technical Report: Pretraining in Days, Not Months -- Your Language Model Thrives on Quality Data [0.0]
本稿では,9日間で言語モデル"1.5-Pints"を事前学習するための計算効率のよい手法を提案する。
MT-Bench(人間の判断をエミュレートするベンチマーク)に基づいて、1.5-PintsはAppleのOpenELMとMicrosoftのPhiを上回っている。
これは、自動化された人間によるレビューと手動によるレビューを組み合わせて、57億トークンのトレーニング済みデータセットを慎重にキュレートすることで達成される。
論文 参考訳(メタデータ) (2024-08-07T02:14:52Z) - Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models [62.4691912312317]
Mixture-of-Experts (MoE)言語モデルは、性能を犠牲にすることなく、高密度モデルと比較して計算コストを2~4ドル削減することができる。
本稿では,強力な計算とパラメータ効率を実現するMOEモデル(DS-MoE)のためのハイブリッド密集型トレーニングおよびスパース推論フレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-08T14:39:49Z) - eP-ALM: Efficient Perceptual Augmentation of Language Models [70.47962271121389]
本稿では,既存モデルの適応性を向上するための直接的な取り組みを提案し,認識を伴う言語モデルの拡張を提案する。
視覚言語タスクに事前訓練されたモデルを適用するための既存のアプローチは、その効率を妨げているいくつかの重要なコンポーネントに依存している。
総パラメータの99%以上を凍結し,1つの直線射影層のみをトレーニングし,1つのトレーニング可能なトークンのみを予測することにより,我々のアプローチ(eP-ALM)は,VQAとCaptioningの他のベースラインよりも有意に優れていることを示す。
論文 参考訳(メタデータ) (2023-03-20T19:20:34Z) - Beyond Distillation: Task-level Mixture-of-Experts for Efficient
Inference [17.97893143555333]
Sparse Mixture-of-Experts (MoE) は、トレーニング計算の比例的な増加を伴わずに、多言語翻訳モデルを数十億のパラメータに拡張する手法として成功している。
本研究では, 蒸留をバイパスするためのMoEモデルにおいて, 異なる粒度(トークン, 文, タスク)でのルーティング戦略について検討する。
WMTとWebスケールのデータセットの実験から、タスクレベルのルーティング(task-MoE)によって、大規模なスパースモデルからより小さく、準備の整ったサブネットワークを抽出できることが示唆された。
論文 参考訳(メタデータ) (2021-09-24T20:42:16Z) - CPM-2: Large-scale Cost-effective Pre-trained Language Models [71.59893315671997]
本稿では, PLM を用いた事前学習, 微調整, 推論の効率性問題に対処するための費用対効果技術について述べる。
我々は,既存のPLMをスクラッチからトレーニングする代わりに活用することで,事前学習プロセスの促進を目的とした知識継承を導入する。
計算資源が限られている大規模PLMに対して,新しい推論ツールキット,すなわちInfMoEを実装した。
論文 参考訳(メタデータ) (2021-06-20T15:43:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。