論文の概要: Ministral 3
- arxiv url: http://arxiv.org/abs/2601.08584v1
- Date: Tue, 13 Jan 2026 14:06:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-14 18:27:19.228789
- Title: Ministral 3
- Title(参考訳): ミニストラル3
- Abstract要約: Ministral 3は、計算およびメモリ制約のあるアプリケーションのためのパラメータ効率の高い高密度言語モデルのファミリーである。
汎用目的のための事前訓練されたベースモデル、微調整された命令モデル、複雑な問題解決のための推論モデルである。
各モデルはイメージ理解機能を備えており、すべてApache 2.0ライセンスで提供されている。
- 参考スコア(独自算出の注目度): 159.00690794690678
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce the Ministral 3 series, a family of parameter-efficient dense language models designed for compute and memory constrained applications, available in three model sizes: 3B, 8B, and 14B parameters. For each model size, we release three variants: a pretrained base model for general-purpose use, an instruction finetuned, and a reasoning model for complex problem-solving. In addition, we present our recipe to derive the Ministral 3 models through Cascade Distillation, an iterative pruning and continued training with distillation technique. Each model comes with image understanding capabilities, all under the Apache 2.0 license.
- Abstract(参考訳): 計算・メモリ制約型アプリケーション用に設計されたパラメータ効率の高い高密度言語モデルであるMinistral 3 シリーズを,3B,8B,14B の3つのモデルサイズで導入する。
各モデルサイズに対して、汎用目的のための事前訓練ベースモデル、微調整命令、複雑な問題解決のための推論モデルという3つのバリエーションをリリースする。
さらに, キャッケード蒸留によるミニストラール3モデルの導出法について述べる。
各モデルはイメージ理解機能を備えており、すべてApache 2.0ライセンスで提供されている。
関連論文リスト
- GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching [41.96482857947199]
大規模言語モデル(LLM)は、言語理解と生成において顕著な能力を示している。
LLMは通常、相当なモデルサイズを持ち、デプロイメントと推論において大きな課題をもたらします。
そこで我々は, モデルモデルから層を戦略的に組み合わせたり, マージしたりすることで, モデルを圧縮するための新しい戦略を開発した。
論文 参考訳(メタデータ) (2025-06-25T14:24:59Z) - Efficient Construction of Model Family through Progressive Training Using Model Expansion [35.743595710122506]
本稿では,進行学習によるモデルファミリの効率的な構築法を提案する。
本手法は,独立に訓練されたモデルに匹敵する性能を維持しつつ,計算コストを約25%削減する。
論文 参考訳(メタデータ) (2025-04-01T10:21:52Z) - Model Assembly Learning with Heterogeneous Layer Weight Merging [57.8462476398611]
モデル統合のための新しいパラダイムであるモデルアセンブリ学習(MAL)を紹介する。
MALは、様々なモデルのパラメータをオープンエンドモデル動物園に統合し、ベースモデルの能力を高める。
論文 参考訳(メタデータ) (2025-03-27T16:21:53Z) - Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging [23.44999968321367]
Soup-of-Expertsは、最小の計算コストでテスト時にモデルをインスタンス化できます。
提案手法は,複数の言語モデリングタスクにおいて,小さな特化モデルを迅速に獲得する方法を実証する。
論文 参考訳(メタデータ) (2025-02-03T20:33:20Z) - The Llama 3 Herd of Models [356.6353861669039]
本稿ではLlama 3と呼ばれる新しい基礎モデルについて述べる。
Llama 3は、多言語性、コーディング、推論、ツール使用をサポートする言語モデルの群れである。
Llama 3は、GPT-4のような主要な言語モデルに匹敵する品質を多くのタスクで提供しています。
論文 参考訳(メタデータ) (2024-07-31T17:54:27Z) - Compact Language Models via Pruning and Knowledge Distillation [61.56557874432008]
ミニトロンモデルでは、スクラッチからのトレーニングに比べてMMLUスコアが最大16%改善している。
すでにトレーニング済みの15Bモデルから8Bと4Bモデルを抽出するには、スクラッチからトレーニングするよりも、モデル毎のトレーニングトークンを最大40倍少なくする必要があります。
論文 参考訳(メタデータ) (2024-07-19T21:47:57Z) - Composing Ensembles of Pre-trained Models via Iterative Consensus [95.10641301155232]
本稿では,異なる事前学習モデルのアンサンブルを構成するための統一的なフレームワークを提案する。
事前学習したモデルを「ジェネレータ」あるいは「スコーラ」として使用し、クローズドループ反復コンセンサス最適化により構成する。
スコアラーのアンサンブルによって達成されたコンセンサスは、シングルスコアラーのフィードバックよりも優れていることを示す。
論文 参考訳(メタデータ) (2022-10-20T18:46:31Z) - Reinforced Multi-Teacher Selection for Knowledge Distillation [54.72886763796232]
知識蒸留はモデル圧縮の一般的な方法です。
現在の方法は、蒸留全体の教師モデルに固定重量を割り当てます。
既存のメソッドのほとんどは、すべての教師モデルに等しい重みを割り当てます。
本論文では,学習例の複雑性や生徒モデル能力の違いから,教師モデルとの違いを学習することで,生徒モデルの蒸留性能の向上が期待できることを考察する。
論文 参考訳(メタデータ) (2020-12-11T08:56:39Z) - Deformation-Aware 3D Model Embedding and Retrieval [37.538109895618156]
与えられたクエリ形状に変形可能な3Dモデルを取得するという新しい問題を導入する。
位置依存型自我中心距離場を利用して非対称な関係を学習する新しいディープ埋め込み手法を提案する。
論文 参考訳(メタデータ) (2020-04-02T19:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。