論文の概要: A Sovereign, Open-Source Foundation Model for German and English
- arxiv url: http://arxiv.org/abs/2607.09424v1
- Date: Fri, 10 Jul 2026 13:51:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.855978
- Title: A Sovereign, Open-Source Foundation Model for German and English
- Title(参考訳): ドイツ語と英語のためのオープン・ソース・ファンデーション・モデル
- Abstract要約: Soofi S 30B-A3B(ソフィー S 30B-A3B)は、ドイツのマムバ・トランスフォーマー・ファウンデーション・モデルである。
そのハイブリッド設計はトークン毎に30Bパラメータの3Bのみを起動し、コンテキストが大きくなるにつれて推論キャッシュをほぼ一定に保ちます。
- 参考スコア(独自算出の注目度): 50.08096276509294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Soofi S 30B-A3B, a sovereign, open-source Mixture-of-Experts (MoE) hybrid Mamba Transformer foundation model for German and English. Its hybrid design activates only 3B of 30B parameters per token and keeps the inference cache near-constant as context grows, giving it a decisive throughput advantage over dense models for long-context, high-concurrency deployment. Pretrained on roughly 27 trillion tokens with deliberately up-weighted German, Soofi S matches dense 14 to 27B models on aggregate English and German benchmarks while achieving the best code aggregates in both languages among 17 open base models, and outperforms every European sovereign baseline in our comparison, including ones far larger in active parameters. Among fully open models, Soofi S obtains the highest English and German evaluation scores, ahead of Olmo 3 32B and Apertus 70B. Soofi S was built end-to-end on the German Industrial AI Cloud, a sovereign HPC scale AI infrastructure operated by Deutsche Telekom in Munich. Soofi S will be released under highly permissive, open-access terms: weights, selected intermediate checkpoints, full per-source data accounting, hyperparameters, and training and evaluation code. Where source licenses permit, data-construction artifacts are released under permissive licenses; commercially licensed sources are documented with aggregate statistics and exact mixture accounting.
- Abstract(参考訳): 本稿では,Soofi S 30B-A3Bについて紹介する。S30B-A3Bは,ドイツ語と英語のためのオープンソースMixture-of-Experts(MoE)ハイブリッドMamba Transformer基盤モデルである。
そのハイブリッド設計はトークンあたりの30Bパラメータの3Bのみを起動し、コンテキストが大きくなるにつれて推論キャッシュをほぼ一定に保つ。
Soofi Sは、意図的に重み付けされたドイツの約27兆のトークンに基づいて、英語とドイツ語のベンチマークで14から27Bのモデルにマッチすると同時に、17のオープンベースモデルの中で両方の言語で最高のコードアグリゲーションを実現しています。
完全にオープンなモデルの中では、Sはオルモ332Bとアペルトゥス70Bに先んじて、英語とドイツ語の評価スコアが最高である。
Soofi SはミュンヘンのDeutsche Telekomが運営する独立したHPCスケールAIインフラストラクチャであるDeutsche Industrial AI Cloud上に、エンドツーエンドで構築された。
Soofi Sは、ウェイト、選択された中間チェックポイント、完全なソースごとのデータ会計、ハイパーパラメータ、トレーニングと評価コードという、非常に寛容でオープンな用語でリリースされる。
ソースライセンスが許すところでは、データ構築アーティファクトはパーミッシブライセンスの下でリリースされ、商用ライセンスのソースは、集計統計と正確な混合会計によって文書化されている。
関連論文リスト
- DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search [2.0669978569487384]
英語の教師が翻訳学習を通して多言語検索にどのように移行するかを示す。
我々はまず、34の公開ソースにわたる1.4Bペアから665万の英語コントラスト事前学習ペアを再構築し、キュレートした。
検証された英語データを8言語に翻訳し、2.8B対の言語間サンプルを生成する。
論文 参考訳(メタデータ) (2026-07-29T17:50:51Z) - LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening [69.1037790901185]
現実的な状況シナリオから構築した中国の論理的推論ベンチマークLLMEval-Logicを提案する。
パイプラインのフォワードオーサとエキスパート-オーディット 自然言語アイテムは、参照の形式化とともに、Z3による注釈付き回答を検証し、自然言語から形式へのグレーディングのためのエキスパートルーブリックを構築し、クローズドループの逆行ワークフローを通じて選択されたアイテムを硬化させる。
論文 参考訳(メタデータ) (2026-05-19T09:40:29Z) - EngGPT2: Sovereign, Efficient and Open Intelligence [0.0]
EngGPT2はSovereign、Efficient、Openモデルとして構築されている。
Qwen3の36TやLlama3の15Tよりも少ない2.5兆のトークンでトレーニングされています。
MMLU-Pro、GSM8K、IFEval、HumanEvalなど、主要なベンチマークのパフォーマンスを提供する。
論文 参考訳(メタデータ) (2026-03-17T12:08:35Z) - The German Commons - 154 Billion Tokens of Openly Licensed Text for German Language Models [41.865590656976316]
ドイツ・コモンズ(ドイツ語: German Commons)は、ドイツで公にライセンスされたテキストのコレクションである。
41のソースから7つのドメインにまたがるデータをコンパイルし、法律、科学、文化、政治、ニュース、経済、ウェブテキストを含む。
論文 参考訳(メタデータ) (2025-10-15T18:24:26Z) - MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes [60.57770396565211]
強い推論能力は、はるかに少ないデータで実現可能であることを示す。
MobileLLM-R50MのAIMEスコアは15.5であり、OLMo-2-1.48Bは0.6、SmolLM-2-1.7Bは0.3である。
論文 参考訳(メタデータ) (2025-09-29T15:43:59Z) - Llama-GENBA-10B: A Trilingual Large Language Model for German, English and Bavarian [0.7039577044513267]
Llama-GENBA-10Bは、大きな言語モデルにおける英語中心バイアスに対処する三言語基礎モデルである。
164Bトークン(82B英語、82Bドイツ語、80Mバイエルン語)で継続的に事前訓練されている。
論文 参考訳(メタデータ) (2025-09-06T10:12:52Z) - YAYI 2: Multilingual Open-Source Large Language Models [53.92832054643197]
我々は,300億のパラメータを持つベースモデルとチャットモデルを含むYAYI 2を提案する。
YAYI 2は、トレーニング済みのデータ処理パイプラインによってフィルタされた2.65兆のトークンを含む多言語コーパス上で、スクラッチから事前トレーニングされる。
ベースモデルは、数百万の指示による教師付き微調整と、人間のフィードバックからの強化学習によって、人間の価値と整合する。
論文 参考訳(メタデータ) (2023-12-22T17:34:47Z) - BERT, mBERT, or BiBERT? A Study on Contextualized Embeddings for Neural
Machine Translation [38.017030073108735]
本稿では,バイリンガル事前学習型言語モデル(BiBERT)が最先端の翻訳性能を実現することを示す。
我々の最良のモデルは、IWSLT'14データセットでは30.45点、IWSLT'14データセットでは38.61点、WMT'14データセットでは31.26点、WMT'14データセットでは34.94点である。
論文 参考訳(メタデータ) (2021-09-09T23:43:41Z) - GottBERT: a pure German Language Model [0.0]
ドイツ語の単一言語RoBERTaモデルはまだ公開されておらず、本書で紹介する(GottBERT)。
評価では、名前付きエンティティ認識(NER)タスクのConll 2003 と GermEval 2014 と、GermEval 2018 (微細で粗い) と GNAD のテキスト分類タスクと、既存のドイツの単一言語 BERT モデルと2つの多言語タスクのパフォーマンスを比較した。
GottBERTはRoBERTa BASEアーキテクチャを使って256コアのTPUポッドで事前訓練に成功した。
論文 参考訳(メタデータ) (2020-12-03T17:45:03Z) - Incorporating BERT into Parallel Sequence Decoding with Adapters [82.65608966202396]
本稿では,2種類のBERTモデルをエンコーダとデコーダとして取り出し,シンプルで軽量なアダプタモジュールを導入し,それらを微調整する。
我々は、ソース側およびターゲット側BERTモデルに含まれる情報を協調的に活用できるフレキシブルで効率的なモデルを得る。
我々のフレームワークは、BERTの双方向および条件独立性を考慮した、Mask-Predictという並列シーケンス復号アルゴリズムに基づいている。
論文 参考訳(メタデータ) (2020-10-13T03:25:15Z) - Nearest Neighbor Machine Translation [113.96357168879548]
我々は、$k$-nearest-neighbor machine translation(k$NN-MT)を紹介する。
キャッシュされたサンプルの大きなデータストア上で、最も近い隣の分類器でトークンを予測する。
多くの設定で一貫してパフォーマンスが向上する。
論文 参考訳(メタデータ) (2020-10-01T22:24:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。