論文の概要: Domyn-Small: A European 10B Reasoning Language Model
- arxiv url: http://arxiv.org/abs/2607.20448v1
- Date: Wed, 13 May 2026 15:26:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.166206
- Title: Domyn-Small: A European 10B Reasoning Language Model
- Title(参考訳): Domyn-Small: ヨーロッパの10B推論言語モデル
- Abstract要約: 私たちは、MITライセンス下でリリースされたオープンウェイトな推論言語モデルであるDomyn-Smallを紹介します。
Domyn-Smallは、9兆個の多言語データの最初の事前学習フェーズの製品であり、その後、推論、命令フォロー、コンテキスト拡張のための後処理パイプラインが続く。
私たちは、HPCクラスタ上でスケーラブルなLLM推論のためのオープンソースのフレームワークであるDomyn Swarm(Apache2.0)とともに、ウェイトとポストトレーニングのレシピをリリースします。
- 参考スコア(独自算出の注目度): 37.20749071207798
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We introduce Domyn-Small, a 10-billion-parameter open-weight reasoning language model released under the MIT license. Domyn-Small is the product of an initial pre-training phase on 9 trillion tokens multilingual data, followed by a post-training pipeline for reasoning, instruction following, and context extension. For the latter, we performed a Continued Pre-Training (CPT) phase that doubles the native context window to 32K tokens, followed by SFT with a math-focused annealing run. Finally, the RL phase includes GRPO with verifiable rewards, DPO, and a multi-environment GRPO stage spanning five task domains: mathematics, code, multiple-choice QA, instruction-following, and tool calling. The 32K-token native context extends to 128K at inference via YaRN, and a chat-template toggle enables dual-mode reasoning. Against peer models in the 7--10B class (Qwen3.5-9B, OLMo-3-7B-Think, Nemotron-Nano-8B, Ministral-3-8B), Domyn-Small achieves a strong accuracy-efficiency balance: it produces roughly one-third as many tokens as Qwen3.5-9B and approximately 35% of OLMo-3-7B-Think's token budget on core reasoning benchmarks, while delivering strong instruction-following (IFEval 79.9) and competitive science reasoning (GPQA-Diamond 50.0). We release the weights and the post-training recipe alongside Domyn Swarm (Apache~2.0), an open-source framework for scalable LLM inference on HPC clusters developed during this program and used throughout this work.
- Abstract(参考訳): MITライセンス下でリリースされた10ビリオンのオープンウェイト推論言語モデルであるDomyn-Smallを紹介する。
Domyn-Smallは、多言語データの9兆トークンの初期事前トレーニングフェーズの製品であり、その後、推論、命令フォロー、コンテキスト拡張のための後トレーニングパイプラインが続く。
後者では,CPT(Continuoused Pre-Training)フェーズでネイティブコンテキストウィンドウを32Kトークンに倍増し,SFTでは算数中心のアニーリングを実行した。
最後に、RLフェーズは、検証可能な報酬を持つGRPO、DPO、および数学、コード、多重選択QA、命令フォロー、ツール呼び出しの5つのタスクドメインにまたがるマルチ環境GRPOステージを含む。
32KのネイティブコンテキストはYaRN経由で128Kまで拡張され、チャットテンプレートトグルはデュアルモード推論を可能にする。
7--10Bクラス(Qwen3.5-9B、OLMo-3-7B-Think、Nemotron-Nano-8B、Ministral-3-8B)のピアモデルに対して、Domyn-SmallはQwen3.5-9Bのトークンの約3分の1、OLMo-3-7B-Thinkのトークン予算の約35%をコア推論ベンチマークで生成し、強力な命令追跡(IFEval 79.9)と競争科学推論(GPQA-Diamond 50.0)を実現している。
我々は、このプログラムで開発されたHPCクラスタ上でスケーラブルなLLM推論のためのオープンソースのフレームワークであるDomyn Swarm(Apache~2.0)とともに、ウェイトとポストトレーニングのレシピをリリースした。
関連論文リスト
- NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction [76.38136259305638]
NCP-ArchPreviewは、標準のNext-token Prediction(NTP)を超えた自己回帰事前学習を促進する潜在空間言語モデルである。
NCP-ArchPreviewは、製品量化された概念語彙をその隠れ状態から直接構築することで潜在空間を構築し、その後、専用の概念モジュールを通じて将来の概念を予測することを学ぶ。
私たちはこのアーキテクチャを8.9Bパラメータに拡張し、Dolma-3データセットから5.73Tトークンでトレーニングします。
論文 参考訳(メタデータ) (2026-09-09T18:12:43Z) - ZAYA1-8B Technical Report [14.894881882111605]
700Mのアクティブパラメータと8Bの合計パラメータを混合したMoEモデルであるZAYA1-8Bを提案する。
ZAYA1-8BはDeepSeek-R1-0528といくつかの挑戦的な数学とコーディングのベンチマークで一致または超える。
ポストトレーニングでは、数学とパズルのウォームアップを推論する4段階のRLカスケード、400タスクのRLVE-Gymカリキュラム、テストタイムの計算トレースと合成コード環境を備えた数学とコードRLを使用する。
論文 参考訳(メタデータ) (2026-05-06T18:44:08Z) - STEP3-VL-10B Technical Report [115.89015065130127]
STEP3-VL-10Bは、コンパクト効率とフロンティアレベルのマルチモーダルインテリジェンスとのトレードオフを再定義する軽量基盤モデルである。
そこで我々はPallel Coordinated Reasoning(PaCoRe)を実装して,テスト時間計算をスケールし,リソースをスケーラブルな知覚推論に割り当てる。
MMBenchでは92.2%、MMMUでは80.11%、AIME2025では94.43%、MathVisionでは75.95%である。
論文 参考訳(メタデータ) (2026-01-14T17:58:24Z) - Code-enabled language models can outperform reasoning models on diverse tasks [86.29363856881399]
標準命令LMは, 微調整をせずに, 強力な推論器となりうることを示す。
これはCodeAdaptによって実現され、LMは多段階的なコード実行と自然言語推論をインターリーブする。
CodeAdaptは、平均8タスクで、3つのLMが対応するRMを上回ります。
論文 参考訳(メタデータ) (2025-10-23T18:04:03Z) - Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought [23.847410628315544]
英語とターゲット言語を切り替える推論スキーマである**Language-Mixed CoT**を紹介する。
我々は6つのファミリー(Qwen2.5、Llama-3.1、Gemma-3など)でNinveモデル(4B-35B)を訓練する。
我々のベストモデル**KO-REAson-35B*は、平均スコア(64.0 pm 25)で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-05T14:39:41Z) - MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes [60.57770396565211]
強い推論能力は、はるかに少ないデータで実現可能であることを示す。
MobileLLM-R50MのAIMEスコアは15.5であり、OLMo-2-1.48Bは0.6、SmolLM-2-1.7Bは0.3である。
論文 参考訳(メタデータ) (2025-09-29T15:43:59Z) - R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning [23.795932850992816]
R1-Code-Interpreterは,マルチターン制御微調整(SFT)と強化学習(RL)によって訓練されたテキストのみの大規模言語モデル(LLM)の拡張である。
144種類の多種多様な推論・計画タスクにまたがる汎用コードインタープリタのトレーニングは,タスクの不均一性や有効サンプルの不足による重大な課題を呈している。
最終モデルであるR1-CI-14Bは、37のテストタスクの平均精度を44.1%から72.4%に改善し、テキストのみのGPT-4o (58.6%) と GPT-4o with Code Interpreter (70.9%) を上回りました。
論文 参考訳(メタデータ) (2025-05-27T18:47:33Z) - Unlocking Multimodal Mathematical Reasoning via Process Reward Model [48.84458074946185]
Process Reward Models (PRM) は、大規模言語モデルの数学的推論能力を高めることを約束している。
マルチモーダル数学的推論におけるPRMの可能性を解き明かすための第一歩を踏み出す。
URSAは3段階のUnfolding Multimodal Process-Supervision Aided Trainingフレームワークである。
論文 参考訳(メタデータ) (2025-01-08T18:49:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。