論文の概要: Closing the Loop: Practical Training Recipes for Looped Language Models
- arxiv url: http://arxiv.org/abs/2610.00673v1
- Date: Wed, 30 Sep 2026 20:09:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.75333
- Title: Closing the Loop: Practical Training Recipes for Looped Language Models
- Title(参考訳): ループを閉じる - ループ言語モデルのための実践的なトレーニングレシピ
- Abstract要約: ループ言語モデルは、レイヤの共有ブロックを繰り返し適用することで、効果的な深さを増大させる。
既存の大規模なレシピでは、何兆ものトークンを多段階で訓練する必要がある。
ループ型言語モデルの実践的なトレーニングレシピを構築し,3つの主要な結果を得た。
- 参考スコア(独自算出の注目度): 0.6911410576481534
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped language models increase effective depth by repeatedly applying a shared block of layers, but existing large-scale recipes require multi-stage training over trillions of tokens, while the benefits of recurrence remain difficult to separate from differences in data and training. In this work, we establish practical training recipes for looped language models, with three main results. (1) We develop a compute-efficient from-scratch pipeline that reduces the training budget from 7.7T tokens in Ouro to 310B tokens while retaining strong reasoning performance. Pretraining followed by high-quality mid-training, together with learning-rate warmup and stronger exit-gate regularization, enables stable recurrent training without prior multi-stage schedules. (2) Under controlled comparisons, our 1.4B LoopLM outperforms a parameter-matched dense model trained on the same data and token budget on all 12 evaluated benchmarks, including +14 points on GSM8K, +10 on MATH, and +22 on DROP. At matched inference compute, it approaches a 3.9B dense model on mathematical reasoning and reading comprehension while using only 36\% as many parameters. (3) We introduce a minimal recipe for converting pretrained dense models into looped ones: a single learned input-mixing scalar and a smoothed exit loss, with no step-specific parameters. Applied to Qwen3-1.7B-Base, Looped Qwen improves over an identically continued dense baseline on every evaluated benchmark across two data regimes, with statistically clear gains on GSM8K, MATH, and MMLU-Pro on the curated mixture. Together, these results make looped language models substantially cheaper to train from scratch and practical to introduce into existing pretrained checkpoints, while isolating the gains due to recurrence itself.
- Abstract(参考訳): ループ言語モデルは、レイヤの共有ブロックを何度も適用することで、効果的な深さを増大させるが、既存の大規模レシピでは、何兆ものトークンを多段階的にトレーニングする必要がある。
本研究は,ループ型言語モデルの実践的学習方法を確立することを目的として,3つの主要な結果を得た。
1)Ouroの7.7Tトークンから310Bトークンへのトレーニング予算を削減し,強力な推論性能を維持した計算効率の高いオフスクラッチパイプラインを開発した。
プレトレーニングの後、質の高い中級トレーニング、学習速度のウォームアップ、より強力な出口ゲート正規化により、事前のマルチステージスケジュールなしで安定した反復訓練が可能となる。
2) GSM8Kで+14点, MATHで+10点, DROPで+22点を含む,同じデータでトレーニングされたパラメータマッチングされた高密度モデルと, トークン予算で比較した。
一致した推論計算では、数学的推論と可読性に関する3.9Bの高密度モデルにアプローチし、パラメータの36.%しか使用していない。
(3) 学習した1つの入力混合スカラーとスムーズな出口損失をステップ固有のパラメータなしで,事前学習した高密度モデルをループ化するための最小限のレシピを導入する。
Qwen3-1.7Bベースに適用すると、Looped Qwenは2つのデータレシスタンスで評価されたベンチマークで同一に連続した密度のベースラインよりも改善され、GSM8K、MATH、MMLU-Proがキュレートされた混合物で統計的に向上する。
これらの結果により、ループ言語モデルはスクラッチからトレーニングし、既存の事前訓練されたチェックポイントを導入し、繰り返しによる利得を分離する。
関連論文リスト
- SPIRAL: Learning to Search and Aggregate [63.26414719363803]
SPIRALは、言語モデルに3つのプリミティブ全てを統一された推論計算パイプラインの一部として使用するように訓練するフレームワークである。
SPIRALは推論計算で効果的にスケールし、GRPOを最大11$timesのスケーリング効率で上回り、3つの計算プリミティブがスケーリングされた場合、15%高いパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-06-22T17:02:09Z) - Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings [24.462817377406754]
データ制約領域における言語モデルの事前学習を改善する方法について述べる。
私たちは低資源のターゲットとしてアラビア語を使い、補助として英語を使います。
検証損失に関するユニークなターゲットデータと、ダウンストリームタスクの精度に関する2-13$times$とで、パフォーマンスを2--3$times$と同等に向上します。
論文 参考訳(メタデータ) (2026-05-13T09:17:51Z) - Diffusion Language Models are Super Data Learners [61.721441061210896]
ユニークなデータが限られている場合、拡散言語モデル(DLM)は、よりエポックなトレーニングによって、常に自己回帰モデル(AR)を上回ります。
本研究の目的は,(1) 任意の次数モデリング,(2) 反復的双方向 denoising からの超高次計算,(3) モンテカルロ増分という3つの複合的要因に起因する。
論文 参考訳(メタデータ) (2025-11-05T08:17:42Z) - MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes [60.57770396565211]
強い推論能力は、はるかに少ないデータで実現可能であることを示す。
MobileLLM-R50MのAIMEスコアは15.5であり、OLMo-2-1.48Bは0.6、SmolLM-2-1.7Bは0.3である。
論文 参考訳(メタデータ) (2025-09-29T15:43:59Z) - Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs [51.21041884010009]
Ring-liteは、強化学習(RL)により最適化されたMixture-of-Experts(MoE)ベースの大規模言語モデルである
我々のアプローチは、挑戦的なベンチマーク上でのSOTA(State-of-the-art)の小規模推論モデルの性能と一致する。
論文 参考訳(メタデータ) (2025-06-17T17:12:34Z) - R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning [23.795932850992816]
R1-Code-Interpreterは,マルチターン制御微調整(SFT)と強化学習(RL)によって訓練されたテキストのみの大規模言語モデル(LLM)の拡張である。
144種類の多種多様な推論・計画タスクにまたがる汎用コードインタープリタのトレーニングは,タスクの不均一性や有効サンプルの不足による重大な課題を呈している。
最終モデルであるR1-CI-14Bは、37のテストタスクの平均精度を44.1%から72.4%に改善し、テキストのみのGPT-4o (58.6%) と GPT-4o with Code Interpreter (70.9%) を上回りました。
論文 参考訳(メタデータ) (2025-05-27T18:47:33Z) - Efficiently Teaching an Effective Dense Retriever with Balanced Topic
Aware Sampling [37.01593605084575]
TAS-Balancedは、効率的なトピック認識クエリとバランスの取れたマージンサンプリング技術です。
本稿では,2つのTRECディープラーニングトラッククエリセットに対して,最先端の低レイテンシ(クエリ毎64ms)を実現するTAS-Balancedトレーニング手法を提案する。
論文 参考訳(メタデータ) (2021-04-14T16:49:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。