論文の概要: Loop the Loopies!
- arxiv url: http://arxiv.org/abs/2607.16051v2
- Date: Mon, 20 Jul 2026 15:59:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.784394
- Title: Loop the Loopies!
- Title(参考訳): Loop the Loopies!
- Abstract要約: 2つのMixture-of-Experts(MoE)モデルからなるLoopie級数を示す。
新たなポストトレーニング手法により、Loopieは強力な推論能力を開発し、フロンティアレベルの推論性能を達成する。
- 参考スコア(独自算出の注目度): 15.591167778628625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present the Loopie series, consisting of two Mixture-of-Experts (MoE) models: a 20B-parameter model with 2B active parameters and a 6B-parameter model with 0.6B active parameters. Looped Transformers have long faced a challenge: given an N times increase in pre-training compute, increasing the parameter count by a factor of N usually outperforms looping a model N times. Loopie addresses this challenge. Extensive ablation studies, including comparisons with a vanilla 30B-A3B model, show that Loopie substantially outperforms vanilla Transformer baselines trained with the same compute budget. With a novel post-training method, Loopie develops strong reasoning abilities and achieves frontier-level reasoning performance.
- Abstract(参考訳): 2つのMixture-of-Experts(MoE)モデル: 2Bのアクティブパラメータを持つ20Bパラメータモデルと0.6Bのアクティブパラメータを持つ6BパラメータモデルからなるLoopie級数を提案する。
ループ変換器は長年、課題に直面してきた: 事前学習計算のN倍の増加を考えると、Nの係数によるパラメータ数の増加は、通常、N倍のループ数を上回る。
Loopieはこの課題に対処する。
バニラ30B-A3Bモデルとの比較を含む大規模なアブレーション研究は、Loopieが同じ計算予算でトレーニングされたバニラトランスフォーマーベースラインを大幅に上回っていることを示している。
新たなポストトレーニング手法により、Loopieは強力な推論能力を開発し、フロンティアレベルの推論性能を達成する。
関連論文リスト
- SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers [50.00050394179417]
ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
論文 参考訳(メタデータ) (2026-09-01T14:52:57Z) - Looped State-Space Language Models with Adaptive Exit-State Selection [43.98434319030707]
ループ型言語モデルに関する最近の研究は、多くの推論問題は、追加の独立パラメータよりも計算深度が大きいことを示唆している。
本稿では,共有マンバブロックを繰り返し適用し,有限深度再帰計算を実現するループ型マンバとループ型ハイブリッドマンバ-トランスフォーマアーキテクチャについて検討する。
我々は,Ouroの2段出口ゲートをLooped Mambaに適応させ,繰り返しステップ出力のしきい値制御の選択を行う。
論文 参考訳(メタデータ) (2026-07-11T04:09:19Z) - LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling [72.71005779366162]
本研究では,ゲインコストの観点から,ループ数選択について検討する。
この研究は18Tトークンのスクラッチからループ数が異なるループ数でLoopCoder-v2をトレーニングし、それにマッチした命令チューニングと評価を行う。
実証的には、この2ループ版はコード生成、コード推論、エージェントソフトウェアエンジニアリング、ツールスベンチマークなど、非ループベースラインよりも幅広い利益をもたらしている。
論文 参考訳(メタデータ) (2026-06-16T15:03:05Z) - LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling [36.7482623230111]
スパースルーティングと反復重み付き計算を統合したループ型MoE言語モデルであるLoopMoEを提案する。
設計により、Vanilla MoEに対してループ式MoEを厳格に制御し、ヘッド・ツー・ヘッドで評価することができる。
論文 参考訳(メタデータ) (2026-06-03T04:38:12Z) - Simply Stabilizing the Loop via Fully Looped Transformer [41.240805541680395]
Looped Transformerは、ループイテレーションの数が増えると、トレーニングの不安定性に悩まされる。
実験により、フルループ変換器はトレーニングの安定性を改善し、下流の性能を高め、異なるテスト時間計算予算の下で予備的適応性を提供することを示した。
論文 参考訳(メタデータ) (2026-05-11T07:21:53Z) - Parcae: Scaling Laws For Stable Looped Language Models [35.9547796403241]
従来の固定深度アーキテクチャは、FLOPのトレーニングを増やすことで、通常、より高いメモリフットプリントやデータを犠牲にして、パラメータ化を増やすことで、品質をスケールする。
潜在的に代替となるのがループアーキテクチャであり、ループ内のレイヤブロックを通じてアクティベーションを送信することでFLOPを増大させる。
有望ではあるが、ループ化されたアーキテクチャをトレーニングするための既存のレシピは不安定になり、残余の爆発と損失のスパイクに悩まされる。
本稿では, 負の対角パラメータ化の離散化により, 射出パラメータのスペクトルノルムを制約する新しい安定ループアーキテクチャであるParcaeを提案する。
論文 参考訳(メタデータ) (2026-04-14T16:43:37Z) - LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation [9.943277041891788]
可変長トラジェクタで訓練されたループ変換器であるLoopFormerを導入し、予算条件の推論を可能にする。
私たちのコアコントリビューションは、異なる長さの軌跡を整列するショートカット一貫性トレーニングスキームです。
LoopFormerは、アグレッシブな計算制約下でさえ、言語モデリングと推論ベンチマークで堅牢なパフォーマンスを示す。
論文 参考訳(メタデータ) (2026-02-11T23:58:28Z) - FALCON: Few-step Accurate Likelihoods for Continuous Flows [78.37361800856583]
本稿では,FALCON(Few-step Accurate Likelihoods for Continuous Flows)を提案する。
FALCONは分子ボルツマンサンプリングのための最先端の正規化フローモデルより優れており、同等の性能を持つCNFモデルよりも2桁高速である。
論文 参考訳(メタデータ) (2025-12-10T18:47:25Z) - OverFill: Two-Stage Models for Efficient Language Model Decoding [68.68408155020568]
大規模言語モデル(LLM)は多様なタスクにまたがって優れていますが、高い推論コストのため、デプロイメント上の大きな課題に直面しています。
プリフィルとデコードステージを分離し,精度と効率のトレードオフを最適化するOverFillを提案する。
我々の3B-to-1B OverFill構成は1Bプルーニングモデルを83.2%上回り、8B-to-3B構成は3Bプルーニングモデルを79.2%上回った。
論文 参考訳(メタデータ) (2025-08-11T20:07:34Z) - Comba: Improving Bilinear RNNs with Closed-loop Control [57.800320390698516]
本稿では,これらのモデルの利点と限界を包括的に分析したBilinear RNNの概念を紹介する。
我々は,状態フィードバックと出力フィードバックの両補正を併用した,スカラー+低ランク状態遷移を取り入れた新しいバイリニアRNNであるCombaを提案する。
また,大規模コーパス上での340M/1.3Bパラメータのトレーニングモデルと,ハードウェア効率のよいチャンクワイド並列カーネルを実装した。
論文 参考訳(メタデータ) (2025-06-03T05:44:50Z) - Reasoning with Latent Thoughts: On the Power of Looped Transformers [52.84192961524481]
多くの合成推論問題に対して、$k$層変換器が$L$倍ループしたことが、$kL$層非ループモデルの性能にほぼ一致することを示す。
ループ型および非ループ型モデルは、その有効深さに依存するスケーリングの挙動を示す。
論文 参考訳(メタデータ) (2025-02-24T18:49:05Z) - Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning [47.06427150903487]
CoT(Chain-of-Thought)プロンプトは、言語モデルの推論能力を高めるための強力なテクニックとして登場した。
ループ変換器は目覚ましい長さの一般化能力を有するが、その限定的な一般化と適応性により、自己回帰解の代替として機能することができない。
ループ変換器の強度をよりよく活用するためのRELAYを提案する。
論文 参考訳(メタデータ) (2025-02-12T15:17:04Z) - Gated Linear Attention Transformers with Hardware-Efficient Training [60.670102007737476]
本研究は、並列化性に対してメモリ移動をオフにする線形注意のためのハードウェア効率のアルゴリズムについて述べる。
次に、このアルゴリズムを、データ依存ゲートを用いたより表現力豊かな線形アテンションに一般化する。
変圧器の標準アテンション層に代えて使用すると、結果として生じるゲート状リニアアテンショントランスが競合的に動作することが分かる。
論文 参考訳(メタデータ) (2023-12-11T18:51:59Z) - Finetuning Pretrained Transformers into RNNs [81.72974646901136]
トランスフォーマーは自然言語生成においてリカレントニューラルネットワーク(RNN)を上回っている。
線形複雑リカレント変種は自己回帰生成に適していることが証明されている。
この研究は、事前訓練された変換器を効率の良い再帰変換器に変換することを目的としている。
論文 参考訳(メタデータ) (2021-03-24T10:50:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。