論文の概要: When Does Muon Help Agentic Reinforcement Learning?
- arxiv url: http://arxiv.org/abs/2607.16169v2
- Date: Mon, 20 Jul 2026 17:21:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.802443
- Title: When Does Muon Help Agentic Reinforcement Learning?
- Title(参考訳): ムーンはいつエージェント強化学習に役立つのか?
- Abstract要約: Muonは大規模プレトレーニングでAdamWと競合するが、強化学習のポストトレーニングの価値はまだ不明である。
本研究では, ALFWorldにおける単系統比較とAdamWとの比較により, スパース・リワード剤RLのバニラムーンについて検討した。
- 参考スコア(独自算出の注目度): 14.63102636181275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Muon is competitive with AdamW in large-scale pre-training, but its value for reinforcement-learning (RL) post-training remains unclear. We study vanilla Muon in sparse-reward agentic RL through matched single-seed comparisons with AdamW on ALFWorld using Qwen2.5-0.5B-Instruct. Under Group-in-Group Policy Optimization (GiGPO), applying Muon only to hidden weight matrices raises final-window validation success from 0.290 to 0.546 (+88%); high-rate AdamW controls retain no post-update success. The effect depends on the advantage estimator and learning rate. At 3e-5, Muon improves GRPO from 0.161 to 0.268, whereas GraphGPO's late-window gap narrows near saturation. At 1e-5, GraphGPO Muon reaches 0.901, raises normalized validation AUC from 0.399 to 0.556, and reaches 0.5 and 0.75 success 30 and 60 updates earlier, respectively. These exploratory results show that Muon can benefit agentic RL and motivate studying the policy optimizer, advantage estimator, and learning rate jointly.
- Abstract(参考訳): ミュオンは大規模プレトレーニングにおいてAdamWと競合するが、強化学習(RL)のポストトレーニングの価値はまだ不明である。
我々は,Qwen2.5-0.5B-インストラクトを用いたALFWorld上のAdamWとの比較により,スパース逆エージェントRLのバニラムーンについて検討した。
グループ・イン・グループ・ポリシー・オプティマイゼーション(GiGPO)の下では、ムオンを隠れた重量行列のみに適用すると、最終的な検証成功は0.290から0.546(+88%)に上昇する。
この効果は、優位推定器と学習率に依存する。
3e-5では、ミューオンはGRPOを0.161から0.268に改善する一方、GraphGPOの遅風ギャップは飽和付近で狭くなる。
GraphGPO Muon は 1e-5 で 0.901 に達し、正規化バリデーション AUC を 0.399 から 0.556 に引き上げ、それぞれ 0.5 と 0.75 の成功率 30 と 60 の更新を達成した。
これらの探索結果から, ムオンはエージェントRLの恩恵を受け, 政策最適化, 優位推定器, 学習率を共同で研究する動機付けが可能であることが示唆された。
関連論文リスト
- Scaling Muon for Diffusion Transformers [32.20758643343064]
行列対応のMuonは、一方向にわたる更新のバランスをとることで、大規模なモデルトレーニングを改善するが、そのスケーリング動作と、大規模なトランスフォーマー(DiT)のエンドツーエンド効率は、まだ不明である。
まず、1.3B から 15B のパラメータから DiT 上の Muon のスケーリング挙動を定式化し、AdamW に対する最適化と生成的品質上の利点がモデルスケールにわたって持続していることを示した。
各ステップ(K)毎にNS5スペクトルをフルに更新し、残りのステップにおける現在の運動量に基づく低計算・通信コストの行制限更新を適用する周期的Row-wise Muonを導入する。
論文 参考訳(メタデータ) (2026-08-21T07:40:28Z) - Why Muon Outperforms Adam: A Curvature Perspective [49.85900116602357]
Muonは、大規模な言語モデルトレーニングにおいて、Adamよりもトレーニング効率を約2倍改善する。
私たちの研究は、Adamに対するMuonの優位性を曲率の観点から軽視する第一歩を踏み出します。
論文 参考訳(メタデータ) (2026-06-03T09:40:30Z) - Does Your Optimizer Care How You Normalize? Normalization-Optimizer Coupling in LLM Training [0.0]
我々は Dynamic Erf (Derf) が Muon (Jordan, 2024) と大きな負の相互作用をすることを示した。
我々の証拠は、Muonのより高速なスペクトルノルム成長下での2つのエラーモード、すなわち飽和(ロッキー圧縮)とスケールブラインドネスを示している。
ダーフが公表したデフォルトアルファとムーンを併用すると、NaNや発散を発生させることなく0.66ナットの相互作用ペナルティが生じる。
論文 参考訳(メタデータ) (2026-04-02T03:20:58Z) - FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - Muon+: Towards Better Muon via One Additional Normalization Step [18.816463168231618]
我々は,ミュオンの簡易かつ効果的な拡張,すなわちミュオン+を提案する。
モデルスケールとアーキテクチャの広範な事前学習実験を通じて,Muon+の有効性を実証する。
論文 参考訳(メタデータ) (2026-02-25T04:04:00Z) - NorMuon: Making Muon more efficient and scalable [71.49702449498085]
我々はアダムの後継としてノームーンを提案する。
我々は、NorMuonがAdamとMuonの両方を一貫して上回り、Adamより21.74%、Muonより11.31%改善していることを示す。
論文 参考訳(メタデータ) (2025-10-07T01:13:41Z) - Muon Outperforms Adam in Tail-End Associative Memory Learning [118.98991042050532]
機能埋め込みにかかわらず,Muonはクラス間のバランスの取れた学習を一貫して達成している。
我々の経験的観察と理論的分析により、ムオンの核となる利点が明らかとなり、その更新規則は線形連想記憶の外積構造と一致している。
論文 参考訳(メタデータ) (2025-09-30T10:04:08Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。