論文の概要: Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
- arxiv url: http://arxiv.org/abs/2607.12395v2
- Date: Thu, 16 Jul 2026 03:43:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.216577
- Title: Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
- Title(参考訳): Ring-Zero:創発的推論のためのゼロRLをトリリオンパラメータにスケーリングする
- Authors: Xinyu Tang, Qianggang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou,
- Abstract要約: 人間の注釈のない検証可能な報酬による強化学習は、しばしばゼロRLと呼ばれ、思考の連鎖的推論を引き出すための強力なパラダイムとして現れている。
我々はモデルから高品質な推論行動を引き出すことを目指している。
単純なスケーリングは、可読性、トークンの冗長性、適応的な推論深さの欠如に悩まされることがよくあります。
- 参考スコア(独自算出の注目度): 55.99621402404222
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards without human-annotated data, often referred to as zero RL, has emerged as a powerful paradigm for eliciting chain-of-thought reasoning. However, due to computational constraints, existing studies are largely restricted to small models, leaving the training dynamics and emergent capabilities at a large scale unexplored. To meaningfully explore this frontier, we aim to elicit high-quality reasoning behaviors from the model. However, we find that naive scaling often suffers from poor readability, token redundancy, and a lack of adaptive reasoning depth. To address these challenges, we present a stable and efficient training pipeline, incorporating algorithmic and system optimizations such as clipped importance sampling, training-inference ratio correction, and mixed-precision control. Our experiments offer three key findings that validate the "bitter lesson" of scaling: (1) scaling to 1T parameters significantly enhances sample efficiency and performance ceilings; (2) the training process progresses sequentially through an initial discovery phase followed by a sharpening phase; and (3) the model spontaneously develops advanced cognitive behaviors, including anthropomorphism, structured formatting, self-verification, parallel reasoning, and context anxiety, rendering hand-crafted heuristics redundant. Evaluated on seven mathematical benchmarks, Ring-2.5-1T-Zero achieves competitive performance. Additionally, to assess CoT quality beyond final-answer correctness, we propose a structured evaluation framework across three dimensions: comprehensibility, reproducibility, and efficiency, where our model demonstrates clear advantages in producing structured and concise reasoning traces. By sharing our observed emergent phenomena, we hope to provide the community with deeper insights into scaling behaviors, particularly at the 1-trillion scale.
- Abstract(参考訳): 人間の注釈のない検証可能な報酬による強化学習は、しばしばゼロRLと呼ばれ、思考の連鎖的推論を引き出すための強力なパラダイムとして現れている。
しかし、計算上の制約のため、既存の研究はほとんど小さなモデルに限られており、訓練力学と創発能力は未探索のままである。
このフロンティアを有意義に探求するために、我々はモデルから高品質な推論行動を引き出すことを目指している。
しかし、単純なスケーリングは可読性、トークンの冗長性、適応的な推論深さの欠如に悩まされることが多い。
これらの課題に対処するため、我々は、クリップ付き重要度サンプリング、トレーニング-推論比補正、混合精度制御などのアルゴリズムおよびシステム最適化を組み込んだ、安定かつ効率的なトレーニングパイプラインを提案する。
1)1Tパラメータへのスケーリングはサンプルの効率と性能の天井を著しく向上させる; (2) トレーニングプロセスは初期発見段階を経て順次進行し, (3) モデルが自然に発達し, 擬人化, 構造化フォーマッティング, 自己検証, 並列推論, コンテキスト不安など, 高度な認知行動が発達する。
7つの数学ベンチマークで評価され、Ring-2.5-1T-Zeroは競争力を発揮する。
さらに,CoTの品質を最終回答の正確性を超えて評価するために,理解性,再現性,効率性の3つの側面にまたがる構造化評価フレームワークを提案する。
観察された創発的な現象を共有することで、特に1トリリオンスケールでのスケーリング行動について、コミュニティに深い洞察を提供したいと思っています。
関連論文リスト
- Beyond Distribution Sharpening: The Importance of Task Rewards [20.11905685439596]
両パラダイムを実装するツールとしてRLを用いて,分布のシャープニングとタスク逆学習を比較した。
Llama-3.2-3B-インストラクト、Qwen2.5-3B-インストラクト、Qwen3-4B-インストラクト-2507を用いた数学データセットによる実験では、シャープ化が利得を制限することが確認された。
論文 参考訳(メタデータ) (2026-04-17T17:17:55Z) - EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs [9.412828452977553]
既存のアプローチは成功した推論パスを強化し、かなりのキャリブレーションコストを発生させる。
この失敗は、アライメントにおけるモデル崩壊の一形態として特徴づけられている。
推論性能とキャリブレーションを協調的に最適化する訓練目標として,EpiCaRを提案する。
論文 参考訳(メタデータ) (2026-01-11T06:21:13Z) - ReEfBench: Quantifying the Reasoning Efficiency of LLMs [9.462320482705508]
非侵襲的で包括的プロセス中心の推論評価のための新しいニューロシンボリックフレームワークを提案する。
分析の結果,拡張トークン生成は深い推論の前提条件ではないことが明らかとなった。
論文 参考訳(メタデータ) (2026-01-07T03:33:07Z) - Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study [91.78803511141975]
この研究は、強化学習のスケーリングにおける正と負のサンプルの役割に焦点を当てている。
グループ相対的政策最適化において、サンプルの半数以上がゼロの優位性を持つような実質的なデータ非効率性を同定する。
本研究では,様々な推論モデルとベンチマークの不安定な性能について検討し,不明瞭な結果を伴う不確実な問題に対する不安定性について考察した。
論文 参考訳(メタデータ) (2025-06-05T11:47:10Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling [52.34735382627312]
大規模言語モデル(LLM)は複雑な推論タスクにおいて顕著な能力を示した。
既存のアプローチは主に、効果的なテストタイムスケーリングを達成するために、模倣学習と苦労に依存しています。
我々は、探索を奨励し、推論スケーリングを理解することで、強化学習をスケールするためにT1を提案する。
論文 参考訳(メタデータ) (2025-01-20T18:33:33Z) - Efficient Iterative Amortized Inference for Learning Symmetric and
Disentangled Multi-Object Representations [8.163697683448811]
本稿では,オブジェクト中心表現の教師なし学習のための効率的なフレームワークであるEfficientMORLを紹介する。
対称性と非絡み合いの両方を必要とすることによる最適化の課題は、高コスト反復的償却推論によって解決できることを示す。
標準のマルチオブジェクト・ベンチマークでは,強いオブジェクト分解と歪みを示しながら,ほぼ1桁の高速なトレーニングとテスト時間推定を実現している。
論文 参考訳(メタデータ) (2021-06-07T14:02:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。