論文の概要: A-Evolve-Training: Autonomous Post-Training of a 30B Model
- arxiv url: http://arxiv.org/abs/2606.20657v2
- Date: Thu, 25 Jun 2026 04:21:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.306458
- Title: A-Evolve-Training: Autonomous Post-Training of a 30B Model
- Title(参考訳): A-Evolve-Training:30Bモデルの自律的な後トレーニング
- Authors: Zhan Shi, Bing He, Yisi Sang, Hanqing Lu, Benoit Dumoulin,
- Abstract要約: 我々は、30Bのネモトロンを訓練した後、ループに人間がいないループを走らせる自律システムについて報告する。
自律生産されたモデルは、NVIDIA Nemotron-Reasoning Challengeのリーダーボード上で、トップヒューマンの0.87に対して0.86の保持スコアに達した。
GPT-2クラス(124M)の予算に事前の自律ML-Researchのデモが行われたのは、今回が初めてである。
- 参考スコア(独自算出の注目度): 19.01340507916024
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training a frontier model is normally weeks of human work: proposing data and recipe changes, launching runs, reading evals, deciding what to keep. We report an autonomous system that runs this loop with no human in the loop, post-training a 30B Nemotron across four rounds over multiple weeks. The autonomously produced model reaches a held-out score of 0.86 against the top human submission's 0.87 on the public NVIDIA Nemotron-Reasoning Challenge leaderboard, placing 8th of ~4000 at the time of writing. More striking than the number: the loop detected that its own dev metric had stopped tracking external performance on the weakest domain -- candidates drove dev to record highs without moving the external target -- and revised its own search policy, no longer maximizing dev but seeking interventions that lowered the now-misleading proxy while improving the external target. We treat this as direct, auditable evidence that a scaled autonomous loop can produce discovery, not only optimization: it detected that its measurement frame had become misleading and changed what counted as evidence. We take the operational view that any system worth the "recursive self-improvement" label must eventually perform end-to-end post-training of a frontier-class model; this is one datapoint of that bar being cleared. We do not claim a "first autonomous match" of human researchers. The claim we make is narrower and auditable: to our knowledge, this is the first publicly reported autonomous post-training run at this scale, where prior public autonomous-ML-research demonstrations sit at GPT-2-class (~124M) budgets. The same system also post-trains the 120B and 550B Nemotron; with no public human baseline there, this shows only that the loop closes at that scale, not that its output is competitive -- infrastructure evidence, with the effectiveness claim deferred until a comparable human anchor exists.
- Abstract(参考訳): トレーニング後のフロンティアモデルは通常、データとレシピの変更の提案、ランニングの起動、evalの読み込み、保持方法の決定など、人間の作業の数週間である。
我々は、このループを人間がいない状態で走らせる自律システムについて報告し、数週間にわたって4ラウンドにわたって30Bのネモトロンを訓練した。
自律的に生産されたモデルは、NVIDIA Nemotron-Reasoning Challengeの一般向けリーダーボードで、トップ人間の応募者の0.87に対して0.86点に達し、執筆時点では4000点中8位となっている。
このループは、自身の開発指標が、最も弱いドメインでの外部パフォーマンスを追跡するのをやめたことを検知した -- 候補者は、外部ターゲットを移動せずに、最高値を記録した — と、独自の検索ポリシーを改訂した。
我々はこれを、スケールした自律ループが発見をもたらすという直接的な、監査可能な証拠として扱い、最適化だけでなく、その測定フレームが誤解を招くことを検出し、証拠として数えられるものを変更した。
我々は、「再帰的な自己改善(recursive self-improvement)」ラベルに値するどんなシステムでも、最終的にフロンティアクラスのモデルのエンドツーエンドのポストトレーニングを実行しなければなりません。
我々は人間の研究者にとって「最初の自律的な一致」は主張しない。
当社の主張はより狭く、監査可能で、私たちの知る限り、これはこの規模で報告された初めての自律的なポストトレーニングで、前回の公的な自律ML-調査のデモがGPT-2クラス(約124M)の予算に置かれている。
同じシステムは120Bと550Bのネモトロンのポストトレーニングも行っており、公的な人間のベースラインが存在しないため、このループはその規模で閉じているだけであり、その出力が競争力のあることではなく、インフラの証拠であり、有効性の主張は同等の人間のアンカーが存在するまで延期されていることを示している。
関連論文リスト
- Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning [5.605622654870907]
ポストトレーニングは、言語モデルを有能な検索強化推論エージェントに変えるための主要なレシピとなっている。
そこで本稿では,バニラGRPOのみによる自己進化法である検索-E1を提案する。
Search-E1はQwen2.5-3Bで平均0.440EMに達し、両方のスケールですべてのオープンソースベースラインを超えた。
論文 参考訳(メタデータ) (2026-05-21T14:00:57Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - Fusion-fission forecasts when AI will shift to undesirable behavior [0.0]
社会全体でChatGPTのようなAIが利用している主な問題は、その行動が望ましいものから望ましくないものへと変化し、気付かないものへと変化することである。
生体およびアクティブマターシステムで観測される融合分裂群のダイナミクスの一般化ベクトルが、AIの振る舞いの将来の変化を -- そして予測できることを示す。
論文 参考訳(メタデータ) (2026-05-14T00:26:32Z) - When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning [30.162034423611292]
マルチモーダル推論のための教師なし自己進化学習フレームワークを提案する。
ヒューマンアノテートされた回答や外部報酬モデルを用いることなく、安定したパフォーマンス向上を実現する。
提案手法は5つの数学的推論ベンチマークにおける推論性能と一般化を一貫して改善する。
論文 参考訳(メタデータ) (2026-03-22T15:22:19Z) - A Rubric-Supervised Critic from Sparse Real-World Outcomes [87.11204512676193]
現実のコーディングエージェントは、成功信号がノイズが多く、遅延し、スパースであるループで人間と動作します。
本稿では,RLに基づくトレーニングや推論時間スケーリングの報奨モデルとして,スパースとノイズの相互作用データから"批判的"モデルを学習するプロセスを提案する。
論文 参考訳(メタデータ) (2026-03-04T07:23:54Z) - Can We Predict Before Executing Machine Learning Agents? [74.39460101251792]
データ中心のソリューション優先のタスクを形式化し、18,438対比較の包括的コーパスを構築する。
検証データ解析レポートを作成した場合, LLM は重要な予測能力を示すことを示す。
このフレームワークをForEAGENT(Predict-then-Verifyループを利用するエージェント)でインスタンス化し、実行ベースラインを+6%超えながらコンバージェンスを6倍高速化する。
論文 参考訳(メタデータ) (2026-01-09T16:44:17Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - A Follow-the-Leader Strategy using Hierarchical Deep Neural Networks
with Grouped Convolutions [0.0]
リーダのタスクは階層型ディープニューラルネットワーク(DNN)のエンドツーエンド駆動モデルを用いて実装される。
モデルはインテリジェンス・プロセッシング・ユニット(IPU)で訓練され、その微粒な計算能力を活用する。
歩行者を追跡する車両の記録が作成され、ウェブで公開されている。
論文 参考訳(メタデータ) (2020-11-04T16:04:42Z) - It Is Not the Journey but the Destination: Endpoint Conditioned
Trajectory Prediction [59.027152973975575]
フレキシブルな人間の軌道予測のための予測条件付きネットワーク(PECNet)を提案する。
PECNetは長距離マルチモーダル軌道予測を支援するために遠方のエンドポイントを推論する。
我々は、PECNetがスタンフォードドローン軌道予測ベンチマークの最先端性能を20.9%改善し、ETH/UCYベンチマークの40.8%向上したことを示す。
論文 参考訳(メタデータ) (2020-04-04T21:27:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。