論文の概要: Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.21971v1
- Date: Fri, 24 Jul 2026 04:35:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.047368
- Title: Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
- Title(参考訳): LLMに自己開発を教える:強化学習によるコアメタスキルの育成
- Authors: Shujin Wu, Cheng Qian, Xiusi Chen, Heng Ji,
- Abstract要約: AlphaEvolveが示すように、環境フィードバックによる反復的自己進化によるテスト時間のスケーリングは、顕著なパフォーマンス向上を示している。
本稿では,データ合成パイプライン,進化対応強化学習,推論時進化探索によるメタスキル開発を目的としたMetaEvolveを提案する。
- 参考スコア(独自算出の注目度): 51.17262419591891
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Test-time scaling through iterative self-evolution with environment feedback, as demonstrated by AlphaEvolve, shows remarkable performance gains. We hypothesize that the success of such evolution frameworks hinges on meta-skills, such as self-reflection with environment feedback, that enable effective multi-round refinement, yet are largely neglected by traditional post-training. To bridge this gap, we present MetaEvolve, a framework designed to develop these meta-skills via a data synthesis pipeline, evolution-aware reinforcement learning (RL), and inference-time evolutionary search. Concretely, we ground MetaEvolve in coding, where program execution provides natural, continuous reward signals beyond binary correctness. Building on these signals, we synthesize evolution trajectories as training data, each containing a current program, its fitness score (combining correctness and efficiency), and a history of prior attempts, and train the model via RL with verifiable rewards derived from test case execution. By training on large-scale code data, we aim to inspire generalizable domain-agnostic meta-skills that can transfer broadly to open-ended problems where such rich training signals are scarce. Across seven coding benchmarks, MetaEvolve outperforms the strongest baseline by 10.01% absolute on in-distribution tasks and 24.12% on out-of-distribution tasks. On open-ended algorithm optimization problems entirely outside the training domain, it further achieves a 46.9% relative improvement. These results demonstrate that explicitly cultivating self-evolution meta-skills offers a principled path toward more capable and autonomously self-evolving AI.
- Abstract(参考訳): AlphaEvolveが示すように、環境フィードバックによる反復的自己進化によるテスト時間のスケーリングは、顕著なパフォーマンス向上を示している。
このような進化フレームワークの成功は、環境フィードバックによる自己回帰のようなメタスキルに依存し、効果的なマルチラウンド改善を実現するが、従来のポストトレーニングでは無視されている、という仮説を立てる。
このギャップを埋めるために、データ合成パイプライン、進化対応強化学習(RL)、推論時進化探索を通じてこれらのメタスキルを開発するために設計されたMetaEvolveを提案する。
具体的には、MetaEvolveをコーディングに利用し、プログラムの実行はバイナリの正確性を超えた自然な、継続的な報酬信号を提供する。
これらの信号に基づいて、我々は進化軌道をトレーニングデータとして合成し、それぞれが現在のプログラム、その適合度スコア(正確性と効率性の組み合わせ)、事前試行の歴史を含み、テストケースの実行から得られた検証可能な報酬でRLを介してモデルを訓練する。
大規模なコードデータのトレーニングにより、このようなリッチなトレーニング信号が不足しているオープンエンド問題に広く移行可能な、一般化可能なドメインに依存しないメタスキルを刺激することを目指している。
7つのベンチマークで、MetaEvolveは配布外タスクでは10.01%、配布外タスクでは24.12%で最強のベースラインを上回っている。
訓練領域外におけるオープンエンドアルゴリズム最適化問題では、46.9%の相対的な改善が達成される。
これらの結果は、自己進化的メタスキルを明示的に育成することで、より有能で自律的な自己進化型AIへの原則的な道筋が示される。
関連論文リスト
- Evolutionary Discovery of Developmental Reward Schedules in Deep Reinforcement Learning [0.0]
本稿では,開発報酬スケジュールの発見のための進化的枠組みを提案する。
エージェンシー、ノベルティ、および反応性は、時間によって異なる重みによって結合される。
本研究は,進化的最適化を開発報酬スケジュール発見のための有望なアプローチとして位置づけた。
論文 参考訳(メタデータ) (2026-06-18T18:47:26Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Learning to Self-Evolve [37.39989112050656]
本稿では,LSE(Learning to Self-Evolve)について紹介する。LSE(Learning to Self-Evolve)は,大規模言語モデル(LLM)を学習して,テスト時に自身の状況を改善するための強化学習フレームワークである。
LSEは、マルチステップ進化問題を1ステップのRL目標に還元し、各コンテキストの編集は、下流のパフォーマンスの改善によって報われる。
本結果は,自己進化を学習可能なスキルとして扱うことの有効性を強調した。
論文 参考訳(メタデータ) (2026-03-19T08:41:24Z) - Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks [10.622439192272527]
従来のエージェントシステムは、タスク分布が継続的にドリフトし、外部の監視が不十分な、オープンな環境に苦しむ。
In-Situ Self-Evolving(In-Situ Self-Evolving)パラダイムを提案する。
このフレームワーク内では、新しい課題をナビゲートするためのツールを反復的に合成、最適化、再利用するシステムであるYunjue Agentを開発します。
論文 参考訳(メタデータ) (2026-01-26T07:27:47Z) - Differentiable Evolutionary Reinforcement Learning [41.96953381133274]
本稿では,最適な報酬信号の自律的発見を可能にする二段階フレームワークであるDerL(Deriable Evolutionary Reinforcement Learning)を提案する。
DERLはメタ最適化において微分可能であり、内部ループ検証性能を強化学習を通じてメタrを更新する信号として扱う。
実験結果から,ALFWorldとScienceWorldにおけるDerLの最先端性能は,報酬に依存した手法よりも優れていた。
論文 参考訳(メタデータ) (2025-12-15T14:50:08Z) - ThetaEvolve: Test-time Learning on Open Problems [110.5756538358217]
In-context LearningとReinforcement Learning(RL)の両方をテスト時に効率的にスケールするために、AlphaEvolveを単純化し拡張するオープンソースのフレームワークであるThetaEvolveを紹介します。
テスト時にRLを使用するThetaEvolveは、推論のみのベースラインよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-11-28T18:58:14Z) - End-to-End Meta-Bayesian Optimisation with Transformer Neural Processes [52.818579746354665]
本稿では,ニューラルネットワークを一般化し,トランスフォーマーアーキテクチャを用いて獲得関数を学習する,エンド・ツー・エンドの差別化可能な最初のメタBOフレームワークを提案する。
我々は、この強化学習(RL)によるエンドツーエンドのフレームワークを、ラベル付き取得データの欠如に対処できるようにします。
論文 参考訳(メタデータ) (2023-05-25T10:58:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。