論文の概要: Learning to Self-Evolve
- arxiv url: http://arxiv.org/abs/2603.18620v1
- Date: Thu, 19 Mar 2026 08:41:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.036639
- Title: Learning to Self-Evolve
- Title(参考訳): 自己開発を学ぶ
- Authors: Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He,
- Abstract要約: 本稿では,LSE(Learning to Self-Evolve)について紹介する。LSE(Learning to Self-Evolve)は,大規模言語モデル(LLM)を学習して,テスト時に自身の状況を改善するための強化学習フレームワークである。
LSEは、マルチステップ進化問題を1ステップのRL目標に還元し、各コンテキストの編集は、下流のパフォーマンスの改善によって報われる。
本結果は,自己進化を学習可能なスキルとして扱うことの有効性を強調した。
- 参考スコア(独自算出の注目度): 37.39989112050656
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Learning to Self-Evolve (LSE), a reinforcement learning framework that trains large language models (LLMs) to improve their own contexts at test time. We situate LSE in the setting of test-time self-evolution, where a model iteratively refines its context from feedback on seen problems to perform better on new ones. Existing approaches rely entirely on the inherent reasoning ability of the model and never explicitly train it for this task. LSE reduces the multi-step evolution problem to a single-step RL objective, where each context edit is rewarded by the improvement in downstream performance. We pair this objective with a tree-guided evolution loop. On Text-to-SQL generation (BIRD) and general question answering (MMLU-Redux), a 4B-parameter model trained with LSE outperforms self-evolving policies powered by GPT-5 and Claude Sonnet 4.5, as well as prompt optimization methods including GEPA and TextGrad, and transfers to guide other models without additional training. Our results highlight the effectiveness of treating self-evolution as a learnable skill.
- Abstract(参考訳): 本稿では,LSE(Learning to Self-Evolve)について紹介する。LSE(Learning to Self-Evolve)は,大規模言語モデル(LLM)を学習して,テスト時に自身の状況を改善するための強化学習フレームワークである。
LSEはテスト時の自己進化(test-time self-evolution)の設定に置かれます。そこではモデルは、見た問題に対するフィードバックからコンテキストを反復的に洗練し、新しい問題を改善する。
既存のアプローチは、モデル固有の推論能力に完全に依存しており、このタスクのためにそれを明示的にトレーニングすることはありません。
LSEは、マルチステップ進化問題を1ステップのRL目標に還元し、各コンテキストの編集は、下流のパフォーマンスの改善によって報われる。
この目的をツリー誘導進化ループと組み合わせる。
テキスト・トゥ・SQL生成(BIRD)と一般質問応答(MMLU-Redux)では、LSEで訓練された4Bパラメータモデルが、GPT-5とClaude Sonnet 4.5によって駆動される自己進化ポリシーを上回り、GEPAやTextGradなどの迅速な最適化手法が実行され、追加のトレーニングなしで他のモデルをガイドするために転送される。
本結果は,自己進化を学習可能なスキルとして扱うことの有効性を強調した。
関連論文リスト
- Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization [53.93621974137829]
自己精製(Self-Refinement)とは、モデルが自身のレスポンスを改訂し、改善された出力を生成する能力を指す。
EVOLVEは、反復的なトレーニングを通じて自己精製の進化を導き、追跡するためのフレームワークである。
固有モデル能力のより広範な自己改善を実現するために自己改善を活用する可能性を実証する。
論文 参考訳(メタデータ) (2025-02-08T15:21:55Z) - A Survey on Self-Evolution of Large Language Models [116.54238664264928]
大規模言語モデル(LLM)は、様々な分野やインテリジェントエージェントアプリケーションにおいて大きく進歩している。
この問題に対処するために、LLMが自律的に獲得し、洗練し、モデル自身によって生成された経験から学ぶことができる自己進化的アプローチが急速に成長している。
論文 参考訳(メタデータ) (2024-04-22T17:43:23Z) - SELF: Self-Evolution with Language Feedback [68.6673019284853]
SELF(Self-Evolution with Language Feedback)は、大規模言語モデルを進化させる新しいアプローチである。
LLMは、人間の学習プロセスと同様、自己回帰を通じて自己改善を可能にする。
数学および一般タスクにおける実験により,SELFは人間の介入なしにLLMの能力を高めることができることが示された。
論文 参考訳(メタデータ) (2023-10-01T00:52:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。