論文の概要: Self-Improving Large Language Models via Progressive Experience Evolution
- arxiv url: http://arxiv.org/abs/2608.02139v1
- Date: Mon, 03 Aug 2026 12:27:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.544338
- Title: Self-Improving Large Language Models via Progressive Experience Evolution
- Title(参考訳): 進歩的体験進化による自己改善型大規模言語モデル
- Authors: Shijie Ren, Xiting Wang, Meng Li, Yujie Guo, Yunhang Yao, Ziheng Peng, Xunlong Wang, Yuetan Chen, Haoyang Zhou, Yunlong Liang, Fandong Meng,
- Abstract要約: textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 52.03479747358687
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) capable of self-improvement require not only effective policy optimization, but also a principled mechanism for transforming transient interaction experience into persistent model capabilities. Existing self-improvement paradigms remain fragmented: test-time methods can explicitly extract experience but cannot internalize it into model parameters, whereas training-time optimization methods can update model parameters but lack an explicit mechanism for accumulating transferable experience. Bridging these two paradigms requires a critical intermediate stage that remains underexplored, namely \emph{experience distillation}. To address this gap, we propose \textbf{SPEE} (\textbf{S}elf-\textbf{P}rogressive \textbf{E}xperience \textbf{E}volution), a unified post-training framework that sequentially performs explicit experience evolution followed by implicit policy optimization. During explicit experience evolution, SPEE reflects on trajectories collected from multiple interactions to extract, verify, and progressively evolve transferable experience, which is subsequently internalized into the policy through privilege-guided On-Policy Self-Distillation (OPSD). During implicit policy optimization, reward-driven reinforcement learning leverages these internalized priors to explore novel solution strategies. In the experience evolution stage, a continuously evolving global experience pool consolidates knowledge from both successful and failed trajectories, filters out low-utility experience, and mitigates post-hoc rationalization induced by individual trajectories. Experiments on five mathematical reasoning benchmarks demonstrate that SPEE consistently outperforms both test-time and training-time self-evolution baselines across three model scales. The source code is available at https://github.com/rrrsj/SPEE.
- Abstract(参考訳): 自己改善が可能な大規模言語モデル(LLM)は、効果的なポリシー最適化だけでなく、過渡的な相互作用体験を永続的なモデル能力に変換するための原則的なメカニズムも必要である。
既存の自己改善パラダイムは断片的である: テストタイムメソッドは、明示的に経験を抽出できるが、モデルパラメータに内部化することはできない トレーニングタイム最適化メソッドはモデルパラメータを更新できるが、転送可能な経験を蓄積するための明示的なメカニズムがない。
これら2つのパラダイムをブリッジするには臨界中間段階が必要であり、これはまだ探索されていない、すなわち 'emph{experience distillation} である。
このギャップに対処するために、明示的な経験の進化を逐次実行し、暗黙のポリシー最適化を伴う統合後トレーニングフレームワークである \textbf{SPEE} (\textbf{S}elf-\textbf{P}rogressive \textbf{E}xperience \textbf{E}volution) を提案する。
明示的な経験進化の間、SPEEは、複数の相互作用から収集された軌跡を反映して、移行可能な経験を抽出し、検証し、徐々に進化させ、その後特権誘導型自己蒸留(OPSD)を通じて政策に内部化される。
暗黙的な政策最適化の間、報酬駆動強化学習は、これらの内部化された事前を利用して、新しいソリューション戦略を探求する。
経験進化段階において、継続的なグローバルな経験プールは、成功と失敗の両方の軌跡からの知識を集約し、低ユーティリティ体験をフィルタし、個々の軌跡によって誘導されるポストホック合理化を緩和する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
ソースコードはhttps://github.com/rrrsj/SPEE.comで入手できる。
関連論文リスト
- Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination [40.98046592234726]
我々は,統合エージェントの自己進化フレームワークであるCOVEを紹介する。
これは、タスク対応ルーティング、ステージ対応スケジューリング、知識最適化を通じて、ハーネスベースとパラメータベースの学習を組み合わせる。
COVEは単一チャネルの進化戦略より優れており、環境の変化によるより堅牢で効率的な改善を実証している。
論文 参考訳(メタデータ) (2026-08-02T13:39:01Z) - SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning [38.54413500261524]
アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T09:57:18Z) - EvoIR-Agent: Self-Evolving Image Restoration Agentic System via Experience-Driven Learning [39.60899845728349]
マルチモーダル大言語モデル(MLLM)による画像復元は,分解結合シナリオの有効性を示す。
トレーニングベースのメソッドは、固有の経験をパラメータに組み込んで、高い推論効率を実現するが、新しいツールや分解との互換性に欠ける。
EvoIR-Agentは、まず、トレーニング不要の画像復元エージェントの経験成分を体系的に定式化する。
論文 参考訳(メタデータ) (2026-05-21T09:14:25Z) - Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency [53.28076739140119]
本稿では,視覚・言語モデル(VLM)における論理的一貫性を幾何学的・言語的双対性演算によって実現する枠組みを提案する。
SAGEは、従来のGRPO法に比べてモデルに依存しず、データ効率が良く、既存のVLMに軽量な後学習段階として適用することができる。
ビデオおよび空間推論ベンチマークの実験では、強いベースラインよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-18T10:05:21Z) - Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents [31.6974589324286]
自己進化エージェントは、過去の相互作用から再利用可能な経験を蒸留することで、大きな言語モデルの静的な性質を克服することを目的としている。
本稿では、自己進化に必要な経験抽出と利用能力を共同で改善する効率的なアルゴリズムフレームワークであるEvolving-RLを提案する。
ALFWorldとMind2Webの実験によると、Evolving-RLはLLMが経験を抽出し再利用する能力を効果的に強化する。
論文 参考訳(メタデータ) (2026-05-11T14:43:56Z) - Online Experiential Learning for Language Models [99.90826536842337]
Online Experiential Learning (OEL)は、言語モデルが自身のデプロイメントエクスペリエンスから継続的に改善できるフレームワークである。
OELは、まず、転送可能な経験知識を抽出し、ユーザ側で収集された相互作用軌跡から蓄積する。
テキストベースのゲーム環境において,複数のモデルスケールでOELを評価し,思考と非思考の両バリエーションについて検討した。
論文 参考訳(メタデータ) (2026-03-17T17:57:49Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - Self-Consolidation for Self-Evolving Agents [51.94826934403236]
大規模言語モデル(LLM)エージェントは静的システムとして機能し、生涯にわたる相互作用を通じて進化する能力に欠ける。
相補的進化機構を導入したLLMエージェントのための新しい自己進化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-02T11:16:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。