論文の概要: Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting
- arxiv url: http://arxiv.org/abs/2607.26643v1
- Date: Wed, 29 Jul 2026 09:05:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.605333
- Title: Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting
- Title(参考訳): 自己進化を再考する: スキルオーバーフィッティングを緩和するための制約付き探索-探索プロセス
- Abstract要約: 大規模言語モデル(LLM)エージェントは、過去のインタラクションからの経験を蓄積し再利用する必要がある。
データ駆動のスキル最適化は、実際の環境から収集された限られた軌道に過度に適合する傾向がある。
リスクを緩和する3段階フレームワークであるSkillBoostを提案する。
- 参考スコア(独自算出の注目度): 20.811638832981178
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enabling large language model (LLM) agents to accumulate and reuse experience from past interactions remains a central challenge in real-world applications. A promising solution is to treat skills as trainable states and optimize them in the same way as model parameters in neural network training. However, data-driven skill optimization is prone to overfitting to the limited trajectories collected from real environments. Overexploiting these trajectories overfits the current batch, while unconstrained exploration causes regression on previously solved cases. This tension motivates a constrained search view of skill self-evolution, governed by an exploration--exploitation trade-off. We propose SkillBoost, a three-stage framework that mitigates both risks: structured exploitation localizes observed failures to editable skill components, prior-guided exploration draws on prior knowledge in the LLM to generate diverse repair candidates, and verified acceptance commits a candidate only when it improves performance within a regression bound. Experiments across 23 model--benchmark configurations show that SkillBoost achieves state-of-the-art performance while mitigating overfitting, outperforming both human-crafted and LLM-generated skills. Transfer experiments further show that optimized skills can be reused by other agents on similar tasks.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントを導入して過去のインタラクションから経験を蓄積し再利用することは、現実世界のアプリケーションにおいて重要な課題である。
有望な解決策は、トレーニング可能な状態としてスキルを扱い、ニューラルネットワークトレーニングのモデルパラメータと同じように、それらを最適化することだ。
しかし、データ駆動型スキル最適化は、実際の環境から収集された限られた軌道に過度に適合する傾向がある。
これらの軌道の過度な探索は、現在のバッチに過度に適合する一方、制約のない探索は、以前に解決されたケースで回帰を引き起こす。
この緊張は、探検と探索のトレードオフによって支配されるスキルの自己進化の制約された検索観を動機付けている。
SkillBoostは2つのリスクを緩和する3段階のフレームワークである: 構造化されたエクスプロイトは、観測された失敗を編集可能なスキルコンポーネントにローカライズし、事前誘導探索はLLMの事前知識に基づいて様々な修復候補を生成し、検証された受け入れコミットは、回帰バウンダリ内でのパフォーマンスを改善する場合にのみ候補をコミットする。
ベンチマーク設定23種類の実験では、SkillBoostはオーバーフィッティングを軽減しつつ最先端のパフォーマンスを実現し、人造スキルとLLM生成スキルの両方を上回ります。
トランスファー実験により、他のエージェントが同様のタスクで最適化されたスキルを再利用できることが示される。
関連論文リスト
- Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills [53.15216425100295]
本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2026-07-24T17:59:22Z) - Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents [9.144810798419975]
LLMエージェントは、長期の対話的タスクのパフォーマンスを向上させるために、意思決定時に取得した外部キュレートされたスキル・プロデューラルな指示を徐々に取り出す。
エージェントの重みを変更することなく、各ターゲットのバックボーンにスキルを適応させるフレームワークであるMASA Model-Aware Skill Alignmentを提案する。
MASAは、最強のベースラインで最大25.8ポイントを獲得して、常に最高の総合成績を収めている。
論文 参考訳(メタデータ) (2026-05-29T01:34:42Z) - SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills [31.23929961213889]
大規模言語モデル(LLM)エージェントは、現実世界のタスクを解きながら豊富なエピソード軌道を蓄積する。
SkillEvolBenchは、経験の再利用からスキル形成まで、このステップを評価するための診断ベンチマークである。
現在のエージェントは、しばしばローカルに適応するが、堅牢な再利用可能なスキルを形成することは滅多にない。
論文 参考訳(メタデータ) (2026-05-22T18:23:31Z) - EvoIR-Agent: Self-Evolving Image Restoration Agentic System via Experience-Driven Learning [39.60899845728349]
マルチモーダル大言語モデル(MLLM)による画像復元は,分解結合シナリオの有効性を示す。
トレーニングベースのメソッドは、固有の経験をパラメータに組み込んで、高い推論効率を実現するが、新しいツールや分解との互換性に欠ける。
EvoIR-Agentは、まず、トレーニング不要の画像復元エージェントの経験成分を体系的に定式化する。
論文 参考訳(メタデータ) (2026-05-21T09:14:25Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - Experiential Reflective Learning for Self-Improving LLM Agents [1.1074589887824053]
実験的反射学習(ERL:Experiential Reflective Learning)は,迅速な環境適応を実現するシンプルな自己改善フレームワークである。
ERLはタスクの軌跡と成果を反映して、タスク間で伝達される実行可能なレッスンを生成する。
ERLはReActベースラインよりも成功率を7.8%向上させ、タスク完了の信頼性を大きく向上させる。
論文 参考訳(メタデータ) (2026-03-25T11:43:22Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。