論文の概要: Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember
- arxiv url: http://arxiv.org/abs/2607.29468v1
- Date: Fri, 31 Jul 2026 14:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.762156
- Title: Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember
- Title(参考訳): セルフプレイとスキルの進化: 自己進化型検索エージェント
- Abstract要約: セルフプレイエージェントは、ターゲットベンチマークからの質問なしにトレーニング問題を生成することができるが、そのカリキュラムには永続的な状態がない。
textbfSESA (Self-Evolving Skill-Augmented Agent) を導入する。
- 参考スコア(独自算出の注目度): 26.754732469136385
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-play agents can generate training problems without questions from target benchmarks, but their curricula lack persistent state: failures affect gradients yet do not explicitly shape future practice. External skill memories preserve procedural experience but are typically learned from fixed task distributions. We introduce \textbf{SESA} (Self-Evolving Skill-Augmented Agent), which makes procedural memory an evolving state of tool-augmented search self-play. A challenger poses problems, while a separately parameterized solver alone retrieves skills. Informative failures are distilled into reusable skills and written back to memory. The updated memory changes solver behavior and success, which changes the challenger's reward and the distribution of future problems; the resulting frontier produces new failures that rewrite memory. This bidirectional loop makes task generation and skill memory co-evolve. Because retrieved skills shape on-policy training trajectories, their benefits can enter the model parameters as well as remain in the external bank, enabling memory-free deployment and optional inference-time retrieval. Across seven open-domain and multi-hop question-answering benchmarks, SESA improves average accuracy over SSP by 1.2--3.2 points across multiple backbones and surpasses the skill-augmented SkillRL baseline by 0.9 points under a unified evaluation protocol. On Qwen3 models, SESA-Off retains 1.8--2.2 points of improvement over SSP, while the final skill bank adds a further 0.5--1.0 points. These results show that evolving skill memory is not merely an inference-time plug-in: it changes policy learning and the future training distribution while retaining value as optional external memory. Our code is available at https://github.com/Zenghuang-Fu/SESA-Self-Evolving-Search-Agents.
- Abstract(参考訳): セルフプレイエージェントは、ターゲットベンチマークからの質問なしにトレーニング問題を生成することができるが、そのカリキュラムには永続的な状態がない。
外的スキル記憶は手続き的な経験を保持するが、通常は一定のタスク分布から学習される。
本稿では,プロシージャ記憶をツール拡張検索の自己再生の進化状態にする「textbf{SESA} (Self-Evolving Skill-Augmented Agent)」を紹介する。
挑戦者が問題を提起し、個別にパラメータ化された解決者がスキルを回収する。
インフォーマティブな失敗は再利用可能なスキルに蒸留され、メモリに書き戻される。
更新されたメモリは、解決者の振る舞いと成功を変え、挑戦者の報酬と将来の問題の分散を変化させる。
この双方向ループはタスク生成とスキルメモリを共進化させる。
検索されたスキルは、政治上のトレーニング軌跡を形成するため、それらの利点はモデルパラメータを入力したり、外部バンクに留まり、メモリフリーなデプロイメントとオプションの推論時間検索を可能にします。
7つのオープンドメインおよびマルチホップ質問答えベンチマークで、SESAは複数のバックボーンにわたるSSPの平均精度を1.2~3.2ポイント改善し、統一された評価プロトコルの下でスキル強化されたSkillRLベースラインを0.9ポイント上回る。
Qwen3では、SESA-OffはSSPよりも1.8--2.2ポイント改善され、最終スキルバンクはさらに0.5-1.0ポイント向上した。
これらの結果は、進化するスキルメモリは単なる推論時プラグインではなく、オプションの外部メモリとしての価値を維持しつつ、ポリシー学習と将来のトレーニング分布を変化させていることを示している。
私たちのコードはhttps://github.com/Zenghuang-Fu/SESA-Self-Evolving-Search-Agentsで公開されています。
関連論文リスト
- Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses [83.32611586724165]
Recurisは、ロングホライゾンエージェントハーネスのためのExperiential-Working Memoryアーキテクチャである。
Work Memoryはタスクの進捗を追跡し、Experiential Memoryからスキル選択をガイドする。
4つのロングホライズンベンチマークと10のモデルでRecurisは37のモデルベンチマークペアのうち35のタスク成功を改善している。
論文 参考訳(メタデータ) (2026-08-25T17:56:35Z) - CONTRAMEM: Learning Self-Evolving Procedural Memory from Contrasting Multi-Model Trajectories [13.649910962870896]
CONTRAMEMは、自己進化型プロシージャメモリのための、ソースフレキシブルでトレーニング不要なフレームワークである。
GAIA2/AREのコンピュータ使用タスクでは、CONTRAMEMは成功率の2倍以上である。
論文 参考訳(メタデータ) (2026-08-23T18:11:26Z) - When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting [20.811638832981178]
大規模言語モデル(LLM)エージェントは、過去のインタラクションからの経験を蓄積し再利用する必要がある。
データ駆動のスキル最適化は、実際の環境から収集された限られた軌道に過度に適合する傾向がある。
リスクを緩和する3段階フレームワークであるSkillBoostを提案する。
論文 参考訳(メタデータ) (2026-07-29T09:05:40Z) - AutoMem: Automated Learning of Memory as a Cognitive Skill [63.07128029793901]
記憶の専門知識は学習したスキルであることを示す。
メモリ管理の2つの軸を自動化するフレームワークであるAutoMemを紹介する。
その結果,メモリ管理は独立して学習可能なスキルであることが示唆された。
論文 参考訳(メタデータ) (2026-07-01T17:57:03Z) - OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation [71.57258488733974]
メモリは、自己進化エージェントの標準的な基盤になっているが、その経験を維持することは、それを通して進化する方法を学ぶことと同じではない。
OPD-Evolver(英語版)は、政策上の自己蒸留を通じて、そのようなエージェントを進化させる緩やかな共進化フレームワークである。
論文 参考訳(メタデータ) (2026-06-16T07:33:53Z) - SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills [31.23929961213889]
大規模言語モデル(LLM)エージェントは、現実世界のタスクを解きながら豊富なエピソード軌道を蓄積する。
SkillEvolBenchは、経験の再利用からスキル形成まで、このステップを評価するための診断ベンチマークである。
現在のエージェントは、しばしばローカルに適応するが、堅牢な再利用可能なスキルを形成することは滅多にない。
論文 参考訳(メタデータ) (2026-05-22T18:23:31Z) - Dynamic Mixture of Latent Memories for Self-Evolving Agents [57.20419419302731]
MoLEMは、動的混合(MoE)に基づく潜在メモリフレームワークの生成混合物である。
我々は、数学、科学、コードドメインにまたがる連続的な学習シーケンスに基づいて、このフレームワークを訓練する。
連続学習を完了した後、Vanilla事前学習ベースラインよりも平均精度を10.40%向上させる。
論文 参考訳(メタデータ) (2026-05-21T03:35:10Z) - SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs [70.1970574147839]
有向グラフのノードとして再利用可能なスキルを表現するフレームワークであるSKILLGRAPHを提案する。
SKILLGRAPHは個々のスキルだけでなく、多段階意思決定をガイドできる順序付きスキルサブグラフも取得する。
実験により,SKILLGRAPHはメモリ拡張RL法に対して最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2026-05-12T12:21:49Z) - Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills [21.971456179996093]
Trace2Skillは、人間の専門家がいかにスキルを作成できるかを反映するフレームワークです。
個々のトラジェクトリにシーケンシャルに反応する代わりに、Trace2Skillは並列なサブエージェント群を派遣して、さまざまな実行プールを分析する。
トラジェクトリ固有のレッスンを抽出し、階層的にそれらをインダクティブ推論を通じて統合され、コンフリクトフリーなスキルディレクトリに集約する。
論文 参考訳(メタデータ) (2026-03-26T08:26:38Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。