論文の概要: ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
- arxiv url: http://arxiv.org/abs/2608.03874v1
- Date: Tue, 04 Aug 2026 16:15:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.278216
- Title: ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?
- Title(参考訳): ContinualSkillBench: LLMエージェントは機能を完全に進化できるのか?
- Authors: Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang,
- Abstract要約: In-context連続型スキル学習のための動的評価フレームワークであるContinualSkillBenchを紹介する。
シーケンシャルな実行は一般的にパフォーマンスを改善するが、モデルやドメインによって大きな違いがある。
さらに、より能力の低いモデルは、より大きな、より断片化されたタスク固有のスキルのコレクションを蓄積する傾向にある。
- 参考スコア(独自算出の注目度): 42.712923465058786
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern agent frameworks equip large language models with external skill libraries to solve complex tasks. However, it remains unclear whether these systems can effectively evolve their skills and whether the resulting skills improve task-solving capabilities. To bridge this gap, we introduce ContinualSkillBench, a dynamic evaluation framework for in-context continual skill learning. It covers five representative domains, each containing 100 interconnected subtasks ordered by increasing difficulty and opportunities for cross-task skill reuse. Our experiments show that sequential execution generally improves performance, but the gains vary substantially across models and domains. Moreover, in-context learning performs comparably to explicit skill maintenance on average, suggesting that much of the improvement arises from adaptation to prior context and feedback rather than reusable skill abstraction alone. Explicit skills nevertheless provide selective benefits for tasks requiring reusable procedures or precise outputs. We further find that less capable models tend to accumulate larger, more fragmented collections of task-specific skills. These findings show that current in-context skill evolution mechanisms can support continual adaptation, but still struggle to consistently consolidate experience into robust and transferable skills.
- Abstract(参考訳): 現代のエージェントフレームワークは、複雑なタスクを解決するために、外部スキルライブラリを備えた大きな言語モデルを備えている。
しかし、これらのシステムが彼らのスキルを効果的に進化させることができるのか、その結果のスキルがタスク解決能力を改善するのかは、まだ不明である。
このギャップを埋めるために、コンテクスト内の継続的スキル学習のための動的評価フレームワークであるContinualSkillBenchを紹介する。
5つの代表的なドメインをカバーし、それぞれが100個の相互接続されたサブタスクを含む。
我々の実験では、シーケンシャルな実行は一般的にパフォーマンスを改善するが、モデルやドメイン間で利得は大きく異なる。
さらに、コンテキスト内学習は、平均して明示的なスキルメンテナンスに比較可能であり、改善の多くは、再利用可能なスキル抽象化ではなく、事前のコンテキストやフィードバックへの適応から生じていることを示唆している。
それにもかかわらず、明示的なスキルは、再利用可能な手順や正確なアウトプットを必要とするタスクに選択的に利益をもたらす。
さらに、能力の低いモデルでは、タスク固有のスキルのより大きく断片化されたコレクションを蓄積する傾向があります。
これらの結果から,現在の文脈内スキル進化機構は連続的な適応を支えつつも,継続的に経験を堅牢かつ伝達可能なスキルにまとめることに苦慮していることが明らかとなった。
関連論文リスト
- Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills [53.15216425100295]
本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2026-07-24T17:59:22Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents [9.144810798419975]
LLMエージェントは、長期の対話的タスクのパフォーマンスを向上させるために、意思決定時に取得した外部キュレートされたスキル・プロデューラルな指示を徐々に取り出す。
エージェントの重みを変更することなく、各ターゲットのバックボーンにスキルを適応させるフレームワークであるMASA Model-Aware Skill Alignmentを提案する。
MASAは、最強のベースラインで最大25.8ポイントを獲得して、常に最高の総合成績を収めている。
論文 参考訳(メタデータ) (2026-05-29T01:34:42Z) - SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills [31.23929961213889]
大規模言語モデル(LLM)エージェントは、現実世界のタスクを解きながら豊富なエピソード軌道を蓄積する。
SkillEvolBenchは、経験の再利用からスキル形成まで、このステップを評価するための診断ベンチマークである。
現在のエージェントは、しばしばローカルに適応するが、堅牢な再利用可能なスキルを形成することは滅多にない。
論文 参考訳(メタデータ) (2026-05-22T18:23:31Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - From Context to Skills: Can Language Models Learn from Context Skillfully? [56.5857437218136]
Ctx2Skillは、コンテキスト固有のスキルを自律的に発見、洗練、選択する自己進化フレームワークである。
より良い文脈学習能力を得るために、どんな言語モデルにもプラグインできる。
論文 参考訳(メタデータ) (2026-04-30T09:53:15Z) - SkillClaw: Let Skills Evolve Collectively with Agentic Evolver [18.942639318503062]
マルチユーザエージェントエコシステムにおける集合的スキル進化のためのフレームワークであるSkillClawを紹介する。
SkillClawは、クロスユーザとオーバータイムのインタラクションを、スキル向上のための主要なシグナルとして扱う。
使用中に生成された軌跡を連続的に集約し、自律的な進化器で処理する。
得られたスキルは共有リポジトリに保持され、ユーザ間で同期される。
論文 参考訳(メタデータ) (2026-04-09T15:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。