論文の概要: SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
- arxiv url: http://arxiv.org/abs/2604.20087v1
- Date: Wed, 22 Apr 2026 01:07:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:10.898324
- Title: SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
- Title(参考訳): SkillLearnBench: 実世界のタスクにおけるエージェントスキル生成のための連続学習手法のベンチマーク
- Abstract要約: SkillLearnBenchは連続的なスキル学習手法を評価するための最初のベンチマークである。
継続的学習は、明確で再利用可能なタスクを改善するが、オープンなタスクでは苦労する。
我々のデータとコードはhttps://github.com/cscmu/SkillLearnBench.comでオープンソース化されています。
- 参考スコア(独自算出の注目度): 32.195367070060904
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Skills have become the de facto way to enable LLM agents to perform complex real-world tasks with customized instructions, workflows, and tools, but how to learn them automatically and effectively remains unclear. We introduce SkillLearnBench, the first benchmark for evaluating continual skill learning methods, comprising 20 verified, skill-dependent tasks across 15 sub-domains derived from a real-world skill taxonomy , evaluated at three levels: skill quality, execution trajectory, and task outcome. Using this benchmark, we evaluate recent continual learning techniques, those leveraging one-shot, self/teacher feedback, and skill creator to generate skills from agent experiences. We find that all continual learning methods improve over the no-skill baseline, yet consistent gains remain elusive: no method leads across all tasks and LLMs, and scaling to stronger LLMs does not reliably help. Continual learning improves tasks with clear, reusable workflows but struggles on open-ended tasks, and using stronger LLM backbones does not consistently produce better skills. Our analysis also revealed that multiple iterations in continual learning facilitate genuine improvement via external feedback, whereas self-feedback alone induces recursive drift. Our data and code are open-source at https://github.com/cxcscmu/SkillLearnBench to enable further studies of automatic skill generation and continual learning techniques.
- Abstract(参考訳): スキルは、LLMエージェントがカスタマイズされた命令、ワークフロー、ツールで複雑な現実世界のタスクを実行できる事実上の方法となっている。
SkillLearnBenchは、実世界のスキル分類から派生した15のサブドメインにまたがる、20の検証済みスキル依存タスクから構成され、スキル品質、実行軌跡、タスク結果の3つのレベルで評価される、継続的スキル学習手法を評価するための最初のベンチマークである。
このベンチマークを用いて、エージェント体験からスキルを生み出すために、最近の連続学習技術、ワンショット、自己/教師のフィードバック、スキルクリエータを活用して評価する。
すべての手法が全てのタスクやLLMをリードするわけではなく、より強力なLLMへのスケーリングは確実には役に立たない。
継続的学習は、明確で再利用可能なワークフローでタスクを改善するが、オープンなタスクに苦労する。
分析の結果,反復学習は外部フィードバックによる真の改善を促進するが,自己フィードバックだけで再帰的ドリフトが引き起こされることがわかった。
我々のデータとコードはhttps://github.com/cxcscmu/SkillLearnBenchでオープンソース化されています。
関連論文リスト
- PRACTICE: From Experience to Expertise in Self-Evolving Embodied Agents [8.367852606377419]
我々は,過去のインタラクションの軌跡から永続的なスキルライブラリを発見し,維持するために,スキル学習者を訓練する。
そこで,本研究では,オンライン・スキル・エグゼクティブ・蒸留を用いて,学習者と教師の連携を図る。
実験では、コンパクトなスキル学習者が、連続したライブラリ更新ラウンドで一貫したパフォーマンス向上を提供することを示した。
論文 参考訳(メタデータ) (2026-08-31T13:26:16Z) - Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents [67.97365535829098]
経験から学ぶことは、有能で自己改善型の大規模言語モデル(LLM)エージェントの開発に不可欠である。
Evo-Harnessは、ノイズの多いシングルショット実行を、クロスドメインとトピックレベルの適応のための再利用可能なスキルハーネスに蒸留する。
本分析は,エボ・ハーネスの有効性を実証し,LLMエージェントがリアルタイムで効果的に学習する方法の原理的理解を提供する。
論文 参考訳(メタデータ) (2026-08-15T06:43:56Z) - SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution [39.74364990208475]
大規模な言語モデルエージェントは、しばしば再利用可能なソリューションパターンを共有する、関連するが独立したタスクに遭遇する。
タスク間のスキル学習のための統合強化学習フレームワークであるSkillRiseを紹介する。
論文 参考訳(メタデータ) (2026-07-29T11:26:33Z) - Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills [53.15216425100295]
本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2026-07-24T17:59:22Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - Reinforcement Learning for Self-Improving Agent with Skill Library [14.717149089634718]
大規模言語モデル(LLM)に基づくエージェントは、複雑な推論とマルチターン相互作用において顕著な機能を示した。
有望なアプローチの1つは、エージェントが新しいスキルを学び、検証し、適用できるスキルライブラリを実装することである。
スキルライブラリによるエージェントの自己改善能力を高めるための強化学習(RL)に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2025-12-18T21:58:19Z) - Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching [67.11497198002165]
大規模言語モデル(LLM)は最新の情報の提供に苦慮することが多い。
既存のアプローチは、通常、新しいドキュメントのトレーニングを継続する。
効率的なヒューマンラーニングにおけるFeynman Techniqueの成功に感銘を受けて、セルフチューニングを紹介した。
論文 参考訳(メタデータ) (2024-06-10T14:42:20Z) - Bilevel Continual Learning [76.50127663309604]
BCL(Bilevel Continual Learning)という,継続的学習の新たな枠組みを提案する。
連続学習ベンチマーク実験では,多くの最先端手法と比較して,提案したBCLの有効性が示された。
論文 参考訳(メタデータ) (2020-07-30T16:00:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。