論文の概要: CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution
- arxiv url: http://arxiv.org/abs/2609.04865v1
- Date: Fri, 04 Sep 2026 08:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.973435
- Title: CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution
- Title(参考訳): CoSkill: 階層的スキル進化のための推論とメタスキルエージェントの統合強化学習
- Abstract要約: CoSkillは、静的メタスキルワークフローを学習可能なメタスキルエージェントとして再キャストする統合マルチエージェントRLフレームワークである。
ReasoningとMeta-Skill Agentsを単一のバックボーンを共有する協力チームとしてモデル化することで、CoSkillはエンドツーエンドのコ適応を可能にする。
- 参考スコア(独自算出の注目度): 12.48020149385294
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Skill libraries improve the sample efficiency of agentic reinforcement learning (RL) by enabling large language model (LLM) agents to reuse procedural knowledge. Yet existing paradigms exhibit structural shortcomings: they either decouple skill evolution from policy optimization or instantiate meta-skills as fixed workflows. Both treat skills as passive objects to be managed, limiting the flexible evolution of skills and their co-adaptation with the reasoning agent. To address the limitations, we propose CoSkill, a unified multi-agent RL framework that recasts the static meta-skill workflow as a learnable Meta-Skill Agent and jointly trains it with a Reasoning Agent over a hierarchical skill library. By modeling the Reasoning and Meta-Skill Agents as a cooperative team sharing a single backbone, CoSkill enables end-to-end co-adaptation: the Reasoning Agent conditions its actions on a retrieved task skill and step skills selected from its child set, while its task performance guides the Meta-Skill Agent in refining those step skills. Experiments on ALFWorld and WebShop show that CoSkill substantially outperforms prior skill-based and RL baselines, achieving success rates of 98.4% and 90.6%, respectively (+3.5 and +6.2 pp). As shown in Figure 1, CoSkill achieves superior early-stage sample efficiency, asymptotic performance, and wall-clock efficiency. Our code is available at https://github.com/jinyuan-cookie/CoSkill.
- Abstract(参考訳): スキルライブラリは、大規模言語モデル(LLM)エージェントによる手続き的知識の再利用により、エージェント強化学習(RL)のサンプル効率を向上させる。
それらは、ポリシー最適化からスキル進化を分離するか、固定されたワークフローとしてメタスキルをインスタンス化する。
どちらも、スキルを管理すべき受動的オブジェクトとして扱い、スキルの柔軟な進化と、推論エージェントとの共適応を制限する。
この制限に対処するために,静的メタスキルワークフローを学習可能なメタスキルエージェントとして再キャストし,階層的なスキルライブラリ上でReasoning Agentと共同でトレーニングする,統合マルチエージェントRLフレームワークであるCoSkillを提案する。
CoSkillは、ReasoningとMeta-Skill Agentsを1つのバックボーンを共有する協力チームとしてモデル化することで、エンドツーエンドのコ適応を可能にします。
ALFWorldとWebShopの実験では、CoSkillは以前のスキルベースとRLベースラインを大きく上回り、それぞれ98.4%と90.6%(+3.5と+6.2pp)の成功率を達成した。
図1に示すように、CoSkillはより優れた早期サンプリング効率、漸近性能、壁時計効率を実現する。
私たちのコードはhttps://github.com/jinyuan-cookie/CoSkill.comで利用可能です。
関連論文リスト
- MASkills: Continual Skills Optimization for Multi-Agent LLM Systems [36.30615078891684]
エージェントスキルを通じてマルチエージェントLLMシステムを最適化する継続的学習フレームワークであるMASkillsを紹介する。
本稿では,スキル条件付きクレジット割り当て,階層型クレジットアグリゲーション,モーメントスムーズな最適化を統合したエージェント最適化パイプラインを提案する。
HotpotQA、LoCoMo、GAIAの実験は、複数のエージェントタスクにおけるMASkillsの有効性を実証している。
論文 参考訳(メタデータ) (2026-09-02T04:34:17Z) - MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution [24.78476085778134]
自己改善エージェントは、実行トレースから自身のスキルファイルを書き換えることで、この問題に対処する。
MetaSkill-Evolveはエージェントスキルの改善を再帰的に行う2段階のフレームワークである。
タスクスキルは高速ループで進化し、メタスキルは自分自身に適用される同じパイプラインの下で遅いループで進化する。
5つのパイプラインエージェントが1つの凍結バックボーンを共有しているため、MetaSkill-Evolveは、ノスキル、スタティックスキル、シングルレベルの進化ベースラインよりも優れています。
論文 参考訳(メタデータ) (2026-07-06T16:40:23Z) - Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - SkillCAT: Contrastive Assessment and Topology-Aware Skill Self-Evolution for LLM Agents [42.30624901249764]
現在のパイプラインはタスク毎の1つのトラックから学び、チェックする前に候補スキルパッチをマージし、推論前にフルスキルコーパスをロードする。
トレーニング不要のフレームワークであるSkillCATを提案し,このプロセスを3段階に分けた。
SpreadsheetBench,WikiTableQuestions,DocVQAなど,一般的なエージェントベンチマーク上でSkillCATを評価する。
論文 参考訳(メタデータ) (2026-06-11T13:12:10Z) - You Live More Than Once: Towards Hierarchical Skill Meta-Evolving [92.6633152185458]
テストタイムスキルの進化はエージェントシステムを強化するための新しいパラダイムと見なされている。
エージェントシステムの継続的改善には,スキル進化フレームワークの試験時間改善が不可欠であることを示す。
軽量な階層型スキルメタ進化ソリューションであるHiSMEを提案する。
論文 参考訳(メタデータ) (2026-05-27T12:26:49Z) - SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs [70.1970574147839]
有向グラフのノードとして再利用可能なスキルを表現するフレームワークであるSKILLGRAPHを提案する。
SKILLGRAPHは個々のスキルだけでなく、多段階意思決定をガイドできる順序付きスキルサブグラフも取得する。
実験により,SKILLGRAPHはメモリ拡張RL法に対して最先端の性能を実現することが示された。
論文 参考訳(メタデータ) (2026-05-12T12:21:49Z) - Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning [32.51284576274437]
永続的なスキルライブラリにより、言語モデルエージェントはタスク間で成功した戦略を再利用できる。
既存の手法は、これらの機能を分離または別々の報酬源で最適化し、部分的かつ矛盾する進化をもたらす。
Skill1は,共有タスクアウトカム目標に向けて,スキル選択,利用,蒸留を共同開発するための単一の政策を訓練するフレームワークである。
論文 参考訳(メタデータ) (2026-05-07T12:33:30Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning [83.98129545309277]
生経験と政策改善のギャップを埋めるフレームワークであるSkillRLを提案する。
本手法では,階層型スキルライブラリであるSkillBankを構築するために,経験に基づく蒸留機構を導入する。
ALF、WebShop、および7つの検索強化タスクの実験結果は、SkillRLが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-09T03:17:17Z) - CUA-Skill: Develop Skills for Computer Using Agent [48.87870942314034]
コンピュータを利用したエージェントスキルベースであるCUA-Skillを導入し,人間のコンピュータ利用知識をスキルとして符号化する。
我々は、動的スキル検索、引数のインスタンス化、メモリ認識障害回復をサポートする、エンドツーエンドのコンピュータ利用エージェントであるCUA-Skill Agentを構築した。
その結果、CUA-Skillは、エンドツーエンドのベンチマークで実行の成功率と堅牢性を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-01-28T23:38:25Z) - Reinforcement Learning for Self-Improving Agent with Skill Library [14.717149089634718]
大規模言語モデル(LLM)に基づくエージェントは、複雑な推論とマルチターン相互作用において顕著な機能を示した。
有望なアプローチの1つは、エージェントが新しいスキルを学び、検証し、適用できるスキルライブラリを実装することである。
スキルライブラリによるエージェントの自己改善能力を高めるための強化学習(RL)に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2025-12-18T21:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。