論文の概要: Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
- arxiv url: http://arxiv.org/abs/2607.22529v1
- Date: Fri, 24 Jul 2026 17:59:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.200011
- Title: Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
- Title(参考訳): スキル・セルフプレイ:LLM能力のフロンティアを共進化スキルで推し進める
- Authors: Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang,
- Abstract要約: 本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
- 参考スコア(独自算出の注目度): 53.15216425100295
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM training is shifting from manual design and annotation to interaction-driven self-evolution. However, existing self-evolutionary methods face a fundamental dilemma between task diversity and verification reliability: environment-bound methods obtain precise feedback but confine learning to narrow domains, while open-ended self-generation broadens the task space but lacks reliable verification, allowing misleading rewards to pollute the training loop. We identify agent skills as a powerful middle ground to reconcile this tension: each skill ensures deep, verifiable execution in a specific scenario, while dynamic routing across skills maintains open-ended task variety. Leveraging this insight, we introduce Skill Self-Play (Skill-SP), a co-evolutionary framework comprising a proposer, a solver, and a dynamic skill controller. Orchestrated via a reinforcement learning loop, these components co-evolve in a continuous self-play loop: the proposer generates challenging tasks conditioned on dynamically sampled skills; the solver explores candidate solutions to push its capability boundaries; and the skill controller collects execution feedback to update and expand the skill library. This interactive co-evolution effectively bridges the gap between structured verification and open-ended exploration. Empirical evaluations on tool-use and reasoning benchmarks demonstrate that Skill-SP, serving as a robust evolution engine, consistently pushes the performance ceiling of competent backbones while catalyzing striking turnarounds for initially misaligned models. Our code is available at https://github.com/Qwen-Applications/skill-self-play.
- Abstract(参考訳): LLMトレーニングは手動設計とアノテーションからインタラクション駆動の自己進化へとシフトしている。
しかし、既存の自己進化的手法はタスクの多様性と信頼性の基本的なジレンマに直面している:環境に縛られた手法は正確なフィードバックを得るが、狭い領域に学習を限定する。
各スキルは、特定のシナリオにおける深い検証可能な実行を保証する一方で、スキル間の動的ルーティングは、オープンなタスクの多様性を維持します。
この知見を活かして,提案者,解決者,動的スキルコントローラからなる共進化的フレームワークであるスキルセルフプレイ(スキルSP)を紹介した。
強化学習ループを介してオーケストレーションされたこれらのコンポーネントは、連続的なセルフプレイループで共進化する。提案者は、動的にサンプリングされたスキルで条件付けられた挑戦的なタスクを生成し、解決者は、その能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは、実行フィードバックを収集して、スキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
ツール使用と推論のベンチマークに関する実証的な評価は、堅牢な進化エンジンとして機能するSkill-SPが、能力のあるバックボーンのパフォーマンス天井を一貫して押し上げながら、初期の不整合モデルの急激なターンアラウンドを触媒することを示した。
私たちのコードはhttps://github.com/Qwen-Applications/skill-self-play.comで利用可能です。
関連論文リスト
- Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning [60.37693496953694]
Embodied Continual Learning (ECL)は、ロボットが新たな操作タスクを継続的に取得できるようにすることを目的としている。
ECLはより深刻な破滅的な忘れ込みに悩まされる。
ECLの主な課題は、継続的に進化するタスクにおける構造化されたスキル再利用である。
論文 参考訳(メタデータ) (2026-06-14T09:02:49Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents [32.49699221723716]
大規模言語モデル(LLM)エージェントが動的にインタラクティブな環境で動作するためには、生涯学習が不可欠である。
オンライン生涯学習エージェントのための2段階強化学習フレームワークであるSkill-enhanced Test-Time Co-Evolution(textttLifeSkill)を提案する。
論文 参考訳(メタデータ) (2026-06-03T12:38:57Z) - SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration [40.79922760459963]
SkillFlowは、トレーニング可能なスーパーバイザをエージェントとして、動的スキルオーケストレーションを備えた構造化環境として、フローベースのフレームワークである。
これらのフロー診断に基づいて、スキル進化メカニズムは、いつ進化するか、どのスキルを創り出すか、どこで意思決定のギャップがあるかを決定する。
論文 参考訳(メタデータ) (2026-05-13T20:14:44Z) - From Context to Skills: Can Language Models Learn from Context Skillfully? [56.5857437218136]
Ctx2Skillは、コンテキスト固有のスキルを自律的に発見、洗練、選択する自己進化フレームワークである。
より良い文脈学習能力を得るために、どんな言語モデルにもプラグインできる。
論文 参考訳(メタデータ) (2026-04-30T09:53:15Z) - EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification [85.3692584167951]
Anthropicは、LLMエージェントが多段階のプロフェッショナルタスクに取り組むためのスキルの概念を提案する。
ツールは単一の自己完結型関数であり、スキルは相互依存型多ファイルアーティファクトの構造化バンドルである。
EvoSkillsは、エージェントが複雑なマルチファイルスキルパッケージを自律的に構築できる自己進化型スキルフレームワークである。
論文 参考訳(メタデータ) (2026-04-02T06:43:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。