論文の概要: SkillGym: Training Skill-Use Agents with Automatic Verifiable Environment Generation
- arxiv url: http://arxiv.org/abs/2609.37539v1
- Date: Tue, 29 Sep 2026 13:21:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.551651
- Title: SkillGym: Training Skill-Use Agents with Automatic Verifiable Environment Generation
- Title(参考訳): SkillGym: 自動検証環境生成によるスキル・ユース・エージェントの訓練
- Abstract要約: 我々はSkillGymを提案する。SkillGymは、検証可能な環境を構築し、軌道を収集し、スキル・ユース・エージェントを訓練するための自動パイプラインである。
SkillGymはまず大量のスキルをインターネットからクロールし、それを再現的にオフラインで動かす。
トレーニングは,エージェントにスキルの実践を教え,関連するスキルを28%から96%に向上させることを示す。
- 参考スコア(独自算出の注目度): 43.10536273212716
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Skills equip LLM agents with professional knowledge and guidance to complete long-horizon and complex tasks. Although skills have been widely adopted in recent agent paradigms and harnesses, how to synthesize reliable training data and how to train agents for skill use remain underexplored. In this work, we propose SkillGym, an automatic pipeline to build verifiable environments, collect trajectories, and train skill-use agents. SkillGym first crawls a large volume of skills from the internet, then keeps those whose workflows can run reproducibly offline. A builder-reviewer pipeline is used to construct difficulty-controlled tasks, spanning four task types, each with a reference solution and an executable verifier. With this pipeline, we build 6.8k environments and collect 19k verified successful trajectories for supervised finetuning. Finetuning on these trajectories improves LLMs of different families and sizes, from 2B to 122B parameters across four skill-use benchmarks; Our Qwen3.5-9B SFT model outperforms the 397B untrained model on two of them. Further analysis shows that training teaches agents to invoke skills, raising the rate of reading the relevant skill from 28% to 96%, and that the gains hold across reasoning structures, extending to task types that form a minority of the training data and to skills held out from training
- Abstract(参考訳): スキルはLLMエージェントに専門知識とガイダンスを与え、長期的かつ複雑なタスクを完了させる。
近年のエージェント・パラダイムやハーネスではスキルが広く採用されているが、信頼性の高いトレーニングデータの合成方法や、スキル・ユースのためのエージェントのトレーニング方法はまだ未定である。
本研究では,検証可能な環境の構築,トラジェクトリの収集,スキルユースエージェントのトレーニングのための自動パイプラインであるSkillGymを提案する。
SkillGymはまず大量のスキルをインターネットからクロールし、そのワークフローをオフラインで再現できる。
ビルダ-リビューアパイプラインは,4つのタスクタイプにそれぞれ参照ソリューションと実行可能検証を備えた,困難な制御タスクを構築するために使用される。
このパイプラインで6.8k環境を構築し、教師付き微調整のために19kの検証された軌道を収集する。
これらのトラジェクトリを微調整することで、4つのスキルユースベンチマークで2Bから122Bパラメータまで、異なるファミリーやサイズのLLMが改善される。
さらなる分析によると、訓練は、エージェントにスキルの発動を教え、関連するスキルの読み上げ率を28%から96%に引き上げ、学習データの一部を形成するタスクタイプやトレーニングから持たないスキルにまで拡張して、推論構造にまたがる利得を保っている。
関連論文リスト
- SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving [26.10002279918353]
textttSkillGymは、大規模な言語モデルエージェントのための実行可能な、検証可能なトレーニング環境に変換するフレームワークである。
われわれの35B textttSkillGym-AgentはスキルアシストSkillsBenchで51.47%に達し、Claude Sonnet 4.6、GPT-5.4 Mini、DeepSeek V4 Proのスコアを上回った。
論文 参考訳(メタデータ) (2026-09-23T11:35:34Z) - SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents [17.565432600589414]
大規模言語モデル(LLM)エージェントは、複雑な意思決定タスクのために強化学習(RL)を用いて訓練される。
SkillRLのような最近のスキルベースのアプローチは、生の軌跡からスキルを抽出することでこの問題に対処しようとしている。
SkillForgeは、環境相互作用を通じてスキルの検証と洗練を可能にする継続的スキル進化のためのフレームワークである。
論文 参考訳(メタデータ) (2026-08-25T15:52:10Z) - Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning [72.09826781730662]
ロングホライゾン推論は、モデルが推論チェーン内の異なるスキルを切り替えることを要求する。
スキル・エントロピー(Skill Entropy)とは、あるスキルから別のスキルに切り替えることの難しさを測る尺度である。
本稿では,RLフレームワークであるSkill-Entropy RLを提案する。
論文 参考訳(メタデータ) (2026-08-05T17:57:16Z) - SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation [34.60026807957888]
我々は、スキルユース機能を改善するための検証済みデータ合成パイプラインであるSKTを紹介する。
2,000の公開スキルを使用して、SKTは4000のタスクパッケージと27,164の検証軌道を生成する。
多様なモデル、ベンチマーク、エージェントハーネスにわたる実験により、SKT生成トラジェクトリの微調整が一貫してスキル使用性能を改善することが示されている。
論文 参考訳(メタデータ) (2026-08-03T14:18:00Z) - Parametric Skills [18.083331448567936]
ParametricSkillsは、フリーフォームのテキストスキルをテスト時にパラメータに変換し、文脈のないスキル活用を可能にするフレームワークである。
提案したParametricSkillsは,DeepSeek-V4-Flashで判断した,コンテキスト内学習を平均6.44ポイント上回る性能を示した。
論文 参考訳(メタデータ) (2026-06-29T09:19:32Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification [85.3692584167951]
Anthropicは、LLMエージェントが多段階のプロフェッショナルタスクに取り組むためのスキルの概念を提案する。
ツールは単一の自己完結型関数であり、スキルは相互依存型多ファイルアーティファクトの構造化バンドルである。
EvoSkillsは、エージェントが複雑なマルチファイルスキルパッケージを自律的に構築できる自己進化型スキルフレームワークである。
論文 参考訳(メタデータ) (2026-04-02T06:43:20Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。