論文の概要: SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
- arxiv url: http://arxiv.org/abs/2608.10538v2
- Date: Fri, 14 Aug 2026 06:10:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.209354
- Title: SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
- Title(参考訳): SKILLER:小言語モデルにおける再利用可能なスキル抽出のための言語レベル強化学習
- Authors: Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li,
- Abstract要約: SKILLERは、小型モデルのエグゼクタ固有のスキルを自動的に生成するように設計された強化学習フレームワークである。
小モデルエージェントシステムを環境として扱い、自然言語を通して全ての強化学習信号を伝播する。
絶対利得は9Bモデルの4.3から20.4ポイント、4Bモデルの1.8から13.3ポイントである。
- 参考スコア(独自算出の注目度): 36.51227416423889
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Agent skills represent a standardized format for packaging procedural knowledge and domain expertise, serving within agent harness systems as an essential mechanism to continually constrain a language model's behavior space for repeatable, high-quality task execution. However, because strong closed-source models entail high inference costs, current popular agent harnesses, such as Codex and OpenClaw, remain prohibitively expensive when deploying these skills to accomplish real-world tasks. The rapid capability enhancement of open-source models deployable on consumer-grade GPUs presents a compelling opportunity to drastically reduce these costs by leveraging skill-based behavioral constraints. Nevertheless, automatically generating effective skills tailored specifically for such compact models remains a significant practical challenge. To address this, we propose SKILLER, a natural-language-driven reinforcement learning framework designed to automatically generate executor-specific skills for small models, which employs a strong model as the actor and critic, treats the small-model agent system as the environment, and propagates all reinforcement learning signals entirely via natural language. Extensive experimental evaluations across five relevant benchmarks using Qwen3.5-9B and Qwen3.5-4B demonstrate that SKILLER outperforms three open-source and one closed-source skill generation or evolution methods, achieving absolute gains ranging from 4.3 to 20.4 percentage points for the 9B model and 1.8 to 13.3 points for the 4B model, while remarkably matching the performance of strong closed-source models on single-skill tasks in SkillsBench. The project is available at https://github.com/DANG-ai/SKILLER.
- Abstract(参考訳): エージェントスキルは、手続き的知識とドメインの専門知識をパッケージングするための標準化されたフォーマットであり、エージェントハーネスシステム内で、反復可能で高品質なタスク実行のために言語モデルの振る舞い空間を継続的に制約する重要なメカニズムとして機能する。
しかし、強力なクローズドソースモデルは高い推論コストを必要とするため、CodexやOpenClawのような一般的なエージェントハーネスは、実際のタスクを達成するためにこれらのスキルをデプロイする際には、違法に高価である。
コンシューマグレードのGPUにデプロイ可能なオープンソースモデルの迅速な機能強化は、スキルベースの行動制約を活用することで、これらのコストを大幅に削減する、魅力的な機会を提供する。
しかし、そのようなコンパクトなモデルに特化された効果的なスキルを自動生成することは、依然として重要な課題である。
そこで本稿では,SKILLERという自然言語による強化学習フレームワークを提案する。このフレームワークは,アクタとして強力なモデルを採用し,小型モデルエージェントシステムを環境として扱い,すべての強化学習信号を自然言語で完全に伝達する。
Qwen3.5-9B と Qwen3.5-4B を用いた5つの関連するベンチマークで、SKILLER は3つのオープンソースおよび1つのクローズドソーススキル生成または進化手法より優れており、9Bモデルでは4.3から20.4ポイント、4Bモデルでは1.8から13.3ポイント、SkillsBench ではシングルスキルタスクでは強いクローズドソースモデルのパフォーマンスは著しく向上している。
このプロジェクトはhttps://github.com/DANG-ai/SKILLER.comで入手できる。
関連論文リスト
- SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents [15.598856888948093]
スキル強化エージェントシステムとスキル自体の自動評価フレームワークであるtextscOpenSkillEvalを提案する。
静的ベンチマークに頼る代わりに、textscOpenSkillEvalは、現実世界のアーティファクトの進化から現実的なタスクインスタンスを自動的に構築する。
600以上の動的に生成されたタスクインスタンスと30のオープンソーススキルを使用して、最先端のモデルとエージェントフレームワークを体系的に評価する。
論文 参考訳(メタデータ) (2026-05-22T14:09:41Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers [33.522307330599496]
ARMADAは、大規模な視覚言語モデルから言語のみのモデルに知識を伝達するために設計された、クロスモーダルな知識蒸留フレームワークである。
ARMADAを12の自然言語理解,8つの複雑な生成推論,5つの命令チューニングタスクで実証的に検証した。
本研究は,従来の知識蒸留パラダイムに挑戦し,視覚言語モデルであっても適切な蒸留を行うと言語モデルを大幅に向上させることができることを示した。
論文 参考訳(メタデータ) (2026-03-11T15:24:34Z) - Agent Skill Framework: Perspectives on the Potential of Small Language Models in Industrial Environments [14.079091139464175]
この研究は、エージェントスキルプロセスの形式的な数学的定義を導入し、その後、様々な大きさの言語モデルの体系的な評価を行った。
その結果、小型モデルは信頼性の高いスキル選択に苦しむ一方で、中程度のサイズのSLM(約12B~30B)はエージェントスキルアプローチから大きく恩恵を受けることがわかった。
論文 参考訳(メタデータ) (2026-02-18T17:52:17Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation [43.68215777330875]
我々は,小型モデルの精度を効果的に向上する,系統的な後学習パイプラインを導入する。
結果として得られた命令調整モデルにより、最先端のパフォーマンスが達成される。
この研究は、Ascendエッジデバイス上で高性能言語モデルを開発するための実用的で効率的なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-30T16:40:55Z) - Plex: Towards Reliability using Pretrained Large Model Extensions [69.13326436826227]
我々は,視覚と言語モダリティのための事前訓練された大規模モデル拡張であるViT-PlexとT5-Plexを開発した。
Plexは信頼性タスク間の最先端性を大幅に改善し、従来のプロトコルを単純化する。
最大1Bパラメータまでのモデルサイズに対するスケーリング効果と,最大4B例までのデータセットサイズを事前トレーニングした。
論文 参考訳(メタデータ) (2022-07-15T11:39:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。