論文の概要: SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use
- arxiv url: http://arxiv.org/abs/2607.01874v1
- Date: Thu, 02 Jul 2026 08:28:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.745661
- Title: SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use
- Title(参考訳): SkillCoach: エージェントスキル使用の評価と改善のための自己進化型ルーブリック
- Authors: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue,
- Abstract要約: SkillCoachは、エージェントのスキル使用を評価し、強化するための自己進化フレームワークである。
実際のロールアウトから熟練したプロセスルーブリックを導き、四次元に沿って軌道を評価する。
外部検証器を別個の結果信号として保持し、プロセス品質を偶然のタスク成功と区別できるようにする。
- 参考スコア(独自算出の注目度): 21.05387636058484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Skills are becoming a reusable operational layer for LLM agents, encoding SOPs, domain rules, tool workflows, scripts, and validation routines. In realistic skill repositories, overlapping skills make reliable skill-use difficult. Final verifier success is too coarse for both evaluation and training, since an agent may pass through trial and error while selecting distractor skills, skipping required steps, composing workflows incorrectly or omitting final checks. We introduce SkillCoach, a self-evolving rubric framework for evaluating and enhancing agentic skill-use. SkillCoach derives skill-grounded process rubrics from real rollouts and evaluates trajectories along four dimensions: skill selection, skill following, skill composition, and skill-grounded reflection. It keeps the external verifier as a separate outcome signal, allowing process quality to be distinguished from accidental task success. The evolved rubrics further serve as process supervision for selecting high-quality training trajectories. Experiments show that evolved rubrics substantially improve evaluation quality, expose failures hidden by final accuracy, and provide stronger supervision signals than outcome-only filtering for enhancing agentic skill-use.
- Abstract(参考訳): スキルは、SOP、ドメインルール、ツールワークフロー、スクリプト、バリデーションルーチンをエンコードする、LLMエージェントの再利用可能な運用レイヤになりつつある。
現実的なスキルリポジトリでは、重複するスキルは、信頼性の高いスキル使用を困難にします。
エージェントは、試行錯誤のスキルを選択したり、必要なステップをスキップしたり、ワークフローを誤って作成したり、最終チェックを省略したりしながら、試行錯誤を行う可能性がある。
本稿では,エージェント・スキル・ユースを評価するための自己進化型ルーリック・フレームワークであるSkillCoachを紹介する。
SkillCoachは、実際のロールアウトからスキルグラウンドのプロセスルーブリックを導き、スキル選択、スキルフォロー、スキルコンポジション、スキルグラウンドのリフレクションの4つの側面に沿って軌道を評価する。
外部検証器を別個の結果信号として保持し、プロセス品質を偶然のタスク成功と区別できるようにする。
進化したルーリックは、高品質な訓練軌道を選択するためのプロセスの監督の役割も担っている。
実験により、進化した潤滑剤は評価品質を大幅に改善し、最終精度で隠蔽された故障を露呈し、結果のみのフィルタリングよりも強力な監視信号を提供し、エージェントのスキル使用を向上させることが示されている。
関連論文リスト
- SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment [10.850946672552277]
スキル中心アセスメントのためのエンドツーエンドフレームワークであるSkillAuditを紹介します。
実用性、効率/コスト、安全性にまたがる包括的多次元評価レポートを生成する。
トップランクの現実世界のスキルパッケージをスキャンした結果、スキルの7%以上が危険な状態にあることがわかった。
論文 参考訳(メタデータ) (2026-06-21T17:40:05Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision [41.562357872885826]
SkillReviseはエージェントスキルを反復的に洗練するために設計された実行基盤フレームワークである。
SkillReviseは、実行エビデンスからスキル欠陥を診断し、一般的なメモリから関連する修復原則を検索し、実行順に編集を適用する。
単発ベースラインを大幅に上回り、SkillsBenchにおけるベースエージェントの成功率は36.05%から61.63%に向上した。
論文 参考訳(メタデータ) (2026-05-31T10:19:13Z) - Harnessing LLM Agents with Skill Programs [58.356514745548026]
HASPは、実行可能なプログラム関数(PF)にスキルをアップグレードする新しいフレームワークです。
PFは障害が発生しやすい状態を起動し、次のアクションを変更したり、修正コンテキストを注入する実行可能なガードレールとして機能する。
HASPは、Web検索、数学推論、コーディングタスクにおいて、トレーニング不要とトレーニングベースの両方の手法と比較して、大幅に向上している。
論文 参考訳(メタデータ) (2026-05-18T01:35:11Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - SkillMaster: Toward Autonomous Skill Mastery in LLM Agents [27.651128308229378]
SkillMasterは、エージェントに新しいスキルを作り、既存のスキルを洗練させ、タスク解決中に蓄積したスキルを選択する訓練フレームワークである。
第一に、私たちは、軌道インフォームドスキルレビューを通じてエージェントを訓練し、完成したエピソードの証拠に基づいて、提案、更新、保持するためのエージェントを指導する。
第2に、各候補スキル編集は、関連するプローブタスクに対する対実的ユーティリティによって評価され、スキル編集決定を訓練するための直接学習信号を提供する。
第3に、DualAdv-GRPOを導入し、タスク解決行動とスキル編集決定の利点を個別に推定し、タスク解決における共同トレーニングを安定化する。
論文 参考訳(メタデータ) (2026-05-09T05:03:00Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。