論文の概要: SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
- arxiv url: http://arxiv.org/abs/2608.09253v1
- Date: Mon, 10 Aug 2026 08:13:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.141002
- Title: SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
- Title(参考訳): SkillSentry: 実行保証を通じてLLMエージェントの信頼性の高いスキル実行
- Abstract要約: SkillSentryは、スキル実行のためのランタイムガイダンスを表現するための、スキル指向のランタイム保証フレームワークである。
SkillSentryは2つのLLMエージェントにまたがって15のスキルで評価され、それぞれに2つのバックボーンモデルが組み合わされた。
その結果、SkillSentryはLLMエージェントのタスク成功率を平均24.1%向上させ、繰り返し実行時の変動度を低下させることを示した。
- 参考スコア(独自算出の注目度): 10.175883215226776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents are increasingly equipped with skills to perform complex tasks through multi-step reasoning and tool use. Although skills provide reusable procedural knowledge, agents may still execute them unreliably. Even when an agent has demonstrated the capability to complete tasks under the guidance of a skill, it may fail to do so consistently across similar tasks or repeated runs due to deviations from the skill procedure or incorrect execution of individual steps. Such instability limits the practical reliability of LLM agents. To address this problem, we propose SkillSentry, a skill-oriented runtime assurance framework built upon a new domain-specific language (DSL) for representing runtime guidance for skill execution. SkillSentry initializes the runtime guidance by combining a skill specification extracted from the corresponding skill document with execution experience mined from historical successful and failed traces. It then wraps around the agent execution loop to monitor and guide skill execution under the current guidance, while iteratively refining the guidance using newly collected traces. We evaluate SkillSentry on 15 skills across two LLM agents, each paired with two backbone models, i.e., Claude Code with Claude-Haiku-4.5 and Claude-Opus-4.6, and Codex with GPT-5.2 and GPT-5.4. Our results show that SkillSentry improves the task success rate of LLM agents by 24.1% across skills, on average, while exhibiting lower variability across repeated runs.
- Abstract(参考訳): LLMエージェントは、多段階の推論とツールの使用を通じて複雑なタスクを実行するスキルをますます備えている。
スキルは再利用可能な手続き的知識を提供するが、エージェントはそれらを信頼できない方法で実行することができる。
エージェントが、スキルの指導の下でタスクを完了させる能力を示したとしても、スキル手順からの逸脱や個々のステップの誤った実行のために、同様のタスクや繰り返し実行を一貫して実行できない場合がある。
このような不安定性はLLMエージェントの実用的信頼性を制限している。
この問題に対処するため、スキル実行のためのランタイムガイダンスを表現するために、新しいドメイン固有言語(DSL)上に構築されたスキル指向ランタイム保証フレームワークであるSkillSentryを提案する。
SkillSentryは、対応するスキルドキュメントから抽出したスキル仕様と、過去の成功と失敗のトレースから抽出した実行経験を組み合わせることで、実行時のガイダンスを初期化する。
その後、エージェントの実行ループをラップして、現在のガイダンスの下でのスキル実行を監視し、ガイドし、新たに収集されたトレースを使用してガイダンスを反復的に修正する。
SkillSentryは2つのLDMエージェントにまたがって15のスキルで評価され、それぞれに2つのバックボーンモデル、すなわちClaude-Haiku-4.5とClaude-Opus-4.6、GPT-5.2とGPT-5.4のコーデックスが組み合わされた。
その結果、SkillSentryはLLMエージェントのタスク成功率を平均24.1%向上させ、繰り返し実行時のタスク成功率を低下させることを示した。
関連論文リスト
- Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses? [38.776828282073865]
プログレッシブな開示下でのスキル使用を評価するベンチマークであるSkill-Useを紹介する。
トリガーは、エージェントが関連するスキルを起動するかどうかを計測し、コンプライアンスは、それが所定の手順に従うかを忠実に測定し、バウンダリは、それが禁止された操作を避けるかどうかを計測する。
スキル・ユース(SU)スコアは、スキルが起動された後にのみ3つとクレジットの実行を組み合わせる。
論文 参考訳(メタデータ) (2026-08-05T13:29:16Z) - Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills? [36.863282825853645]
MMG2Skillは、ワイルドガイドをエージェント実行可能なスキルに変換するためのフレームワークである。
MMG2Skillは、モデルドメイン設定毎にバニラベースラインエージェントを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-01T09:50:40Z) - SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision [41.562357872885826]
SkillReviseはエージェントスキルを反復的に洗練するために設計された実行基盤フレームワークである。
SkillReviseは、実行エビデンスからスキル欠陥を診断し、一般的なメモリから関連する修復原則を検索し、実行順に編集を適用する。
単発ベースラインを大幅に上回り、SkillsBenchにおけるベースエージェントの成功率は36.05%から61.63%に向上した。
論文 参考訳(メタデータ) (2026-05-31T10:19:13Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - SkillMaster: Toward Autonomous Skill Mastery in LLM Agents [27.651128308229378]
SkillMasterは、エージェントに新しいスキルを作り、既存のスキルを洗練させ、タスク解決中に蓄積したスキルを選択する訓練フレームワークである。
第一に、私たちは、軌道インフォームドスキルレビューを通じてエージェントを訓練し、完成したエピソードの証拠に基づいて、提案、更新、保持するためのエージェントを指導する。
第2に、各候補スキル編集は、関連するプローブタスクに対する対実的ユーティリティによって評価され、スキル編集決定を訓練するための直接学習信号を提供する。
第3に、DualAdv-GRPOを導入し、タスク解決行動とスキル編集決定の利点を個別に推定し、タスク解決における共同トレーニングを安定化する。
論文 参考訳(メタデータ) (2026-05-09T05:03:00Z) - SkillOS: Learning Skill Curation for Self-Evolving Agents [67.94374107466957]
本稿では,自己進化エージェントのスキルキュレーションを学習するための,経験駆動型RLトレーニングレシピであるSkillOSを提案する。
SkillOSは、凍結したエージェントエグゼキュータとトレーニング可能なスキルキュレーターを組み合わせて、蓄積したエクスペリエンスから外部SkillRepoを更新する。
SkillOSは、メモリフリーと強力なメモリベースラインを、有効性と効率の両方で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-07T17:31:50Z) - How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings [29.3744517703302]
本研究は,段階的に挑戦的な現実的な環境下でのスキルユーティリティの総合的研究である。
その結果、設定がよりリアルになるにつれて、パフォーマンスは一貫して低下することがわかった。
クエリ固有の改善は、初期スキルが合理的な妥当性と品質を持つ場合に、性能を著しく回復することを示す。
論文 参考訳(メタデータ) (2026-04-06T00:10:30Z) - EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification [85.3692584167951]
Anthropicは、LLMエージェントが多段階のプロフェッショナルタスクに取り組むためのスキルの概念を提案する。
ツールは単一の自己完結型関数であり、スキルは相互依存型多ファイルアーティファクトの構造化バンドルである。
EvoSkillsは、エージェントが複雑なマルチファイルスキルパッケージを自律的に構築できる自己進化型スキルフレームワークである。
論文 参考訳(メタデータ) (2026-04-02T06:43:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。