論文の概要: What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills
- arxiv url: http://arxiv.org/abs/2608.04562v1
- Date: Wed, 05 Aug 2026 07:56:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.778917
- Title: What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills
- Title(参考訳): スキル・ワーストとは何か? エージェント・スキルの構造を意識したシェープ・バリュエーション
- Authors: Tao Li, Junfeng Liu, Qinghua Zhao, Yifan Li, Lei Wang, Bo Shao, Xuejun Liu, Linjun Shou,
- Abstract要約: 本稿では,スキル評価のための構造認識フレームワークであるSkillSVを紹介する。
SkillSVは、スキルを単位、依存関係、階層にコンパイルするので、有効なカウンターファクトのスキルのみが評価される。
ノイズエージェント評価のためのロールアウト予算推定器を用いて結果値を推定する。
- 参考スコア(独自算出の注目度): 18.13304162006297
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills are increasingly optimized by automated feedback loops, producing long structured artifacts whose internal value remains unclear. We study skill valuation: assigning credit to the internal units of a fixed skill, such as rules, examples, scripts, and heuristics, under a fixed agent and held-out task distribution. Skill valuation differs from data or prompt-span valuation because skill units are structured: they may depend on other units, belong to a document hierarchy, trigger agent behavior, and consume limited prompt context. We introduce SkillSV, a structure-aware Shapley-style framework for skill valuation. SkillSV compiles a skill into units, dependencies, and hierarchy, so that only valid counterfactual skills are evaluated. It uses paired deletion and length-neutral padding to separate content value from context cost, and estimates the resulting values with a rollout-budgeted estimator for noisy agent evaluations. On four agentic benchmarks, we assess the faithfulness, actionability, and explanation of SkillSV: it recovers unit interactions, preserves aggregate skill lift, and guides safe pruning and compression.
- Abstract(参考訳): エージェントスキルは、自動化されたフィードバックループによってますます最適化され、内部値が不明な長い構造化アーティファクトを生成する。
定型エージェントと定型タスク分散の下で,ルール,例,スクリプト,ヒューリスティックスなどの定型スキルの内部単位にクレジットを割り当てる。
スキル単位は、他の単位に依存し、文書階層に属し、エージェントの振る舞いをトリガーし、限られたプロンプトコンテキストを消費する。
スキル評価のための構造を意識したShapleyスタイルのフレームワークであるSkillSVを紹介する。
SkillSVは、スキルを単位、依存関係、階層にコンパイルするので、有効なカウンターファクトのスキルのみが評価される。
ペア削除と長さニュートラルパディングを用いて、コンテント値とコンテクストコストを分離し、ノイズエージェント評価のためのロールアウト予算推定器を用いて結果値を推定する。
4つのエージェントベンチマークにおいて,SkillSVの信頼性,動作性,説明性を評価し,ユニット間の相互作用を回復し,アグリゲートスキルリフトを保持し,安全な刈り取りと圧縮を導く。
関連論文リスト
- Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents [19.325317938976355]
我々は、スキル強化エージェントが、前述のスキル使用と介入測定の影響の体系的なギャップであるtextbfReasoning Backroom を提示するかどうかを問う。
BACKTRACE(BACKTRACE)は,各スキル条件の回答と一致した非スキルのカウンターファクトとをペアリングする評価フレームワークである。
BACKROOMBenchは、制御された論理と競合数学にまたがる検証ベッドである。
論文 参考訳(メタデータ) (2026-07-29T21:59:20Z) - Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment [10.850946672552277]
スキル中心アセスメントのためのエンドツーエンドフレームワークであるSkillAuditを紹介します。
実用性、効率/コスト、安全性にまたがる包括的多次元評価レポートを生成する。
トップランクの現実世界のスキルパッケージをスキャンした結果、スキルの7%以上が危険な状態にあることがわかった。
論文 参考訳(メタデータ) (2026-06-21T17:40:05Z) - A Framework for Evaluating Agentic Skills at Scale [0.4509560087514856]
エージェントスキルは構造化され、エージェント能力を増強する再利用可能な知識アーティファクトである。
個々のスキルを評価するための再利用可能な方法論は存在しない。
本稿では,スキルライターが現実的なタスクを構築できる評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-16T11:46:56Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents [58.87681796862133]
我々は経済的なレンズを通してスキルの書き直しを勉強する。
我々のフレームワークは、情報保存戦略を用いて、スキル構造をプロファイルし、スキルを書き換える。
SkillsBenchの実験は、戦略間の異なる品質とコストのトレードオフを明らかにしている。
論文 参考訳(メタデータ) (2026-06-08T12:36:51Z) - Co-Evolving Skill Generation and Policy Optimization [35.41582114275514]
既存の手法は通常、強力な言語モデルを使用してトラジェクトリを分析し、スキルを生成し、オンライントレーニング中に検索可能なスキルバンクを更新します。
プレストレージスキル検証のためのオンライン強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-07T17:55:55Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。