論文の概要: SkillGrad: Optimizing Agent Skills Like Gradient Descent
- arxiv url: http://arxiv.org/abs/2605.27760v1
- Date: Tue, 26 May 2026 23:18:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.594503
- Title: SkillGrad: Optimizing Agent Skills Like Gradient Descent
- Title(参考訳): SkillGrad: グラディエントDescentのようなエージェントスキルを最適化する
- Authors: Hanyu Wang, Yifan Lan, Bochuan Cao, Lu Lin, Jinghui Chen,
- Abstract要約: エージェントスキルは、構造化ファイルに再利用可能な手続き的知識を格納することで、特殊なドメインにLLMエージェントを適用するための軽量な方法を提供する。
既存のスキル進化法はしばしば、明示的な定式化なしに反射を通してこれらの欠陥に対処する。
エージェントスキルを最適化するための勾配に着想を得たフレームワークであるSkillGradを提案する。
- 参考スコア(独自算出の注目度): 30.781132643932338
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent skills provide a lightweight way to adapt LLM agents to specialized domains by storing reusable procedural knowledge in structured files. However, whether downloaded from third parties or self-generated, these skills are often unreliable, incomplete, or outdated. Existing skill-evolution methods often address these deficiencies through heuristic reflections without an explicit optimization formulation. In this paper, we propose SkillGrad, a gradient-descent-inspired framework for optimizing agent skills. SkillGrad treats the skill package as a structured parameter to optimize in a gradient descent fashion: task executions provide trajectory-level loss evidence, automatic diagnoses then provide text-based gradients that indicate the correction directions. To stabilize optimization across iterations, a momentum agent accumulates recurring diagnostic patterns into a persistent memory overlay. Finally, an LLM-based patcher executes the parameter update by applying layer-aware edits to the skill package. Evaluated on SpreadsheetBench Verified and WikiTableQuestions, SkillGrad consistently outperforms training-based skill evolution baselines across two backbone LLMs, improving over the strongest training-based baseline by $6.7$ percentage points on average. Ablations further show that momentum and contrastive diagnosis both contribute to the final skill quality.
- Abstract(参考訳): エージェントスキルは、構造化ファイルに再利用可能な手続き的知識を格納することで、特殊なドメインにLLMエージェントを適用するための軽量な方法を提供する。
しかし、サードパーティからダウンロードするか、自己生成するかにかかわらず、これらのスキルは信頼できない、不完全な、あるいは時代遅れであることが多い。
既存のスキル進化法はしばしば、明示的な最適化の定式化なしにヒューリスティックなリフレクションを通してこれらの欠陥に対処する。
本稿では,エージェントスキルを最適化するための勾配に着想を得たフレームワークであるSkillGradを提案する。
タスクの実行は軌道レベルの損失証拠を提供し、自動診断は修正方向を示すテキストベースの勾配を提供する。
繰り返しの最適化を安定させるために、モーメントエージェントは繰り返し発生する診断パターンを永続的なメモリオーバーレイに蓄積する。
最後に、LCMベースのパッチは、レイヤー認識編集をスキルパッケージに適用することにより、パラメータ更新を実行する。
SpreadsheetBench VerifiedとWikiTableQuestionsで評価されたSkillGradは、トレーニングベースのスキル進化ベースラインを2つのバックボーンLCMで一貫して上回り、トレーニングベースのベースラインを平均6.7ドルポイント改善した。
アブレーションは、運動量とコントラスト診断の両方が最終技術品質に寄与することを示している。
関連論文リスト
- CODESKILL: Learning Self-Evolving Skills for Coding Agents [13.599750520978988]
コーディングエージェントは、ソフトウェアエンジニアリングタスクを解決しながら、豊富な軌道を生成する。
エージェントの自己進化を可能にするために、これらの軌道は、体験をコンパクトにエンコードして将来の行動を導く再利用可能な手続きスキルに蒸留することができる。
CODESKILLは,学習可能な管理方針として,スキル抽出とスキルバンクのメンテナンスを再構築するLLMベースのフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T05:12:49Z) - Harnessing LLM Agents with Skill Programs [58.356514745548026]
HASPは、実行可能なプログラム関数(PF)にスキルをアップグレードする新しいフレームワークです。
PFは障害が発生しやすい状態を起動し、次のアクションを変更したり、修正コンテキストを注入する実行可能なガードレールとして機能する。
HASPは、Web検索、数学推論、コーディングタスクにおいて、トレーニング不要とトレーニングベースの両方の手法と比較して、大幅に向上している。
論文 参考訳(メタデータ) (2026-05-18T01:35:11Z) - Skill-R1: Agent Skill Evolution via Reinforcement Learning [84.35984979949502]
Skill-R1は、検証可能な報酬からインスタンスレベルの繰り返しスキル最適化のための強化学習フレームワークである。
オープンソースモデルとクローズドソースモデルの両方とのブラックボックス互換性を維持しつつ、モデルレベルの更新よりも大幅に安価に適応できる。
論文 参考訳(メタデータ) (2026-05-10T06:19:15Z) - SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents [6.293920920196533]
SkillLensは階層的なスキル進化フレームワークで、スキルをポリシー、戦略、手順、プリミティブの4層グラフにまとめる。
セマンティックなスキルシードを検索し、スキルグラフの次数補正されたランダムウォークを通じて拡張し、各訪問したユニットが受け入れられ、分解され、書き直され、スキップされるかどうかを検証器を使って決定する。
MuLocbenchとALFWorld全体で、SkillLensは、強いスキルベースのベースラインよりも一貫して改善されている。
論文 参考訳(メタデータ) (2026-05-08T18:48:04Z) - SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering [9.008257157319271]
SkillMOOはパスレートを最大131%改善し、最適化オーバーヘッドの低いタスク毎の最高のベースラインに対して、コストを最大32%削減する。
LLMによる編集とNSGA-IIサバイバルセレクションを用いて,自動でスキルバンドルを進化させる多目的最適化フレームワークであるSkillMOOを提案する。
3つのSkillsBenchソフトウェアエンジニアリングタスクでは、SkillMOOはパスレートを最大131%改善し、最適化オーバーヘッドの低いタスク毎の最高のベースラインに対して最大32%のコスト削減を実現している。
論文 参考訳(メタデータ) (2026-04-10T13:08:01Z) - MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild [74.7263562191605]
大規模言語モデル(LLM)エージェントは、複雑なタスクにますます使われている。
既存の方法は、知識を蒸留せずに生の軌跡を保存するか、静的なスキルライブラリを維持するか、または再訓練のために破壊的なダウンタイムを必要とする。
本稿では,基本的なLCMポリシと再利用可能な行動スキルのライブラリを共同で進化させるメタ学習フレームワークであるMetaClawを紹介する。
論文 参考訳(メタデータ) (2026-03-17T22:30:30Z) - EvoSkill: Automated Skill Discovery for Multi-Agent Systems [6.319876096746374]
エージェントスキルを自動的に発見・洗練する自己進化型フレームワークである textbfEvoSkill を紹介する。
EvoSkillは実行障害を分析し、新しいスキルや既存のスキルへの編集を提案し、それらを構造化された再利用可能なスキルフォルダに実体化する。
われわれはEvoSkillを米国財務データの根拠となる推論ベンチマークであるOfficeQAと、ノイズの多い検索ベンチマークであるSealQAの2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-03T09:07:22Z) - GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning [55.03441672267886]
強化学習のための勾配整列データ選択法GradAlignを提案する。
GradAlignは,信頼できない報酬信号,分散不均衡,低ユーティリティトレーニングコーパスの3つにまたがって評価する。
論文 参考訳(メタデータ) (2026-02-25T01:54:50Z) - ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。