論文の概要: Agent Skill Evolution: How Revisions Affect Coding Agents
- arxiv url: http://arxiv.org/abs/2610.04832v1
- Date: Sun, 04 Oct 2026 00:33:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 08:32:51.141484
- Title: Agent Skill Evolution: How Revisions Affect Coding Agents
- Title(参考訳): エージェントスキルの進化:コーディングエージェントにどのように影響するか
- Abstract要約: 我々は、エージェントのハーネスの設定とともに、スキルがどのように進化し、どのように変化するかを特徴付ける。
ほとんどのリビジョン(55%)はルールやプロシージャを変更し、CLAUDE.mdのようなスキル変更ファイルを同じサイズの他のコミットよりも頻繁に修正するコミットである。
修正では、単一の回答に18-19%の入力トークンを追加し、エージェントエピソードには検出可能なコストがかからない一方で、スキル本体をロードすると、エピソードのトークンが平均50%上昇する。
- 参考スコア(独自算出の注目度): 14.22442992777441
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent Skills, the SKILL.md files that tell an LLM coding agent how a project works, are revised like code, yet what a revision does to the agent is unknown. From 2,608 first/last revision pairs of 3,159 Skills, we characterize how Skills evolve and how they change together with the configuration of the agent's harness. We then focus on rule changes, revisions that add or remove a rule we can check automatically, such as "run allium check". We measure their effect on 21 models in single answers and on four agents in a sandbox, and their cost on 20 of these models and the four agents. Most revisions (55%) change a rule or procedure, and commits that revise a Skill change harness files such as CLAUDE.md more often than other commits of the same size. Across 16 open-weight models, an added rule raises compliance in a single answer by +0.41 on average. Across the four agents, the rate at which the agent takes the required action rises by +0.23 on average (+0.16 to +0.36), and for the three agents that blind judges assessed, final correctness rises by +0.10 on average (+0.06 to +0.14). The gain comes mainly from rules that name a command or path the old Skill did not mention. Real tools load a Skill's body only when the agent decides it needs it. In that setting the four agents keep about half of the action gain on average (51%), and the three open models about 38%. A revision adds 18-19% input tokens to a single answer and no detectable cost to an agent episode, while loading a Skill's body raises the tokens of an episode by 50% on average.
- Abstract(参考訳): エージェントスキル(Agens Skills) - LLMのコーディングエージェントにプロジェクトがどのように動作するかを伝えるSKILL.mdファイル。
2,608個の最初の/最後の2対の3,159個のスキルから、スキルがどのように進化し、エージェントのハーネスの設定とともにどのように変化するかを特徴付ける。
その後、ルールの変更、"run allium check"などの自動チェック可能なルールの追加や削除に重点を置いています。
一つの回答で21モデル,サンドボックスで4エージェント,そしてこれら20モデルと4エージェントのコストを計測した。
ほとんどのリビジョン(55%)はルールやプロシージャを変更し、CLAUDE.mdのようなスキル変更ファイルを同じサイズの他のコミットよりも頻繁に修正するコミットである。
16のオープンウェイトモデルに対して、追加のルールは1つの回答におけるコンプライアンスを平均で+0.41に引き上げる。
4つのエージェント全体では、エージェントが要求されるアクションを取る速度は、平均で0.23以上(+0.16から+0.36)、盲目の裁判官が評価した3つのエージェントでは、最終的な正しさは平均で+0.10以上(+0.06から+0.14)である。
ゲインは主に、古いスキルが言及しなかったコマンドやパスを名付けるルールから来ている。
実際のツールは、エージェントが必要なときにのみスキルの身体をロードする。
この設定では、4人のエージェントは平均してアクションゲインの約半分(51%)を保ち、3つのオープンモデルは約38%である。
修正では、単一の回答に18-19%の入力トークンを追加し、エージェントエピソードには検出可能なコストがかからない一方で、スキル本体をロードすると、エピソードのトークンが平均50%上昇する。
関連論文リスト
- Teaching Agents to Code Reliably [12.841316191115778]
リポジトリの問題を解決するために、自律的なコーディングエージェントを訓練する方法を示す。
トレーニングがこれらの行動を政策にどう移行するかを示す。
パス@1から43.0%に上昇し、パス@8から60.7%に上昇し、検証精度を26.8%から41.7%に引き上げる。
論文 参考訳(メタデータ) (2026-10-02T19:47:19Z) - Agents Are Systems, Not Models: Rethinking Agentic Evaluation [80.87068485535677]
エージェントの構成の5つの部分(タスク情報、推論、自己検証、時間予算、バックボーンモデル)について検討する。
結果の約54%は、変更ではなく、同じ構成を繰り返すことによるものです。
ベンチマークと18,000以上のエージェントトラジェクトリをリリースする。
論文 参考訳(メタデータ) (2026-10-01T12:55:07Z) - Scale and Selection: What Makes Automatic Harness Evolution Work for Visual-Interface Robot Agents [0.9961969009329336]
市販の符号化エージェントのハーネスは,他のエージェントによって自動的に改善可能であることを示す。
単一ロールアウトはノイズの多いバイナリ結果なので、1ラウンドあたりのロールアウトが少なく、運良くリビジョンを推進できます。
修正されるたびに、不確定な編集が蓄積されると、10ラウンド以内にパフォーマンスが下向きにドリフトする。
論文 参考訳(メタデータ) (2026-09-30T08:46:38Z) - SAGE: A Statistical Acceptance Gate for Self-Evolving Agents [17.727663090075463]
自己進化型エージェント(SAGE)の統計的受容ゲートを提案する。
SAGEはベースラインの編集のサブセットのみをコミットし、利得が信頼できないものや、壊れたアイテムによって購入されるものをフィルタリングする。
全20セットで最高得点を記録し、LiveMathは34.15から48.78に上昇した。
論文 参考訳(メタデータ) (2026-09-28T18:07:45Z) - Reinforcement Learning of Communication in a Mesh of Small Language Models [0.0]
私たちは、小さな言語モデルエージェントの分散メッシュであるTalkMeshを紹介します。
各エージェントは提案をサンプリングし、訓練された信頼度ヘッドでスコア付けする。
最も自信のあるエージェントはヒントを放送し、エージェントは信頼のしきい値以下で修正し、各リビジョンは提案を上回ります。
ゴシップ・コンセンサス(Gossip consensus)は、コーディネーターを使わずに、自信によって重み付けられた票を近似する。
論文 参考訳(メタデータ) (2026-09-24T21:41:12Z) - Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents [50.78646963535282]
Skill-as-Pseudocode (SaP) はマークダウンスキルライブラリの型付き擬似コードへの自動変換である。
1つ以上のスキルから引き出された類似の手続きパスのクラスタごとに、SaPは型付きコントラクトを抽出し、それを4チェック決定性検証器を通じてフィルタリングする。
プロモートされた契約は、復元された具体的なアクションテンプレートと共に書き直されたスキルスケルトンにインライン化され、エージェントは2つの補完的な信号を与える。
論文 参考訳(メタデータ) (2026-05-27T04:48:40Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents [58.79302663733703]
大規模言語モデルに基づくマルチエージェントシステムは、専門家エージェントの協力により、様々なタスクにまたがる優れた能力を示している。
不器用なエージェントや悪意のあるエージェントが与える影響 - システム全体のパフォーマンスにおいて、頻繁にタスクでエラーを犯すものは、いまだに過小評価されていない。
本稿では,下流タスクにおける障害要因下での各種システム構造のレジリエンスについて検討する。
論文 参考訳(メタデータ) (2024-08-02T03:25:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。