論文の概要: EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?
- arxiv url: http://arxiv.org/abs/2607.09711v1
- Date: Tue, 23 Jun 2026 19:14:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.382298
- Title: EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?
- Title(参考訳): EvoClawBench: エージェントは自分のランから再利用可能なスキルを学ぶことができるか?
- Authors: Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo,
- Abstract要約: 既存のエージェントベンチマークは、主にタスクの完了、ツールの使用、またはスキルユーティリティをテストする。
EvoClawBenchは,このクローズドループスキル学習質問に対する,反復的,フィクスチャ支援タスクのベンチマークである。
エージェントループにスキルオーサリングを追加することによる自動的なメリットではなく,エージェント自身のランニングから再利用可能なスキルを学習することが選択的かつコスト依存的であることを示す。
- 参考スコア(独自算出の注目度): 26.111653210817853
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing agent benchmarks primarily test task completion, tool use, or skill utility, but do not isolate whether a runtime can convert evidence from its own runs into reusable skills that improve fresh executions after authoring overhead. We introduce EvoClawBench, a benchmark for this closed-loop skill-learning question on repeated, fixture-backed tasks. EvoClawBench compares direct execution without skills, PreSkill authoring before execution, and PostSkill summarization from first-run evidence followed by a fresh second execution. The suite contains 100 tasks and 502 sub-problems across coding, data, office, security, operations, and domain-document workflows, with support for multiple agent runtimes. Experiments with OpenClaw and nanobot under local execution show that direct baseline performance is strongly runtime-dependent: OpenClaw remains below 20% across models, while nanobot ranges from 56.45% to 96.13%. Self-authored skills have mixed effects. nanobot GPT-5.4 stays above 96% in all modes and MiniMax-M2.7 improves from 90.97% to 94.50% under PostSkill, but nanobot DeepSeek-V4-Pro drops from 77.77% to 4.80% with PreSkill and 0.99% with PostSkill. OpenClaw shows similarly non-monotonic behavior, with some skill runs near baseline and others collapsing. These results indicate that learning reusable skills from an agent's own runs is selective and cost-sensitive, rather than an automatic benefit of adding skill authoring to an agent loop.
- Abstract(参考訳): 既存のエージェントベンチマークは、主にタスクの完了、ツールの使用、またはスキルユーティリティをテストするが、ランタイムがエビデンスを自身の実行から再利用可能なスキルに変換することができるかどうかを分離しない。
EvoClawBenchは,このクローズドループスキル学習質問に対する,反復的,フィクスチャ支援タスクのベンチマークである。
EvoClawBenchは、スキルのない直接実行、実行前のPreSkillオーサリング、ファーストランエビデンスからのPostSkill要約、そして新しい2回目の実行とを比較している。
このスイートには、コーディング、データ、オフィス、セキュリティ、オペレーション、ドメインドキュメントワークフローにまたがる100のタスクと502のサブプロブレムが含まれており、複数のエージェントランタイムをサポートする。
OpenClawはモデル全体で20%以下であり、nanobotは56.45%から96.13%である。
自己権限のスキルには、さまざまな効果があります。
ナノボットのGPT-5.4は全モードで96%以上、MiniMax-M2.7は90.97%から94.50%に改善されたが、ナノボットのDeepSeek-V4-Proは77.77%から4.80%に低下し、PreSkillは0.99%となった。
OpenClawも同様にモノトニックな動作を示し、いくつかのスキルはベースライン近くで動作し、他のスキルは崩壊する。
これらの結果は,エージェントループにスキルオーサリングを追加することによる自動的なメリットよりも,エージェント自身のランニングから再利用可能なスキルを学習することが選択的かつコスト感受性であることが示唆された。
関連論文リスト
- Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - VISUALSKILL: Multimodal Skills for Computer-Use Agents [63.79539541125141]
ターゲットアプリケーション毎に調整された階層型マルチモーダルスキルであるVISUALSKILLを提案する。
著者によるドキュメンテーションとライブアプリケーションUI探索を組み合わせた2段階のパイプラインで、それぞれのスキルを構築します。
2つのCUAベンチマークでは、Claude Code CLIエージェントがClaude Opus 4.6によって支援され、VISUALSKILLで平均スコア0.456に達した。
論文 参考訳(メタデータ) (2026-06-16T19:57:07Z) - Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents [99.67681154381803]
Test-time Rule Acquisition and Compiled Enforcement (TRACE)は、コーディングエージェントランタイムのためのスキル層パイプラインである。
開発者が事前に記述した実行時チェックとは異なり、TRACEスキルはユーザのチャット修正に由来する。
論文 参考訳(メタデータ) (2026-06-11T10:43:40Z) - SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows [16.693609667845948]
SKILL.nbは,エビデンス・リバース・キャリブレーションによるライフサイクルポリシーによる再利用可能なエージェント管理のためのフレームワークである。
SKILL.nbは選択的な形式化を使用する: 実行はどのワークフローステップを実行可能なコードにするかを決定する。
ゲート条件付き実行では、各ステップがゲートの検証時にコードを実行したり、ドリフトが実行可能実現を無効にした場合にローカルにフォールバックすることが可能になる。
論文 参考訳(メタデータ) (2026-06-06T08:27:18Z) - MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills [24.371534406647978]
MalSkillBenchは、悪質なエージェントスキルの最初のランタイム検証ベンチマークである。
コードインジェクションは94.5%に達するが、迅速なインジェクションは75.8%に過ぎない。
データセット、パイプライン、ベースライン、結果をリリースしています。
論文 参考訳(メタデータ) (2026-06-05T10:43:19Z) - SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces [6.384302247811717]
既存のフレームワークでは、一度ランタイムタスクにマッチしたコンテキストガイダンスとして、通常、スキルがエージェント推論ループに注入されます。
この実行パラダイムは、無関係なコンテキスト注入と、スキル固有の推論と計画の2つの主要な冗長性源を導入している。
我々は,スキルパッケージをオフラインで最小限の実行可能なインターフェースにコンパイルする,境界優先のコンパイラランタイムフレームワークであるSkillSmithを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:25:25Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SkillEvolver: Skill Learning as a Meta-Skill [46.52001686198623]
オンラインスキル学習のための軽量なプラグアンドプレイソリューションである textbfSkillEvolver を提案する。
SkillEvolverの学習対象は、モデルの重みではなく、スキルの散文とコードである。
微量蒸留とは異なり、メタスキルは学習スキルの展開後にのみ洗練される。
論文 参考訳(メタデータ) (2026-05-11T12:58:25Z) - SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills [0.0]
SkillSieveは3層検出フレームワークで、必要に応じてより深く分析する。
400スキルのラベル付きベンチマークでは、SkillSieveは0.800 F1を達成し、ClawVetの0.421を上回った。
論文 参考訳(メタデータ) (2026-04-08T00:58:48Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。