論文の概要: ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents
- arxiv url: http://arxiv.org/abs/2603.20340v1
- Date: Fri, 20 Mar 2026 09:25:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:38.853731
- Title: ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents
- Title(参考訳): ContractSkill: マルチモーダルWebエージェントのための修理可能なコントラクトベースのスキル
- Abstract要約: 私たちは、ドラフトスキルをコントラクト化された実行可能なアーティファクトに変換するフレームワークであるContractSkillを紹介します。
この表現は、決定論的検証、ステップレベルのフォールトローカライゼーション、最小限のパッチベースの修復を可能にする。
- 参考スコア(独自算出の注目度): 13.2889725132666
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite rapid progress in multimodal GUI agents, reusable skill acquisition remains difficult because on-demand generated skills often leave action semantics, state assumptions, and success criteria implicit. This makes them brittle to execution errors, hard to verify, and difficult to repair. We present ContractSkill, a framework that converts a draft skill into a contracted executable artifact with explicit preconditions, step specifications, postconditions, recovery rules, and termination checks. This representation enables deterministic verification, step-level fault localization, and minimal patch-based repair, turning skill refinement into localized editing rather than full regeneration. Experiments on VisualWebArena and MiniWoB with GLM-4.6V and Qwen3.5-Plus show that ContractSkill improves self-generated skills from 9.4% and 10.9% to 28.1% and 37.5% on VisualWebArena, and from 66.5% and 60.5% to 77.5% and 81.0% on MiniWoB. Repaired artifacts also transfer across models, improving the target model's self-generated-skill baseline by up to 47.8 points and 12.8 points on the two benchmarks, respectively. These results suggest that agent skills are better treated as explicit procedural artifacts that can be verified, repaired, and shared across models.
- Abstract(参考訳): マルチモーダルGUIエージェントの急速な進歩にもかかわらず、オンデマンドで生成されたスキルはアクションセマンティクス、状態仮定、成功基準を暗黙的に残すため、再利用可能なスキル獲得は依然として困難である。
これにより、実行エラーに対して脆弱になり、検証が難しく、修正が困難になる。
ContractSkillは、ドラフトスキルを明示的な前提条件、ステップ仕様、後条件、リカバリルール、終了チェックを備えた、契約された実行可能なアーティファクトに変換するフレームワークです。
この表現は、決定論的検証、ステップレベルのフォールトローカライゼーション、パッチベースの最小限の修復を可能にし、スキル改善を完全な再生ではなくローカライズされた編集に変換する。
GLM-4.6VとQwen3.5-PlusによるVisualWebArenaとMiniWoBの実験では、ContractSkillは、VisualWebArenaで9.4%から10.9%、28.1%、37.5%、MiniWoBで66.5%、60.5%、77.5%、そして81.0%の自己生成スキルを改善している。
修復されたアーティファクトはモデル間で転送され、ターゲットモデルの自己生成スキルベースラインは2つのベンチマークでそれぞれ47.8ポイント、12.8ポイント向上した。
これらの結果から, エージェントスキルは, モデル間で検証, 修復, 共有可能な明示的な手続き的アーティファクトとして扱われることが示唆された。
関連論文リスト
- Signal or Noise? A Benchmark Study of Agent Skills in Web Development [6.7220476997481375]
私たちはWebDev-Skills-Benchを使って、50のWeb-Benchプロジェクトで31の公開WebDevスキルと1000のタスクを研究しています。
4つのモデル全体で、ターゲットスキルインジェクションは平均パス@2を1.3%減らして4.2%減らし、タスク完了の深さを低くし、トークンコストを72%減らして394%減らす。
損失は簡単な初期タスクに集中し、スキルランキングはモデル間で弱い転送をし、アンチパターンルールは有用なスキルの中でサンプル重いコンテンツより優れています。
論文 参考訳(メタデータ) (2026-08-24T10:13:07Z) - When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning [72.09826781730662]
ロングホライゾン推論は、モデルが推論チェーン内の異なるスキルを切り替えることを要求する。
スキル・エントロピー(Skill Entropy)とは、あるスキルから別のスキルに切り替えることの難しさを測る尺度である。
本稿では,RLフレームワークであるSkill-Entropy RLを提案する。
論文 参考訳(メタデータ) (2026-08-05T17:57:16Z) - Not All Skills Help: Measuring and Repairing Agent Knowledge [47.498075849595374]
ASSAYは、生成をキュレーションから分離するフレームワークである。
スキルごとの因果属性を小さな開発セットで計算する。
ライブラリをオフラインで再構築し、各テストタスクに対して負の効果でスキルを抑圧する。
論文 参考訳(メタデータ) (2026-06-13T16:37:38Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning [34.60596020541521]
我々はBadSkillを紹介します。BadSkillは、モデル・イン・スキル脅威サーフェスをターゲットとするバックドア攻撃の定式化です。
BadSkillでは、敵が隠れペイロードをアクティベートするために、組み込まれたモデルがバックドアで調整された、一見良心的なスキルを公開している。
ベンチマークは8つのトリガータスクと5つの非トリガー制御スキルを含む13のスキルにまたがっており、主な評価セットは571の負のクラスクエリと396のトリガー整列クエリである。
BadSkillは8つのトリガースキルの平均攻撃成功率(ASR)を99.5%まで達成し、負のクラスのクエリに対して強い良識的な精度を維持している。
論文 参考訳(メタデータ) (2026-04-10T14:48:29Z) - EvoSkill: Automated Skill Discovery for Multi-Agent Systems [6.319876096746374]
エージェントスキルを自動的に発見・洗練する自己進化型フレームワークである textbfEvoSkill を紹介する。
EvoSkillは実行障害を分析し、新しいスキルや既存のスキルへの編集を提案し、それらを構造化された再利用可能なスキルフォルダに実体化する。
われわれはEvoSkillを米国財務データの根拠となる推論ベンチマークであるOfficeQAと、ノイズの多い検索ベンチマークであるSealQAの2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-03T09:07:22Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z) - Beyond Accuracy: Behavioral Dynamics of Agentic Multi-Hunk Repair [6.60715519922201]
マルチハンクバグの修復には、複数の非結合コード領域にまたがるコーディネート編集が必要である。
我々は、Hunk4Jデータセットから372個のマルチハンクバグ(Claude Code, Codex, Gemini-cli, Qwen Code)を評価する。
論文 参考訳(メタデータ) (2025-11-14T07:00:47Z) - Exploring Expert Failures Improves LLM Agent Tuning [74.0772570556016]
本稿では,失敗した専門家の軌道から有益な行動を識別する専門的失敗の探索(EEF)を提案する。
EEFは、未解決のいくつかのサブタスクをうまく解決し、エージェントチューニング性能を改善する。
論文 参考訳(メタデータ) (2025-04-17T17:53:54Z) - Exposing Limitations of Language Model Agents in Sequential-Task Compositions on the Web [69.6913064185993]
言語モデルエージェント(LMA)は、ミューティステップ決定タスクにおける有望なパラダイムとして登場した。
約束にもかかわらず、現実世界のアプリケーションでの彼らのパフォーマンスはまだ過小評価されている。
既存のLMAはベースタスクで平均94.0%の成功率を達成したが、その性能は構成タスクで平均24.9%に低下した。
論文 参考訳(メタデータ) (2023-11-30T17:50:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。