論文の概要: SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation
- arxiv url: http://arxiv.org/abs/2608.05628v1
- Date: Thu, 06 Aug 2026 05:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.825959
- Title: SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation
- Title(参考訳): SkillHEX:仮説駆動型自律探査と爆発によるエージェントスキルの向上
- Abstract要約: 本稿では,仮説駆動型自己検証とエビデンス誘導木探索を併用したクローズドループフレームワークであるSkillHEXを紹介する。
SkillHEXは、フェール可能な失敗仮説を実行可能なテストに変換する。
- 参考スコア(独自算出の注目度): 13.350311645241225
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although agent skills equip LLMs with reusable procedural knowledge, manual maintenance suffers from high costs, unscalability, and misalignment. Real-world deployments thus require autonomous, on-demand skill evolution at test time, constrained by limited interaction budgets and a lack of training or validation sets. This setting introduces a severe sparse reward challenge, where outcomes conflate multiple latent failure causes. Under such ambiguity, existing methods that greedily refine a single incumbent skill are particularly vulnerable to an exploitation trap, allowing early misdiagnoses to exhaust limited trials along unproductive trajectories. To address this, we introduce SkillHEX, a closed-loop framework coupling hypothesis-driven self-verification with evidence-guided tree search. SkillHEX translates falsifiable failure hypotheses into executable tests, producing diagnostic evidence as dense reward without additional environment attempts. This evidence guides a search over persistent skill-revision branches, dynamically balancing the exploitation of supported edits with the exploration of plausible alternatives. Evaluated on 87 tasks from SkillsBench, SkillHEX outperforms existing self-evolving methods and achieves an average pass rate of 55.9% and 57.9% using GPT-5.3-Codex and Claude Opus 4.7 under a five-iteration budget, respectively.
- Abstract(参考訳): エージェントスキルは、再利用可能な手続き的知識を備えたLLMを装備するが、手動メンテナンスは、高コスト、非スケール性、誤調整に悩まされる。
現実のデプロイメントには、制限されたインタラクション予算とトレーニングや検証セットの欠如によって制約された、テスト時に自律的でオンデマンドなスキルの進化が必要です。
この設定では、結果が複数の遅延障害の原因を分割する、厳しいスパース報酬の課題が導入されます。
このような曖昧さの下では、単一の既存のスキルを巧みに洗練する既存の手法は、特に搾取トラップに弱いため、初期の誤診は非生産的な軌道に沿って限られた試験を排出することができる。
そこで本研究では,仮説駆動型自己検証とエビデンス誘導木探索を組み合わせたクローズドループフレームワークであるSkillHEXを紹介する。
SkillHEXは、フェール可能な失敗仮説を実行可能なテストに変換する。
このエビデンスでは、永続的なスキルリビジョンのブランチの探索をガイドし、サポート対象の編集と妥当な代替品の探索を動的にバランスさせる。
SkillsBenchの87のタスクで評価され、SkillHEXは既存の自己進化手法より優れており、それぞれGPT-5.3-CodexとClaude Opus 4.7を使用して55.9%と57.9%の平均パスレートを達成している。
関連論文リスト
- Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting [20.811638832981178]
大規模言語モデル(LLM)エージェントは、過去のインタラクションからの経験を蓄積し再利用する必要がある。
データ駆動のスキル最適化は、実際の環境から収集された限られた軌道に過度に適合する傾向がある。
リスクを緩和する3段階フレームワークであるSkillBoostを提案する。
論文 参考訳(メタデータ) (2026-07-29T09:05:40Z) - Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills [53.15216425100295]
本稿では,提案者,解決者,スキルコントローラからなる共進化型フレームワークであるスキルセルフプレイ(スキルSP)を紹介する。
プロジェクタは動的にサンプリングされたスキルを前提とした挑戦的なタスクを生成し、ソルバは能力境界を押し上げるための候補ソリューションを探索し、スキルコントローラは実行フィードバックを収集してスキルライブラリを更新および拡張する。
このインタラクティブな共進化は、構造化された検証とオープンな調査の間のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2026-07-24T17:59:22Z) - SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment [10.850946672552277]
スキル中心アセスメントのためのエンドツーエンドフレームワークであるSkillAuditを紹介します。
実用性、効率/コスト、安全性にまたがる包括的多次元評価レポートを生成する。
トップランクの現実世界のスキルパッケージをスキャンした結果、スキルの7%以上が危険な状態にあることがわかった。
論文 参考訳(メタデータ) (2026-06-21T17:40:05Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems [36.96247516261787]
SkillSmithは、シナジー対応のスキルツールの共同進化フレームワークである。
スキル進化が再利用可能な機能ギャップを特定すると、ツールをラップ、編集、構成、分割、または廃止することが可能になります。
失敗の署名、因果帰属、治療を含むアンチパターンを記録し、既知の誤りを繰り返す診断と拒否提案を加速させる。
論文 参考訳(メタデータ) (2026-05-31T16:01:19Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification [85.3692584167951]
Anthropicは、LLMエージェントが多段階のプロフェッショナルタスクに取り組むためのスキルの概念を提案する。
ツールは単一の自己完結型関数であり、スキルは相互依存型多ファイルアーティファクトの構造化バンドルである。
EvoSkillsは、エージェントが複雑なマルチファイルスキルパッケージを自律的に構築できる自己進化型スキルフレームワークである。
論文 参考訳(メタデータ) (2026-04-02T06:43:20Z) - EvoSkill: Automated Skill Discovery for Multi-Agent Systems [6.319876096746374]
エージェントスキルを自動的に発見・洗練する自己進化型フレームワークである textbfEvoSkill を紹介する。
EvoSkillは実行障害を分析し、新しいスキルや既存のスキルへの編集を提案し、それらを構造化された再利用可能なスキルフォルダに実体化する。
われわれはEvoSkillを米国財務データの根拠となる推論ベンチマークであるOfficeQAと、ノイズの多い検索ベンチマークであるSealQAの2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-03T09:07:22Z) - HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction [4.0252071077178]
マルチパスチェーンによるテスト時間計算のスケーリングは推論精度を向上する。
既存のアプローチは、このトレードオフを厳格な方法で解決している。
動的拡張還元制御問題としてテスト時間スケーリングを再構成する。
論文 参考訳(メタデータ) (2026-02-06T09:27:54Z) - Exploring Expert Failures Improves LLM Agent Tuning [74.0772570556016]
本稿では,失敗した専門家の軌道から有益な行動を識別する専門的失敗の探索(EEF)を提案する。
EEFは、未解決のいくつかのサブタスクをうまく解決し、エージェントチューニング性能を改善する。
論文 参考訳(メタデータ) (2025-04-17T17:53:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。