論文の概要: Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce
- arxiv url: http://arxiv.org/abs/2608.28638v1
- Date: Mon, 10 Aug 2026 16:33:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-06 19:38:41.458632
- Title: Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce
- Title(参考訳): サロゲート型溶液・再生法による自己進化技術
- Abstract要約: 本報告では, 自己完結型納品品からの対話型問題解決を, 新鮮容器で独立して実施する。
固定ハーネス内では、安価なモデルは平均3点あたり74.9%のスキル、60.1%の人為的なベースラインよりも+14.8ドルのスキルを自給自足する。
- 参考スコア(独自算出の注目度): 8.058399657517054
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent skills are portable packages of instructions and resources an agent consults at deployment. Self-evolving them fails in two ways today. First, skills evolved from scratch underperform human-curated ones and, on a weak model, using no skill at all. Second, an evolution-time pass records one lucky trajectory that a fresh stochastic agent often fails to reproduce at deployment. We present reSolve, a per-task, oracle-in-the-loop framework built on three components. It decouples interactive solving from a self-contained deliverable that is independently re-executed in a fresh container, a protocol we call solve-and-reproduce. It enhances the sparse reward signal with a surrogate verifier that cannot access hidden tests or reference answers. It then runs verifier-guided beam search over a solution-construction graph. Within a fixed harness, a cheap model self-evolves skills that reach $74.9\%$ mean-of-3, $+14.8$ points over the $60.1\%$ human-curated baseline, exceeding the strongest official curated-skill result ($67.3\%$, GPT-5.5/OpenHands). We also report observed failure cases and domain-level results, including performance on the 14 Natural Science tasks, to clarify when the approach does and does not help.
- Abstract(参考訳): エージェントスキルは、エージェントがデプロイ時にコンサルタントする命令とリソースのポータブルパッケージである。
今日、自己進化は2つの方法で失敗します。
第一に、スキルはスクラッチから進化し、人間のキュレートされたスキルを過小評価し、弱いモデルでは、全くスキルを使用しなかった。
第二に、進化時間のパスは、新しい確率的エージェントが配置時にしばしば再生できない幸運な軌跡を1つ記録する。
提案するreSolveは,3つのコンポーネント上に構築された,タスクごとのオーラクル・イン・ザ・ループフレームワークである。
自己完結した成果物からインタラクティブな問題解決を分離し、独立して新しいコンテナで再実行します。
隠されたテストや参照回答にアクセスできない代理検証器でスパース報酬信号を強化する。
次に、検証器誘導ビームサーチを解構成グラフ上で実行する。
固定ハーネス内では、安価なモデルが74.9 %$平均3ドル、$+14.8 ドル、人為的なベースラインを上回り、最強のキュレートスキル(67.3 %$、GPT-5.5/OpenHands)を超えるスキルを自己進化させる。
また、14の自然科学タスクのパフォーマンスを含む、障害事例やドメインレベルの結果も報告し、アプローチがいつ役に立たないかを明らかにした。
関連論文リスト
- HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification [30.941867057615223]
既存の提案と検証のメソッドは、固定されたタスクセットですべての候補をスコアします。
私たちは、自動化ハーネス進化のための予算対応フレームワークであるHarnessLensを紹介します。
論文 参考訳(メタデータ) (2026-08-27T16:12:23Z) - Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators [19.87699788583019]
私たちは、再生、デバッグではなく、パラダイムシフトを主張します。
本稿では,自律的修復における3つの課題に対処する,ドメイン固有のデバッグエージェントを提案する。
Pass@16.7%は66.7%、Regenerate Avg Pass@1's 25.9%、Regenerate Pass@3's 40.7%、Regenerate Pass@3's 40.7%である。
論文 参考訳(メタデータ) (2026-08-03T17:59:48Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents [0.12891210250935145]
LLMエージェントに手続き的スキルを加えることは、通常、タスク成功の平均的な改善によって評価される。
この指標は重要なコストを隠蔽します。
約6,000回のランでエージェントとスキルと非スキルを比較して、双方を計測する。
論文 参考訳(メタデータ) (2026-07-24T17:50:03Z) - Self-Evolving Agents with Anytime-Valid Certificates [1.2691047660244335]
我々は,小型のステアリングアダプタとEmphfrozenベースモデルを中心としたバージョン付きハーネスに自己修正を限定するアーキテクチャである textbfSEA を提案する。
5つのループコントローラが発行された保証を構成しており、そのようなゲートは凍結されたベースが既に生成している動作の中でのみ選択できるため、5つの検証器・イン・ザ・ループ機構はゲートが必要とする高密度でグレーダフリーな信号を供給する。
結果は高価な評価で単回実行され、実行時から実行時までの分散を確認し、タスク毎のアルゴリズムの混合を適用することが今後の作業である。
論文 参考訳(メタデータ) (2026-07-01T12:34:52Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models [56.055015597319674]
検証可能な報酬(RLVR)を用いた強化学習は,大規模言語モデル(LLM)の推論能力の向上に有効である
近年の自己回帰法は LLM の推論能力を解き放つためのラベルフリーな代替手段について検討している。
我々は、他の視点から補完的な監督を求めることにより、トレーニングの安定性を向上させる新しい自己監督型RLフレームワークであるtextitCo-rewardingを提案する。
論文 参考訳(メタデータ) (2025-08-01T08:09:14Z) - On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents [58.79302663733703]
大規模言語モデルに基づくマルチエージェントシステムは、専門家エージェントの協力により、様々なタスクにまたがる優れた能力を示している。
不器用なエージェントや悪意のあるエージェントが与える影響 - システム全体のパフォーマンスにおいて、頻繁にタスクでエラーを犯すものは、いまだに過小評価されていない。
本稿では,下流タスクにおける障害要因下での各種システム構造のレジリエンスについて検討する。
論文 参考訳(メタデータ) (2024-08-02T03:25:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。